Settimana del Super ScontoClaude Skills — 20% DI SCONTO
News

DeepSeek V4.1-Flash: Novità, Prezzi e Alternative (2026)

Powerdrill Bloom·
DeepSeek V4.1-Flash: Novità, Prezzi e Alternative (2026)

DeepSeek ha rilasciato V4.1-Flash il 10 settembre 2026. Si tratta di un modello Mixture-of-Experts da 552 miliardi di parametri che legge immagini e testo in modo nativo, gestisce un contesto fino a un milione di token e viene distribuito con licenza MIT. La novità principale riguarda il costo: il modello attiva 8 miliardi di parametri in input e 16 miliardi in output.

Quest'ultima frase riassume l'intera storia in forma compressa. Questa guida la analizza nel dettaglio e riporta i prezzi pubblicati delle API. Spiega inoltre cosa cambia e cosa rimane invariato con questo rilascio se il vostro lavoro finale consiste in un report, una presentazione o una tabella.

Tutti i dati riportati di seguito provengono dalle note di rilascio ufficiali di DeepSeek, dalla sua scheda modello su Hugging Face e dalla pagina dei prezzi pubblicata, verificati il 14 settembre 2026.

Cosa c'è di nuovo in DeepSeek V4.1-Flash

Le note di rilascio di DeepSeek si aprono con quattro affermazioni. Il modello è "più intelligente, più veloce, più efficiente". È "il modello più piccolo della nostra nuova famiglia di architetture, con comprensione visiva nativa". È progettato per "maggiore capacità, inferenza più rapida, throughput più elevato". E in futuro si estenderà a modelli più grandi.

La scheda del modello è più specifica. DeepSeek-V4.1-Flash viene descritto come "un modello Mixture-of-Experts (MoE) multimodale con 552 miliardi di parametri di backbone e supporto per contesti fino a un milione di token". Inoltre, "elabora nativamente immagini e testo e genera testo in modo autoregressivo".

Tre cambiamenti sono davvero rilevanti per il lavoro quotidiano, al di là dei benchmark.

La visione è integrata, non aggiunta a posteriori. Un codificatore visivo e un proiettore a due strati trasformano le immagini in embedding. Questi vengono "elaborati congiuntamente con gli embedding di testo fin dall'inizio del pre-addestramento del modello linguistico". La scheda del modello indica che DeepSeek-ViT, il codificatore, è stato addestrato da zero.

Il contesto raggiunge un milione di token. Il pre-addestramento ha utilizzato 45 mila miliardi di token, con un'attenzione sparsa addestrata a 64K e il contesto esteso a 1 milione successivamente durante il processo.

L'intensità del ragionamento è regolabile. Il modello "supporta un'impostazione dell'intensità del ragionamento controllabile in modo continuo (valore intero da 1 a 100) che bilancia il costo di inferenza con la precisione". Spenderete di più solo per le domande che lo richiedono davvero.

DeepSeek ha inoltre ritirato la generazione precedente. Le note di rilascio indicano che "V4-Flash & V4-Flash-Vision-Exp sono stati ritirati" e che i vecchi nomi dei modelli reindirizzano temporaneamente a V4.1-Flash per motivi di compatibilità.

Il cambiamento architetturale dietro il calo dei costi

La parte interessante del rilascio di DeepSeek V4.1-Flash non è la tabella dei benchmark, bensì l'aritmetica della memoria.

DeepSeek-V4.1-Flash utilizza quella che la scheda del modello definisce un'architettura Causal Encoder-Decoder (CED). Si tratta di un Transformer a 40 strati suddiviso in un codificatore causale a 20 strati e un decodificatore a 20 strati. La KV cache globale del decodificatore viene proiettata dagli stati nascosti finali del codificatore anziché essere costruita strato per strato.

Il risultato pratico è il numero citato ovunque: 8 miliardi di parametri attivi per token durante il prefill, 16 miliardi durante la decodifica. La scheda del modello descrive questo aspetto come un "sostanziale miglioramento dell'efficienza dei costi per i carichi di lavoro agentici ad alta intensità di input".

"Ad alta intensità di input" è l'espressione chiave da notare. I documenti lunghi sono ad alta intensità di input. Lo è anche una chat in cui si allegano quaranta pagine e poi si pongono sei domande al riguardo.

Altre due tecniche riducono le dimensioni della cache stessa. La Compressed Sparse Attention 2 assegna a ciascuno strato di attenzione una di tre modalità e condivide gli indici tra gli strati. Il caching KV principale in FP4 memorizza la cache in un formato a quattro bit. Insieme, la scheda del modello stima la KV cache globale a 890 byte per token, circa un quarto rispetto alla generazione precedente.

Le note di rilascio traducono questo dato nella metrica che l'acquirente percepisce concretamente. Rispetto alla generazione precedente, la cache richiede "1/4 della HBM" e "1/8 dello spazio di archiviazione SSD". Aggiunge inoltre che "i costi legati ai cache-hit spesso rappresentano una quota significativa dei costi degli agenti".

Prezzi di DeepSeek V4.1-Flash

DeepSeek pubblica i prezzi per milione di token, suddividendoli tra ore di punta (peak) e ore non di punta (off-peak). I valori riportati di seguito provengono dalla pagina ufficiale Models & Pricing del 14 settembre 2026, espressi in dollari statunitensi.

Metrica Ore non di punta Ore di punta
1 milione di token di input (cache hit) $0.003 $0.006
1 milione di token di input (cache miss) $0.15 $0.3
1 milione di token di output $0.6 $1.2

La pagina indica che "le tariffe fuori picco sono la metà di quelle di picco" e definisce le ore di punta come le fasce orarie 01:00–04:00 e 06:00–10:00 UTC, dal lunedì al venerdì. Tutto il resto è considerato fuori picco.

Accanto alla tabella sono riportati due dettagli operativi. Il nome del modello da utilizzare è deepseek-flash. La lunghezza del contesto è di 1 milione di token con un output massimo di 384K, e il limite di concorrenza indicato è di 2.500.

La stessa pagina segnala che V4-Pro rimane disponibile. DeepSeek scrive di aver "deciso di continuare a fornire servizi API per DeepSeek V4 Pro dopo il 14 settembre 2026". Viene specificato che il metodo di fatturazione rimane invariato.

Cosa coprono i benchmark e cosa no

Le tabelle dei modelli instruct nella scheda del modello si concentrano principalmente sul codice e sul lavoro degli agenti. Terminal-Bench, DeepSWE, NL2Repo-Bench e Codeforces occupano la maggior parte delle righe. Ciò riflette l'obiettivo principale di DeepSeek.

Quattro righe sono particolarmente rilevanti se il vostro output finale è un documento.

Benchmark DeepSeek-V4.1-Flash-Base
DocVQA (LLM-Judge) 95.6
CVBench (EM) 77.9
RefCOCO-avg (Acc@0.5) 86.0
MMMU-Pro (EM) 56.5

DocVQA misura la capacità di rispondere a domande su immagini di documenti. Si tratta del parametro di riferimento pubblicato più vicino alla lettura di una fattura scansionata, di un contratto di locazione o di un report in formato PDF. Il modello base ottiene qui un punteggio di 95.6.

Sul fronte dei modelli instruct, Chartography con strumenti si attesta a 78.9 e BabyVision con strumenti a 89.6. Entrambi sono benchmark per agenti visivi eseguiti tramite un framework esterno.

Considerate questi dati come indicativi. La scheda del modello specifica che tutte le valutazioni agentiche utilizzano temperature=1.0, top_p=0.95, e che i benchmark per agenti visivi utilizzano una finestra di contesto di 512k token. La vostra configurazione potrebbe differire.

Cosa cambia per il flusso di lavoro da documento a prodotto finale

Un token di input più economico cambia radicalmente la scelta di quali flussi di lavoro valga la pena automatizzare.

Consideriamo un mese di fatture dei fornitori in formato PDF. Con la vecchia logica, avreste eseguito l'estrazione una sola volta, salvato un riepilogo e lavorato a partire da quello. L'estrazione era la fase costosa, quindi veniva eseguita il meno possibile.

L'input ha un prezzo di $0.15 per milione di token in caso di cache miss. Un cache hit costa una frazione di centesimo. Con queste tariffe, rileggere la fonte non rappresenta più la voce di costo principale. Potete porre una seconda domanda direttamente sulle pagine originali anziché basarvi sui vostri appunti.

Questo è fondamentale per la precisione, non solo per il budget. Un riepilogo perde il numero di pagina. L'originale no.

Il contesto da 1 milione di token ha un effetto simile. Gli ordini di lavoro di un trimestre, un intero fascicolo di locazione o un anno di registri dei turni possono risiedere in un'unica finestra. Non dovrete più scegliere quali dieci documenti includere.

La visione nativa colma l'ultimo divario. Un grafico incollato in una diapositiva, la foto della lettura di un contatore e una bolla di consegna scansionata diventano tutti input leggibili anziché elementi da digitare nuovamente da zero.

Dove un modello più economico smette di essere d'aiuto

DeepSeek V4.1-Flash rappresenta un livello. Il prodotto finale ne rappresenta un altro.

Le pagine di DeepSeek descrivono un'API e un prodotto di chat. Definiscono prezzi, limiti di contesto, benchmark e il nome di un modello. Ciò che non descrivono è uno spazio di lavoro che mantenga uniti i file, le analisi precedenti e i formati di output tra una sessione e l'altra.

Questa è la normale divisione del lavoro, non una lacuna. Un'API è pensata per essere un componente.

La conseguenza pratica è che l'ultimo miglio spetta a voi. Qualcuno deve pur sempre inserire la risposta in una tabella formattata, in una diapositiva o in un documento che un collega possa aprire. Qualcuno deve ancora essere in grado di indicare una cifra e dire da quale pagina provenga.

Powerdrill Bloom si colloca proprio su questo livello. La sua homepage lo descrive come "l'analista di dati AI che mostra il proprio lavoro". Aggiunge che "ogni numero viene restituito con l'indicazione della pagina, della riga e del dato di origine". Caricate i file, ponete la domanda in linguaggio naturale e ottenete il documento finale.

I due livelli si integrano anziché farsi concorrenza. Un modello più economico, con un contesto più ampio e dotato di visione rende la fase di lettura meno costosa. Uno spazio di lavoro decide cosa fare con quanto è stato letto.

Alternative che vale la pena conoscere

Se state valutando V4.1-Flash rispetto ad altre opzioni, i tre confronti più frequenti sono i seguenti.

Contro DeepSeek V4-Pro. Le note di rilascio affermano che "test condotti da più parti posizionano V4.1-Flash davanti a V4-Pro in termini di prestazioni, costi, velocità e tempo di esecuzione totale". Aggiungono che DeepSeek sta "eliminando gradualmente V4-Pro". La pagina dei prezzi elenca ancora V4-Pro a $0.66 per milione di token di input in caso di cache miss fuori picco, contro i $0.15 di Flash. V4-Pro non indica il supporto per la visione su quella pagina.

Contro i modelli proprietari di frontiera. La tabella comparativa della scheda del modello include Opus-5.0 e GPT-5.6 Sol. Flash è in testa in diverse categorie agentiche, tra cui Terminal-Bench 2.1 a 90.6 e AutomationBench a 54.8. Risulta invece inferiore su Terminal-Bench 3.0 e 4.0. Considerate le tabelle fornite dai produttori per quello che sono.

Contro uno spazio di lavoro anziché un modello. Se ciò di cui avete effettivamente bisogno è un report finito a partire da file già in vostro possesso, il confronto non deve essere fatto tra modelli. La nostra panoramica delle alternative a DeepSeek affronta questa prospettiva, mentre la guida esplicativa sugli agenti di dati AI definisce la categoria.

Come accedere a DeepSeek V4.1-Flash

Sulle pagine di DeepSeek sono documentate tre modalità di accesso.

La prima è l'API. Indirizzate il vostro client su https://api.deepseek.com per il formato compatibile con OpenAI, oppure su https://api.deepseek.com/anthropic per il formato Anthropic, e impostate il modello su deepseek-flash. La pagina dei prezzi indica come supportati l'output JSON, le chiamate a strumenti (tool calls), l'API Responses e la visione.

La seconda è il prodotto di chat, disponibile su chat.deepseek.com, a cui la scheda del modello rimanda direttamente.

La terza riguarda i pesi del modello. Il modello è pubblicato su Hugging Face con licenza MIT, accompagnato da un report tecnico. Questa è la strada da seguire se avete la necessità di eseguirlo all'interno della vostra rete aziendale.

Una nota per la terza opzione. La scheda del modello specifica che "questo rilascio non include un template di chat in formato Jinja", pertanto la codifica dei prompt richiede attenzione in caso di self-hosting.

Domande frequenti (FAQ)

Cos'è DeepSeek V4.1-Flash? Si tratta di un modello Mixture-of-Experts multimodale rilasciato da DeepSeek il 10 settembre 2026. La scheda del modello indica 552 miliardi di parametri di backbone, elaborazione nativa di immagini e testo e supporto per contesti fino a un milione di token. È pubblicato con licenza MIT.

Quanto costa DeepSeek V4.1-Flash? La pagina ufficiale dei prezzi indica $0.15 per milione di token di input in caso di cache miss nelle ore fuori picco e $0.3 nelle ore di punta. L'output costa $0.6 fuori picco e $1.2 nelle ore di punta. L'input con cache-hit costa $0.003 fuori picco.

DeepSeek V4.1-Flash supporta le immagini? Sì. La scheda del modello descrive un codificatore visivo addestrato da zero, con embedding visivi elaborati congiuntamente al testo fin dall'inizio del pre-addestramento. La pagina dei prezzi indica la visione come supportata per deepseek-flash.

Cosa è successo a DeepSeek V4-Flash? Le note di rilascio indicano che V4-Flash e V4-Flash-Vision-Exp sono stati ritirati. I nomi dei modelli precedenti sono ancora accettati e reindirizzano a V4.1-Flash, con fatturazione alla tariffa di Flash.

DeepSeek V4.1-Flash è adatto per creare report e diapositive? Il modello gestisce la fase di lettura e il punteggio di 95.6 in DocVQA suggerisce un'ottima comprensione dei documenti. Trasformare questi dati in un prodotto finale formattato rappresenta un livello separato, che è esattamente ciò che offre uno spazio di lavoro AI.

Conclusione

DeepSeek V4.1-Flash è un rilascio incentrato sull'efficienza che si presenta sotto le vesti di un rilascio di funzionalità. Il lavoro sull'architettura si è concentrato sulla KV cache e i vantaggi si concretizzano sugli input lunghi.

Per chiunque riceva dati sotto forma di documenti, questa è la direzione ideale. Rileggere due volte cento pagine è ormai un errore di arrotondamento anziché una decisione difficile.

Il modello restituisce comunque del testo. Se la vostra settimana lavorativa si conclude con una tabella da far approvare, la fase successiva al modello è quella che vi richiede più tempo. Provate Powerdrill Bloom gratuitamente e caricate i documenti che avreste dovuto riassumere a mano.


Fonti (al 14-09-2026): note di rilascio di DeepSeek-V4.1-Flash · scheda del modello DeepSeek-V4.1-Flash · DeepSeek Models & Pricing. I prezzi e la disponibilità possono variare; verificare le pagine ufficiali prima di pianificare il budget.