Super Sale WeekClaude Skills — 20% KORTING
News

DeepSeek V4.1-Flash: Wat is er nieuw, prijzen en alternatieven (2026)

Powerdrill Bloom·
DeepSeek V4.1-Flash: Wat is er nieuw, prijzen en alternatieven (2026)

DeepSeek heeft op 10 september 2026 V4.1-Flash uitgebracht. Het is een Mixture-of-Experts-model met 552 miljard parameters dat afbeeldingen en tekst native leest, context tot één miljoen tokens verwerkt en wordt geleverd onder een MIT-licentie. De belangrijkste verandering is de prijs: het model activeert 8 miljard parameters bij invoer en 16 miljard bij uitvoer.

Die laatste zin is het hele verhaal in een notendop. Deze gids ontrafelt het en geeft de gepubliceerde API-prijzen weer. Ook wordt uitgelegd wat de release wel en niet verandert als uw werk eindigt in een rapport, een presentatie of een tabel.

Alle onderstaande feiten zijn afkomstig uit de eigen release-opmerkingen van DeepSeek, de Hugging Face-modelkaart en de gepubliceerde prijzenpagina, gecontroleerd op 14 september 2026.

Wat is er nieuw in DeepSeek V4.1-Flash

De release-opmerkingen van DeepSeek openen met vier claims. Het model is "slimmer, sneller, efficiënter." Het is "het kleinste model in onze nieuwe architectuurfamilie, met native visueel begrip." Het is ontworpen voor "grotere capaciteit, snellere inferentie, hogere doorvoer." En het schaalt later op naar grotere modellen.

De modelkaart is specifieker. DeepSeek-V4.1-Flash wordt beschreven als "een multimodaal Mixture-of-Experts (MoE)-model met 552 miljard backbone-parameters en ondersteuning voor contexten tot één miljoen tokens." Het "verwerkt afbeeldingen en tekst native en genereert tekst autoregressief."

Drie veranderingen zijn belangrijk voor het dagelijkse werk, in plaats van alleen voor benchmarks.

Visie is ingebouwd, niet achteraf toegevoegd. Een vision-encoder en een tweelaagse projector zetten afbeeldingen om in embeddings. Deze worden "vanaf het begin van de pre-training van het taalmodel gezamenlijk verwerkt met tekst-embeddings." De modelkaart vermeldt dat DeepSeek-ViT, de encoder, vanaf nul is getraind.

Context bereikt één miljoen tokens. De pre-training maakte gebruik van 45 biljoen tokens, met sparse attention getraind op 64K en context die later in de run werd uitgebreid naar 1M.

Denkinspanning is een draaiknop. Het model "ondersteunt een traploos regelbare instelling voor denkinspanning (geheel getal 1–100) die inferentiekosten afweegt tegen nauwkeurigheid." U geeft alleen meer uit aan de vragen die dat echt nodig hebben.

DeepSeek heeft ook de vorige generatie met pensioen gestuurd. De release-opmerkingen vermelden dat "V4-Flash & V4-Flash-Vision-Exp zijn uitgefaseerd" en dat de oude modelnamen om redenen van compatibiliteit tijdelijk doorverwijzen naar V4.1-Flash.

De architectuurwijziging achter de kostendaling

Het interessante deel van de DeepSeek V4.1-Flash-release is niet de benchmarktabel. Het is de geheugenberekening.

DeepSeek-V4.1-Flash maakt gebruik van wat de modelkaart een Causal Encoder-Decoder (CED)-architectuur noemt. Het is een Transformer met 40 lagen, opgesplitst in een causale encoder met 20 lagen en een decoder met 20 lagen. De globale KV-cache van de decoder wordt geprojecteerd vanuit de uiteindelijke verborgen toestanden van de encoder, in plaats van per laag te worden opgebouwd.

Het praktische resultaat is het getal dat overal wordt genoemd: 8 miljard parameters actief per token tijdens prefill, 16 miljard tijdens decode. De modelkaart beschrijft dit als "een aanzienlijke verbetering van de kostenefficiëntie voor invoer-intensieve agent-workloads."

Invoer-intensief is de term waar het om draait. Lange documenten zijn invoer-intensief. Dat geldt ook voor een chat waarin u veertig pagina's bijvoegt en er vervolgens zes vragen over stelt.

Twee andere technieken verkleinen de cache zelf. Compressed Sparse Attention 2 wijst aan elke attention-laag een van de drie modi toe en deelt indices over de lagen heen. FP4 main KV-caching slaat de cache op in een 4-bits indeling. Samen stelt de modelkaart de globale KV-cache op 890 bytes per token, ongeveer een kwart van de vorige generatie.

De release-opmerkingen vertalen dat naar de statistiek die een koper daadwerkelijk voelt. Vergeleken met de vorige generatie heeft de cache "1/4 van de HBM" en "1/8 van de SSD-opslag" nodig. Er wordt aan toegevoegd dat "kosten voor cache-hits vaak een groot deel van de agent-kosten uitmaken."

DeepSeek V4.1-Flash prijzen

DeepSeek publiceert prijzen per miljoen tokens en splitst deze op in piek- en daltijden. De onderstaande waarden zijn afkomstig van de officiële Models & Pricing-pagina op 14 september 2026, in Amerikaanse dollars.

Meter Daluren Piekuren
1M input-tokens (cache-hit) $0.003 $0.006
1M input-tokens (cache-miss) $0.15 $0.3
1M output-tokens $0.6 $1.2

De pagina vermeldt dat "de daltarieven de helft zijn van de piektarieven" en definieert piekuren als 01:00–04:00 en 06:00–10:00 UTC, van maandag tot en met vrijdag. Al het andere valt onder daluren.

Naast de tabel staan twee operationele details. De te gebruiken modelnaam is deepseek-flash. De contextlengte is 1M met een maximale output van 384K, en de vermelde limiet voor gelijktijdige verzoeken is 2.500.

Op dezelfde pagina staat dat V4-Pro beschikbaar blijft. DeepSeek schrijft dat het heeft "besloten om na 14 september 2026 API-diensten te blijven leveren voor DeepSeek V4 Pro." Er wordt vermeld dat de factureringsmethode ongewijzigd blijft.

Wat de benchmarks wel en niet dekken

De instruct-modeltabellen van de modelkaart neigen naar code- en agent-werk. Terminal-Bench, DeepSWE, NL2Repo-Bench en Codeforces nemen de meeste rijen in beslag. Dat weerspiegelt waar DeepSeek zich op richt.

Vier rijen zijn relevanter als uw output een document is.

Benchmark DeepSeek-V4.1-Flash-Base
DocVQA (LLM-Judge) 95.6
CVBench (EM) 77.9
RefCOCO-avg (Acc@0.5) 86.0
MMMU-Pro (EM) 56.5

DocVQA meet het beantwoorden van vragen over documentafbeeldingen. Dat is de dichtstbijzijnde gepubliceerde proxy voor het lezen van een gescande factuur, een huurcontract of een PDF-rapport. Het basismodel scoort daar 95.6.

Aan de instruct-kant komt Chartography met tools uit op 78.9 en BabyVision with tools op 89.6. Beide zijn benchmarks voor visuele agents die via een extern testframework worden uitgevoerd.

Beschouw deze resultaten als indicatief. De modelkaart vermeldt dat alle agent-evaluaties gebruikmaken van temperature=1.0, top_p=0.95, en dat benchmarks voor visuele agents een contextvenster van 512k tokens gebruiken. Uw opzet zal anders zijn.

Wat dit verandert voor werk van document tot eindproduct

Een goedkopere input-token verandert welke workflows überhaupt het automatiseren waard zijn.

Neem bijvoorbeeld een maand aan leveranciersfacturen als PDF's. Volgens de oude berekening zou u deze één keer extraheren, een samenvatting opslaan en vanuit de samenvatting werken. Extractie was de dure stap, dus u deed dat zo min mogelijk.

Input is geprijsd op $0.15 per miljoen tokens bij een cache-miss. Een cache-hit kost een fractie van een cent. Tegen die tarieven is het herlezen van de bron niet langer de kostenpost. U kunt een tweede vraag stellen over de originele pagina's in plaats van over uw eigen aantekeningen.

Dat is belangrijk voor de nauwkeurigheid, niet alleen voor het budget. Een samenvatting verliest het paginanummer. Het origineel niet.

De context van 1M heeft een vergelijkbaar effect. Werkbonnen van een kwartaal, een volledig huurdossier of een jaar aan ploegenlogboeken kunnen in één venster staan. U hoeft niet langer te kiezen welke tien documenten u opneemt.

Native vision dicht het laatste gat. Een grafiek die in een dia is geplakt, een gefotografeerde meterstand en een gescande pakbon worden allemaal leesbare invoer in plaats van iets dat u moet overtypen.

Waar een goedkoper model niet meer helpt

DeepSeek V4.1-Flash is één laag. Het eindproduct is een andere.

De pagina's van DeepSeek beschrijven een API en een chatproduct. Ze vermelden prijzen, contextlimieten, benchmarks en een modelnaam. Wat ze niet beschrijven, is een werkruimte die uw bestanden, uw eerdere analyses en uw outputformaten tussen sessies door bij elkaar houdt.

Dat is de normale taakverdeling, geen tekortkoming. Een API is bedoeld als een component.

Het praktische gevolg is dat de laatste loodjes voor uw rekening blijven. Iemand moet het antwoord nog steeds in een opgemaakte tabel, een dia of een document krijgen dat een collega kan openen. Iemand moet nog steeds naar een getal kunnen wijzen en kunnen zeggen van welke pagina het afkomstig is.

Powerdrill Bloom bevindt zich op die laag. De homepage beschrijft het als "de AI-data-analist die zijn werk laat zien." Er wordt aan toegevoegd dat "elk getal wordt geleverd met de pagina, de rij en de figuur erachter." U uploadt de bestanden, stelt uw vraag in natuurlijke taal en ontvangt het resultaat.

De twee lagen vullen elkaar aan in plaats van dat ze concurreren. Een goedkoper model met een grotere context en vision-mogelijkheden maakt de leesstap goedkoper. Een werkruimte bepaalt wat er met de gelezen informatie gebeurt.

Alternatieven die het waard zijn om te kennen

Als u V4.1-Flash vergelijkt met andere opties, komen drie vergelijkingen het vaakst naar voren.

Tegenover DeepSeek V4-Pro. De release-opmerkingen vermelden dat "tests door meerdere partijen V4.1-Flash vooropstellen ten opzichte van V4-Pro op het gebied van prestaties, kosten, snelheid en totale looptijd." Er wordt aan toegevoegd dat DeepSeek "V4-Pro aan het uitfaseren is." De prijzenpagina vermeldt V4-Pro nog steeds op $0.66 per miljoen input-tokens bij een cache-miss tijdens daluren, tegenover $0.15 voor Flash. V4-Pro vermeldt op die pagina geen vision-ondersteuning.

Tegenover gesloten frontier-modellen. De vergelijkingstabel van de modelkaart bevat Opus-5.0 and GPT-5.6 Sol. Flash loopt voorop op verschillende agent-rijen, waaronder Terminal-Bench 2.1 op 90.6 en AutomationBench op 54.8. Het loopt achter op Terminal-Bench 3.0 en 4.0. Beschouw door leveranciers opgestelde tabellen als zodanig.

Tegenover een werkruimte in plaats van een model. Als wat u werkelijk nodig hebt een kant-en-klaar rapport is op basis van bestanden die u al hebt, is de vergelijking niet model-tot-model. Ons overzicht van DeepSeek-alternatieven behandelt dit perspectief, en de uitleg over AI-data-agents definieert de categorie.

Hoe u toegang krijgt tot DeepSeek V4.1-Flash

Op de eigen pagina's van DeepSeek worden drie routes beschreven.

De API is de eerste. Richt uw client op https://api.deepseek.com voor de met OpenAI compatibele indeling, of op https://api.deepseek.com/anthropic voor de Anthropic-indeling, en stel het model in op deepseek-flash. De prijzenpagina vermeldt JSON-output, tool calls, de Responses API en vision als ondersteund.

Het chatproduct is de tweede, op chat.deepseek.com, waarnaar de modelkaart rechtstreeks linkt.

De gewichten zijn de derde. Het model is gepubliceerd op Hugging Face onder een MIT-licentie, met daarnaast een technisch rapport. Dat is de route als u het binnen uw eigen netwerk nodig hebt.

Een opmerking voor de derde route. De modelkaart vermeldt dat "deze release geen chat-sjabloon in Jinja-indeling bevat", dus prompt-codering vereist aandacht als u zelf host.

FAQs

Wat is DeepSeek V4.1-Flash? Het is een multimodaal Mixture-of-Experts-model dat op 10 september 2026 door DeepSeek is uitgebracht. De modelkaart vermeldt 552 miljard backbone-parameters, native beeld- en tekstverwerking en ondersteuning voor contexten tot één miljoen tokens. Het is gepubliceerd onder een MIT-licentie.

Hoeveel kost DeepSeek V4.1-Flash? De officiële prijzenpagina vermeldt $0.15 per miljoen input-tokens bij een cache-miss tegen daltarieven, en $0.3 tijdens piekuren. Output is $0.6 tijdens daluren en $1.2 tijdens piekuren. Input bij een cache-hit is $0.003 tijdens daluren.

Ondersteunt DeepSeek V4.1-Flash afbeeldingen? Ja. De modelkaart beschrijft een vanaf nul getraine vision-encoder, waarbij visuele embeddings vanaf het begin van de pre-training gezamenlijk met tekst worden verwerkt. De prijzenpagina markeert vision als ondersteund voor deepseek-flash.

Wat is er gebeurd met DeepSeek V4-Flash? De release-opmerkingen vermelden dat V4-Flash en V4-Flash-Vision-Exp zijn uitgefaseerd. De oude modelnamen worden nog steeds geaccepteerd en verwijzen door naar V4.1-Flash, gefactureerd tegen het Flash-tarief.

Is DeepSeek V4.1-Flash geschikt voor het maken van rapporten en dia's? Het model verzorgt de leesstap, en DocVQA op 95.6 duidt op een sterk documentbegrip. Het omzetten daarvan in een opgemaakt eindproduct is een aparte laag, en dat is wat een AI-werkruimte biedt.

Conclusion

DeepSeek V4.1-Flash is een efficiëntie-release in de kleren van een capaciteits-release. Het architectuurwerk is gaan zitten in de KV-cache, en de winst is merkbaar bij lange invoer.

Voor iedereen wiens gegevens als documenten binnenkomen, is dat de juiste richting. Het twee keer lezen van honderd pagina's is nu een afrondingsfout in plaats van een beslissing.

Het model levert u nog steeds tekst. Als uw week eindigt met een tabel die door iemand moet worden goedgekeurd, is de stap na het model degene die u tijd kost. Probeer Powerdrill Bloom gratis en upload de documenten die u handmatig wilde samenvatten.


Bronnen (per 14-09-2026): DeepSeek-V4.1-Flash release-opmerkingen · DeepSeek-V4.1-Flash modelkaart · DeepSeek Models & Pricing. Prijzen en beschikbaarheid veranderen; controleer de officiële pagina's voordat u budgetteert.