Gepubliceerd op 10 september 2026
DeepSeek bracht DeepSeek-V4.1-Flash uit op 10 september 2026 en verlaagde de API-prijs naar $0,15 per miljoen inputtokens buiten piekuren, met output op $0,60. Het model heeft een basis van 552 miljard parameters, maar zet er per token dat het leest maar 8 miljard van aan. De gewichten staan op Hugging Face onder de MIT-licentie en het contextvenster is een miljoen tokens groot.
Wat is DeepSeek-V4.1-Flash en waarom is het zo goedkoop?
DeepSeek-V4.1-Flash is een mixture-of-experts model, wat betekent dat het per woord maar een deel van zichzelf aanzet. Het leest zowel afbeeldingen als tekst en schrijft tekst terug. DeepSeek trainde het vanaf nul op 45 biljoen tokens aan gemengde tekst en beeld.
Het prijsverhaal draait om de KV-cache, het werkgeheugen dat een model bijhoudt voor elk token in je prompt. Dat geheugen maakt lange agent-runs duur, want het groeit mee met het gesprek en moet in het GPU-geheugen blijven staan. DeepSeek zegt dat V4.1-Flash 890 bytes per token gebruikt, ongeveer een kwart van wat DeepSeek-V4-Flash nodig had en volgens de eigen grafiek zo’n 437 keer minder dan DeepSeek-V1.
Twee ontwerpkeuzes doen dat werk. Een causale encoder-decoder-opzet splitst de 40 lagen in een encoder van 20 lagen en een decoder van 20 lagen, zodat de decoder zijn cache eenmalig opbouwt uit de encoder in plaats van per laag. Daarom zet het model 8 miljard parameters aan tijdens het lezen van een prompt en 16 miljard tijdens het schrijven. Daarbovenop slaat DeepSeek de cache op in FP4, een getalformaat van vier bits, en deelt het attention-indices tussen lagen. Je krijgt ook een schuifknop voor denkkracht van 1 tot 100, zodat je nauwkeurigheid tegen kosten per verzoek kunt afwegen zonder van model te wisselen.
DeepSeek-V4.1-Flash benchmarks tegenover Claude Opus-5.0
DeepSeek publiceerde een volledige vergelijkingstabel. Lees hem als twee verhalen: op de code- en agenttests die het hele jaar geciteerd worden, komt V4.1-Flash op het niveau van een frontier-model. Op de nieuwste en zwaarste tests niet.
| Wat er gemeten wordt | DeepSeek-V4.1-Flash | Claude Opus-5.0 |
|---|---|---|
| DeepSWE v1.1 (echte bugs in echte repositories oplossen) | 74,2 | 74,0 |
| Terminal-Bench 2.1 (werk afmaken in een terminal) | 90,6 | 89,1 |
| Terminal-Bench 4.0 (de zwaardere terminalset) | 31,2 | 51,8 |
| Agent’s Last Exam (lange agenttaken in meerdere stappen) | 31,8 | 28,6 |
| GPQA Diamond (wetenschapsvragen op promovendusniveau) | 90,9 | 93,4 |
| Humanity’s Last Exam (de zwaarste expertvragen) | 36,8 | 56,3 |
Dit zijn de eigen cijfers van DeepSeek. De codetests draaide het via de eigen DeepSeek Harness in Minimal-modus met een context van een miljoen tokens en de denkknop op 100, en het noemt bij elke rij welke harness gebruikt is. Wat de modelkaart niet zegt, is waar de cijfers van Opus-5.0 en GPT-5.6 Sol vandaan komen, dus behandel die kolommen als verzameld en niet als opnieuw gemeten.
Een ding publiceerde DeepSeek wel dat de meeste labs weglaten: hoeveel de harness het antwoord verandert. Hetzelfde model scoort 74,2 op DeepSWE v1.1 onder mini-SWE, 72,6 onder de eigen harness, 69,8 onder Claude Code en 65,6 onder Codex. Het kopcijfer is de beste van acht scaffolds, en het verschil is bijna negen punten. Draai je jouw agents op Codex, reken dan op de onderkant van die reeks.
Wat DeepSeek niet vertelt over DeepSeek-V4.1-Flash
In de vergelijkingstabel ontbreekt een kolom voor GPT-6 Astra, het model dat OpenAI een week eerder uitbracht en op 9 september opnieuw aankondigde voor zakelijk gebruik. OpenAI meldt 57,9 op Terminal-Bench 4.0 voor Astra. DeepSeek meldt 31,2 voor V4.1-Flash op dezelfde test en vergelijkt zichzelf in plaats daarvan met GPT-5.6 Sol. Dat is de ontbrekende rij, en het is precies de rij die telt als je vandaag een code-agent kiest.
Twee praktische hiaten zijn goed om te weten voordat je iets downloadt. De release bevat geen chat-template in het gebruikelijke Jinja-formaat, dus je draait het Python-referentiescript van DeepSeek of je neemt de nieuwe Rust-toolkit over om prompts correct op te bouwen. En DeepSeek publiceert geen hardware-eis om een checkpoint van 552 miljard parameters zelf te draaien, en ook geen cijfer voor tokens per seconde. Dat is een vreemde omissie bij een release waarvan efficiëntie het hele argument is.
Prijs, licentie en wat er met DeepSeek V4 Pro gebeurt
- Licentie: MIT, gewichten gepubliceerd op Hugging Face met een technisch rapport
- Prijs buiten piekuren: $0,15 per miljoen inputtokens, $0,60 per miljoen outputtokens
- Piekprijs: $0,30 en $1,20, tussen 01:00 en 04:00 en tussen 06:00 en 10:00 UTC op werkdagen
- Input uit cache: $0,003 buiten piek, $0,006 tijdens piek, per miljoen tokens
- Context: een miljoen tokens in, tot 384.000 uit, tekst en afbeeldingen ondersteund
- Modelnaam in de API: deepseek-flash, met een limiet van 2.500 gelijktijdige verzoeken
De oudere DeepSeek-V4-Flash en DeepSeek-V4-Flash-Vision-Exp zijn uitgefaseerd en hun namen wijzen nu naar V4.1-Flash. Vanaf 12:00 uur Pekingtijd op 14 september 2026 gaan ook aanroepen naar deepseek-v4-pro naar V4.1-Flash, tegen het Flash-tarief, ongeveer een kwart van wat V4 Pro kostte. DeepSeek zegt dat er een V4.1 Pro komt, maar noemt geen datum. Heb je iets op V4 Pro gebouwd, dan krijg je over vier dagen een modelwissel die je zelf niet gekozen hebt.
Wat dit betekent
Dit is het nu waard om te testen als je code- of agentwerk op volume draait en je rekening vooral door lange prompts wordt bepaald. Denk aan een team dat code-review-agents over een grote repository laat lopen, waarbij elk verzoek duizenden regels context opnieuw inleest. Voor $0,15 per miljoen inputtokens buiten piekuren, met input uit cache op $0,003, wordt die werklast met een factor goedkoper die de meeste teams binnen een week opmerken. De MIT-licentie betekent bovendien dat je het op eigen hardware kunt draaien zonder onderhandeling, wat uitmaakt als je broncode niet naar een Chinese API mag sturen.
Het is niet het model om achter een onderzoeksassistent te zetten of achter iets dat zware feitelijke vragen moet beantwoorden. Een score van 36,8 op Humanity’s Last Exam tegenover 56,3 voor Opus-5.0 is geen afrondingsverschil, en het gat van 20 punten op Terminal-Bench 4.0 zegt hetzelfde op een andere manier. De eerlijke lezing is dat DeepSeek een heel goedkoop model heeft gebouwd dat uitblinkt in de agenttaken van een half jaar geleden en middenmoot is op de taken die nu gesteld worden. Test het op je eigen repository, met je eigen harness, voordat je verkeer verplaatst. Het eerste dat wij zouden meten zijn de kosten per afgeronde taak in plaats van de prijs per token, want het verschil tussen scaffolds dat DeepSeek publiceerde suggereert dat je resultaat net zo goed van je agentframework afhangt als van het model.
Voor meer informatie, bekijk de officiële aankondiging van DeepSeek-V4.1-Flash in de documentatie van DeepSeek.