{"id":3442329,"date":"2026-08-04T08:43:31","date_gmt":"2026-08-04T06:43:31","guid":{"rendered":"https:\/\/datanorth.ai\/?post_type=news&#038;p=3442329"},"modified":"2026-08-04T08:43:41","modified_gmt":"2026-08-04T06:43:41","slug":"deepseek-lanceert-deepseek-v4-flash-0731","status":"publish","type":"news","link":"https:\/\/datanorth.ai\/nl\/nieuws\/deepseek-lanceert-deepseek-v4-flash-0731","title":{"rendered":"DeepSeek lanceert DeepSeek-V4-Flash-0731"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><em>Gepubliceerd: 03 augustus 2026<\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">DeepSeek heeft op 31 juli 2026 DeepSeek-V4-Flash-0731 uitgebracht. De gewichten staan onder een MIT-licentie op Hugging Face en de officiele V4-Flash API is in publieke beta gegaan. DeepSeek-V4-Flash-0731 is een Mixture-of-Experts-model met 284 miljard parameters waarvan er 13 miljard per token actief zijn, met een contextvenster van 1 miljoen tokens en een prijs van 0,14 dollar per miljoen invoertokens en 0,28 dollar per miljoen uitvoertokens. Het gaat om een opnieuw getrainde versie van de preview uit april en niet om een nieuwe architectuur. DeepSeek meldt dat het model op alle gepubliceerde agentbenchmarks beter scoort dan het grotere V4-Pro (Preview).<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat heeft DeepSeek uitgebracht met DeepSeek-V4-Flash-0731?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">DeepSeek-V4-Flash-0731 is de officiele release van DeepSeek V4-Flash en vervangt de previewversie die sinds april 2026 beschikbaar was. In de model card staat expliciet dat de architectuur en het aantal parameters ongewijzigd zijn. De verbetering komt volledig uit een nieuwe post-trainingpijplijn gericht op programmeren, agents, redeneren en tool use. Het gepubliceerde checkpoint meldt 304 miljard parameters op Hugging Face. Daarin zit de DSpark-module voor speculative decoding, bovenop het basismodel van 284 miljard parameters.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Aan de API-kant ondersteunt het endpoint deepseek-v4-flash nu native het Responses API-formaat en is het aangepast voor Codex. De V4-Pro API en de modellen in de DeepSeek-app en op het web zijn niet bijgewerkt. De gewichten vallen onder een MIT-licentie en zijn vrij toegankelijk, waardoor commercieel gebruik op eigen infrastructuur is toegestaan.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Benchmarks en technische specificaties van DeepSeek-V4-Flash-0731<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">DeepSeek-V4-Flash-0731 is een decoder-only Mixture-of-Experts-model met 284 miljard parameters in totaal en 13 miljard actief per token. Elke MoE-laag bevat 1 gedeelde expert en 256 gerouteerde experts met een intermediate dimensie van 2048, waarbij 6 gerouteerde experts per token actief worden. De eerste drie MoE-lagen gebruiken hash routing en de multi-token prediction-diepte is 1. De attention combineert Compressed Sparse Attention en Heavily Compressed Attention, en Manifold-Constrained Hyper-Connections vervangen de gebruikelijke residual connections. Voor de pre-training zijn meer dan 32 biljoen tokens gebruikt met de Muon-optimizer.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Op de benchmarks die DeepSeek bij de model card publiceerde scoort DeepSeek-V4-Flash-0731 82,7 op Terminal Bench 2.1, tegen 61,8 voor de V4-Flash preview en 72,1 voor V4-Pro (Preview). Verder komt het model op 54,2 bij NL2Repo, 76,7 bij Cybergym, 54,4 bij DeepSWE, 70,3 bij Toolathlon-Verified, 25,2 bij Agents&#8217; Last Exam en 25,1 bij AutomationBench Public. Ter vergelijking noemt DeepSeek GLM-5.2 op 81,0 bij Terminal Bench 2.1 en Opus-4.8 op 85,0. Alle cijfers komen van DeepSeek zelf en de code-agenttaken zijn gedraaid met de minimal mode van de DeepSeek Harness, die niet is vrijgegeven. Eigen metingen kunnen dus afwijken.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Hoe verhoudt DeepSeek-V4-Flash-0731 zich tot DeepSeek V4-Pro?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">De belangrijkste vergelijking in deze release is intern. DeepSeek-V4-Flash-0731 scoort hoger dan DeepSeek V4-Pro (Preview) op alle negen gepubliceerde agent- en codebenchmarks, terwijl het ongeveer een derde kost op uitvoertokens. V4-Flash-uitvoer kost 0,28 dollar per miljoen tokens tegenover 0,87 dollar per miljoen voor deepseek-v4-pro. Invoer kost 0,14 dollar per miljoen tokens bij een cache miss en 0,0028 dollar per miljoen bij een cache hit, met een concurrency-limiet van 2.500.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Tegenover externe modellen plaatst DeepSeek V4-Flash-0731 dicht bij GLM-5.2 op agentic coding en onder Claude Opus 4.8, dat de gepubliceerde tabel aanvoert op Terminal Bench 2.1, NL2Repo, Cybergym, DeepSWE, Toolathlon-Verified, Agents&#8217; Last Exam en AutomationBench Public. Het argument is dus prijs-prestatie en niet de koppositie.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Beschikbaarheid, prijs en zelf hosten van DeepSeek-V4-Flash-0731<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">DeepSeek-V4-Flash-0731 is beschikbaar via de DeepSeek API als deepseek-v4-flash, nu in publieke beta, en als MIT-gelicentieerde gewichten op Hugging Face. Voor API-gebruik is geen eigen GPU-capaciteit nodig en dat is voor de meeste teams de praktische route, tegen 0,14 dollar per miljoen invoertokens en 0,28 dollar per miljoen uitvoertokens.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Zelf hosten is een ander verhaal. Alle experts blijven in het geheugen staan, ook al zijn er maar 13 miljard parameters per token actief. Het vLLM-voorbeeld van DeepSeek draait het model op een enkele node met 4x GB300. De dynamische GGUF-builds van Unsloth komen uit op 162 GB voor de lossless 8-bits versie en 103 GB voor een 3-bits versie, waarvoor ongeveer 110 GB aan gecombineerd RAM en VRAM nodig is. DSpark speculative decoding zet je aan met een enkele vLLM-vlag. Het DSpark-paper meldt 60 tot 85 procent snellere generatie per gebruiker op V4-Flash ten opzichte van de MTP-1-baseline bij gelijke totale doorvoer. DeepSeek adviseert een temperatuur van 1,0 en top_p van 0,95 voor agentgebruik, met maximaal 384.000 uitvoertokens bij reasoning effort high en max.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><em>De volledige details staan in <a href=\"https:\/\/huggingface.co\/deepseek-ai\/DeepSeek-V4-Flash-0731\" target=\"_blank\" rel=\"noreferrer noopener\">de DeepSeek V4 model card op Huggingface<\/a> en in <a href=\"https:\/\/api-docs.deepseek.com\/quick_start\/pricing\/\" target=\"_blank\" rel=\"noreferrer noopener\">de prijsdocumentatie van de DeepSeek API<\/a>.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>DeepSeek-V4-Flash-0731 is de officiele V4-Flash-release van DeepSeek, gepubliceerd op 31 juli 2026: een MoE-model met 284 miljard parameters waarvan 13 miljard actief, een contextvenster van 1 miljoen tokens, MIT-gelicentieerde gewichten en een prijs van 0,14 en 0,28 dollar per miljoen tokens.<\/p>\n","protected":false},"author":12,"featured_media":3442327,"template":"","tags":[],"news-category":[],"class_list":["post-3442329","news","type-news","status-publish","has-post-thumbnail"],"meta_box":[],"_links":{"self":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news\/3442329","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news"}],"about":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/types\/news"}],"author":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/users\/12"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media\/3442327"}],"wp:attachment":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media?parent=3442329"}],"wp:term":[{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/tags?post=3442329"},{"taxonomy":"news-category","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news-category?post=3442329"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}