{"id":3444014,"date":"2026-09-17T12:53:55","date_gmt":"2026-09-17T10:53:55","guid":{"rendered":"https:\/\/datanorth.ai\/?post_type=news&#038;p=3444014"},"modified":"2026-09-17T12:53:42","modified_gmt":"2026-09-17T10:53:42","slug":"nvidia-brengt-deepseek-v4-1-flash-nvfp4-uit","status":"publish","type":"news","link":"https:\/\/datanorth.ai\/nl\/nieuws\/nvidia-brengt-deepseek-v4-1-flash-nvfp4-uit","title":{"rendered":"NVIDIA brengt DeepSeek-V4.1-Flash-NVFP4 uit"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><em>Geplubliceerd: 17 september 2026<\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">NVIDIA publiceerde op 16 september 2026 DeepSeek-V4.1-Flash-NVFP4, een vier-bits versie van DeepSeek-V4.1-Flash die draait op vier GB300-GPU&#8217;s. Op de zes benchmarks die NVIDIA meldt, verschuift de nauwkeurigheid maximaal 1,5 punt in beide richtingen ten opzichte van het origineel. Dit is een herverpakking van het model van een ander, geen nieuw model, en NVIDIA zegt dat zelf op de modelkaart.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat is DeepSeek-V4.1-Flash-NVFP4?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Het is DeepSeek-V4.1-Flash waarvan de experts zijn omgezet naar een ander vier-bits getalformaat. Kwantisatie verkleint de getallen in een model, waardoor het minder geheugen en minder tijd per antwoord nodig heeft. DeepSeek leverde de gewichten al in vier bits, in een formaat dat MXFP4 heet. NVIDIA zette ze om naar NVFP4, het eigen vier-bits formaat dat Blackwell-GPU&#8217;s rechtstreeks in hardware verwerken.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Slechts een deel van het model is veranderd. NVIDIA converteerde de routed experts, de gespecialiseerde deelnetwerken waar een mixture-of-experts-model per woord tussen wisselt. Dat gaat om 384 experts verdeeld over 40 lagen. De attentielagen, de gedeelde experts, de beeldonderdelen en de Engram-geheugentabellen behouden de precisie waarmee DeepSeek ze uitbracht.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Een detail gaat tegen de verwachting in: het bestand werd groter, niet kleiner. NVFP4 slaat de schaalfactoren in fijnere groepen op, waardoor het bestand groeit van ongeveer 476 GiB naar 492 GiB. Je ruilt wat schijfruimte in voor rekenwerk dat de hardware zelf aankan.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Benchmarks van DeepSeek-V4.1-Flash-NVFP4 tegenover het MXFP4-origineel<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">NVIDIA draaide zes benchmarks tegen het eigen MXFP4-bestand van DeepSeek. De conclusie: de conversie kost je niets dat meetbaar is.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table><thead><tr><th>Wat wordt gemeten<\/th><th>NVFP4 (deze versie)<\/th><th>MXFP4 (Orgineel van DeepSeek)<\/th><\/tr><\/thead><tbody><tr><td>GPQA Diamond (moeilijke betavragen)<\/td><td>91,288<\/td><td>91,035<\/td><\/tr><tr><td>AA-LCR (geheugen over lange context)<\/td><td>78,438<\/td><td>78,563<\/td><\/tr><tr><td>SciCode (wetenschappelijk programmeren)<\/td><td>55,843<\/td><td>54,401<\/td><\/tr><tr><td>IFBench (instructies opvolgen)<\/td><td>77,267<\/td><td>76,667<\/td><\/tr><tr><td>MMMU-Pro (beelden en grafieken lezen)<\/td><td>73,699<\/td><td>74,046<\/td><\/tr><tr><td>Terminal-Bench 2.1 (agenttaken in de terminal)<\/td><td>82,16<\/td><td>81,60<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Beide kolommen zijn metingen van NVIDIA zelf, gedaan met vLLM op GB300-hardware. GPQA Diamond en AA-LCR draaiden 16 herhalingen, IFBench vijf, en Terminal-Bench gebruikte een aparte agentopstelling met acht pogingen per taak. De verschillen zijn klein genoeg om binnen de normale spreiding tussen runs te vallen. Dat is precies de claim van NVIDIA, en die is bescheiden: er is niets kapotgegaan.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat je nodig hebt om DeepSeek-V4.1-Flash-NVFP4 te draaien<\/h2>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Licentie: MIT, door NVIDIA vrijgegeven voor commercieel en niet-commercieel gebruik<\/li>\n\n\n\n<li>Download: Hugging Face, onder nvidia\/DeepSeek-V4.1-Flash-NVFP4<\/li>\n\n\n\n<li>Hardware: vier NVIDIA GB300-GPU&#8217;s, uitsluitend Blackwell-architectuur<\/li>\n\n\n\n<li>Runtimes: vLLM en SGLang, beide door NVIDIA getest op GB300<\/li>\n\n\n\n<li>Omvang: ongeveer 492 GiB, tegenover ruwweg 476 GiB voor het origineel<\/li>\n\n\n\n<li>Context: tot 1 miljoen tokens, tekst en beeld erin, tekst eruit<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Het model is groot maar ijl: 552B parameters in de basis, waarvan er 8B actief zijn terwijl het je prompt leest en 16B terwijl het schrijft, plus een apart geheugen van 196B. Daarom zijn vier GPU&#8217;s genoeg voor een model van dit formaat.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat NVIDIA niet vertelt over DeepSeek-V4.1-Flash-NVFP4<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">De modelkaart publiceert nauwkeurigheid en verder niets. Er staat geen cijfer over doorvoer, geen tokens per seconde, geen tijd tot het eerste token en geen besparing op geheugen. Snelheid is de hele reden om op Blackwell van MXFP4 naar NVFP4 te gaan, en juist dat getal ontbreekt. Je hoort dat de conversie veilig is, niet dat die snel is.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Twee kleinere hiaten tellen als je een uitrol plant. NVIDIA behield de DSpark-tensoren voor speculative decoding, een truc die meerdere tokens tegelijk opstelt om het schrijven te versnellen, maar meldt dat het die route niet heeft getest. En het vLLM-voorbeeld op de kaart is alleen tekst, dus voor beeldinvoer heb je een aparte multimodale configuratie nodig, terwijl beeld juist de helft is van waar DeepSeek-V4.1-Flash voor bedoeld is.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat dit betekent<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Draai je DeepSeek-V4.1-Flash al op GB300-hardware, download deze versie dan en meet deze week zelf de snelheid. De vraag over nauwkeurigheid is beantwoord, dus het enige dat je nog moet vaststellen is de snelheidswinst, en die laat NVIDIA aan jou over. Voor een platformteam dat een groot open-weights model over vier GPU&#8217;s draait, is een gratis wissel zonder kwaliteitsverlies en met een aannemelijke doorvoerwinst een middag benchmarken waard.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Voor iedereen daarbuiten kun je dit gerust overslaan. Het vraagt Blackwell-hardware van GB300-klasse, wat de meeste teams die open gewichten op eigen servers draaien uitsluit, en het voegt geen enkele functionaliteit toe. Dit lezen als een DeepSeek-release zou een misvatting zijn. Het interessante zit in de timing. DeepSeek bracht V4.1-Flash op 10 september uit en de vier-bits versie van NVIDIA volgde zes dagen later; GLM-5.3-Flash kostte in augustus zeven dagen. Open topmodellen zijn nu binnen een week klaar voor Blackwell, waardoor het gat kleiner wordt tussen een Chinees lab dat een model publiceert en een Europees bedrijf dat het kan draaien op hardware die het al bezit. Die trend is belangrijker dan dit specifieke bestand.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Voor meer informatie, bekijk <a href=\"https:\/\/huggingface.co\/nvidia\/DeepSeek-V4.1-Flash-NVFP4\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">de offici\u00eble aankondiging van DeepSeek-V4.1-Flash-NVFP4 in de modelkaart van NVIDIA<\/a>.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>NVIDIA publiceerde op 16 september 2026 DeepSeek-V4.1-Flash-NVFP4, een vier-bits conversie van DeepSeek-V4.1-Flash voor Blackwell-GPU&#8217;s. Het model draait op vier GB300-GPU&#8217;s onder MIT-licentie en verwerkt 1 miljoen tokens context.<\/p>\n","protected":false},"author":12,"featured_media":3444011,"template":"","tags":[],"news-category":[],"class_list":["post-3444014","news","type-news","status-publish","has-post-thumbnail"],"meta_box":[],"_links":{"self":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news\/3444014","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news"}],"about":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/types\/news"}],"author":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/users\/12"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media\/3444011"}],"wp:attachment":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media?parent=3444014"}],"wp:term":[{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/tags?post=3444014"},{"taxonomy":"news-category","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news-category?post=3444014"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}