{"id":3443694,"date":"2026-09-11T10:19:54","date_gmt":"2026-09-11T08:19:54","guid":{"rendered":"https:\/\/datanorth.ai\/?post_type=news&#038;p=3443694"},"modified":"2026-09-11T10:20:16","modified_gmt":"2026-09-11T08:20:16","slug":"ant-group-brengt-ling-3-0-flash-vl-uit","status":"publish","type":"news","link":"https:\/\/datanorth.ai\/nl\/nieuws\/ant-group-brengt-ling-3-0-flash-vl-uit","title":{"rendered":"Ant Group brengt Ling-3.0-flash-VL uit"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><em>Gepubliceerd op 11 september 2026<\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Het inclusionAI-lab van Ant Group publiceerde Ling-3.0-flash-VL op 10 september 2026, een model van 124 miljard parameters dat er per token maar 5,5 miljard van aanzet. Het leest naast tekst ook beeld en video, houdt 262.144 tokens context vast en komt onder de MIT-licentie, die commercieel gebruik toestaat. inclusionAI zette dezelfde dag ook fp8-, fp4- en int4-versies online.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat is Ling-3.0-flash-VL en hoe zit het in elkaar?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Ling-3.0-flash-VL is de beeldversie van Ling-3.0-flash, het tekstmodel dat inclusionAI eerder uitbracht. Het is een mixture-of-experts model, wat betekent dat het per token maar een deel van zichzelf aanzet. Beide versies tellen 124 miljard parameters in totaal. De beeldversie activeert er 5,5 miljard per token, tegenover 5,1 miljard bij de tekstversie.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Drie onderdelen doen het visuele werk. Een ViT-encoder zet beelden en videoframes om in kenmerken, en een klein netwerk van twee lagen vertaalt die naar dezelfde ruimte als de tekst. VideoRoPE codeert wanneer iets gebeurde en niet alleen waar het in beeld staat, en dat is wat het model in staat stelt om vragen over lange video te beantwoorden en een moment daarin terug te vinden. Daaronder wisselt een ruggengraat van 42 lagen twee soorten attention af, Kimi Delta Attention en Gated MLA, in een verhouding van vijf op een. Zo houdt het een kwart miljoen tokens vast zonder dat de geheugenkosten uit de hand lopen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Denkmodus staat standaard aan, en je zet hem per verzoek uit.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Ling-3.0-flash-VL benchmarks tegenover Ling-3.0-flash<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Lees deze tabel als een voor-en-na op hetzelfde basismodel en niet als een ranglijst tegen concurrenten, want dat is de enige vergelijking die inclusionAI in cijfers publiceert.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table><thead><tr><th>Wat er gemeten wordt<\/th><th>Ling-3.0-flash-VL<\/th><th>Ling-3.0-flash (tekstversie, de voorganger)<\/th><\/tr><\/thead><tbody><tr><td>Totaal aantal parameters<\/td><td>124 miljard<\/td><td>124 miljard<\/td><\/tr><tr><td>Actieve parameters per token<\/td><td>5,5 miljard<\/td><td>5,1 miljard<\/td><\/tr><tr><td>Geaccepteerde input<\/td><td>Tekst, beeld en video<\/td><td>Tekst<\/td><\/tr><tr><td>Contextvenster<\/td><td>262.144 tokens<\/td><td>262.144 tokens<\/td><\/tr><tr><td>AA Intelligence Index v4.1.1, zoals inclusionAI citeert<\/td><td>42<\/td><td>38<\/td><\/tr><tr><td>Outputsnelheid gemeten door Artificial Analysis<\/td><td>138,8 tokens per seconde, tegenover een mediaan van 97 in deze formaatklasse<\/td><td>Niet gepubliceerd in deze vergelijking<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">De cijfers voor parameters en context komen van de modelkaart van inclusionAI. De indexscore van 42 is het citaat van inclusionAI zelf en gaat over versie 4.1.1 van de Artificial Analysis Intelligence Index. Artificial Analysis draait inmiddels versie 4.3 en zet Ling-3.0-flash-VL daar op 25, tweede van 64 open-gewichtenmodellen in zijn formaatklasse tegenover een mediaan van 8. Beide cijfers kloppen. Het zijn verschillende tests.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat inclusionAI niet vertelt over Ling-3.0-flash-VL<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">De multimodale benchmarkvergelijking bestaat alleen als plaatje. inclusionAI zet een grafiek op de modelkaart en geen tabel waar je een getal uit kunt lezen, waardoor niemand uit deze release een MMMU-score of schermagent-score kan citeren zonder hem zelf opnieuw te draaien. Voor een model waarvan het hele verhaal is dat beeld het echte werk verbetert, is dat het verkeerde om weg te laten.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Het indexcijfer in de kop komt uit een oudere scoreversie. 42 op v4.1.1 citeren is niet onjuist, maar Artificial Analysis is doorgegaan naar v4.3 en scoort het model daar op 25. Wie de bron controleert, vindt dus een ander getal dan wat op de modelkaart staat.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Dan is er nog de breedsprakigheid, die helemaal niet op de modelkaart staat. Artificial Analysis mat 160 miljoen outputtokens om zijn index te draaien, tegenover een mediaan van 84 miljoen bij vergelijkbare modellen. Een redeneermodel dat bijna twee keer zo lang doordenkt als zijn concurrenten is niet goedkoop om te draaien, wat de gewichten ook kosten. inclusionAI publiceert bovendien zelf geen prijs. Het model is bij de lancering gratis op OpenRouter, maar een lanceeractie is geen prijs.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Licentie, hardware en hoe je Ling-3.0-flash-VL draait<\/h2>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Licentie: MIT, commercieel gebruik toegestaan, gewichten op Hugging Face en ModelScope<\/li>\n\n\n\n<li>Formaten: volledige BF16-gewichten plus fp8-, fp4- en int4-versies<\/li>\n\n\n\n<li>Hardware voor de volledige context van 262.144 tokens: vier GPU&#8217;s van de 141GB-klasse zoals H20-3e of H200, of een Blackwell-node met vier GPU&#8217;s<\/li>\n\n\n\n<li>Op kaarten van 80GB zoals H100 of H800 splits je het in plaats daarvan over acht<\/li>\n\n\n\n<li>Serveren: er hoort een SGLang-dockerimage bij, en inclusionAI onderhoudt een vLLM-fork<\/li>\n\n\n\n<li>Gehost gebruik: beschikbaar via Novita, en bij de lancering gratis op OpenRouter<\/li>\n<\/ul>\n\n\n\n<h2 class=\"wp-block-heading\">Wat dit betekent<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Dit is het nu waard om te testen als je scherm- of documentagents op eigen hardware bouwt en vier grote GPU&#8217;s kunt vrijmaken. Dat is een smalle groep, maar voor hen is het verhaal sterk. Een MIT-licentie, video als input, een venster van een kwart miljoen tokens en 5,5 miljard actieve parameters per token is een combinatie die deze week niemand anders gratis weggeeft. Een team van vier dat schadeafhandeling automatiseert op gescande documenten en schermopnames, is precies het soort koper waar dit bij past.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Het is eerder iets om te volgen dan om nu over te nemen als je hoopte het in een API te wisselen en een cijfer te zien bewegen. Het bewijs is dun op precies de plek waar het telt. Er is geen leesbare multimodale benchmarktabel, de indexscore in de kop hangt af van welke versie van de index je bekijkt, en het cijfer voor breedsprakigheid suggereert dat jouw echte rekening bepaald wordt door hoeveel het model nadenkt en niet door wat de gewichten kosten. Test het op jouw eigen schermafbeeldingen en jouw eigen documenten, en tel daarbij de outputtokens, want daar gaat dit model je verrassen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Voor meer informatie, bekijk<\/em> <em><a href=\"https:\/\/huggingface.co\/inclusionAI\/Ling-3.0-flash-VL\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">de offici\u00eble aankondiging van Ling-3.0-flash-VL in de modelkaart van inclusionAI<\/a><\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Het inclusionAI-lab van Ant Group bracht Ling-3.0-flash-VL uit op 10 september 2026, een open-gewichtenmodel van 124 miljard parameters dat er per token 5,5 miljard aanzet.<\/p>\n","protected":false},"author":22,"featured_media":3443699,"template":"","tags":[],"news-category":[],"class_list":["post-3443694","news","type-news","status-publish","has-post-thumbnail"],"meta_box":[],"_links":{"self":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news\/3443694","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news"}],"about":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/types\/news"}],"author":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/users\/22"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media\/3443699"}],"wp:attachment":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media?parent=3443694"}],"wp:term":[{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/tags?post=3443694"},{"taxonomy":"news-category","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/news-category?post=3443694"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}