Van de modellen die nu op het Nederlandse leaderboard van EuroEval zijn getest, staat Gemini 3.7 Flash begin oktober 2026 bovenaan, gevolgd door Gemini 3.6 Flash en gpt-5.6-sol. Daarmee is het niet het nieuwste model: Gemini 3.8 Flash kwam op 2 september uit en GPT-6.1 Sol op 29 September, en geen van beide is nog in het Nederlands gebenchmarkt.
Die ranglijst is bovendien niet genoeg om een model te kiezen. Er bestaat niet één beste AI-model voor Nederlands, want “goed in Nederlands” is niet één vaardigheid, maar minstens drie: de taal verwerken, Nederland kennen, en schrijven voor een Nederlandse lezer.
De korte versie
- Van de geteste modellen voert Gemini 3.7 Flash het Nederlandse leaderboard van EuroEval aan met een rank score van 1,24, waarbij lager beter is.
- Nederlandse taalvaardigheid is een gelopen race. De zeventien modellen in de bovenste vijf rangen zitten op sentiment binnen 2,5 punt van elkaar.
- Kennis van Nederland is dat niet. Diezelfde zeventien modellen lopen van 22,1 tot 84,2, dus daar bepaalt je modelkeuze de uitkomst.
Hieronder staan de cijfers per model, wat de benchmarks wel en niet meten, en hoe je zelf toetst welk model jouw Nederlandstalige werk aankan.
Wat is nu het beste AI-model voor Nederlands?
Gemini 3.7 Flash voert het Nederlandse leaderboard van EuroEval aan met een rank score van 1,24. EuroEval, tot vorig jaar bekend als ScandEval, test modellen op negen Nederlandse datasets en berekent de gemiddelde positie op die negen datasets. Lager is dus beter. Gemini 3.6 Flash volgt met 1,34 en gpt-5.6-sol met 1,43. Op het moment van lezen stonden er 786 modellen op de lijst.
Het eerste dat opvalt, is welke modellen bovenaan staan. Het zijn de snelle, goedkope Flash-varianten, niet de grootste topmodellen. Voor Nederlandstalig werk is dat goed nieuws: je hoeft niet het duurste model te nemen.
| Model (zoals EuroEval het noteert) | Rang | Sentiment (DBRD) | Kennis van Nederland (MultiLoKo-nl) | Duidelijke Taal | Open weights |
|---|---|---|---|---|---|
| gemini-3.7-flash | 1 | 92,0 | 83,0 | 49,2 | nee |
| gemini-3.6-flash | 2 | 91,5 | 81,3 | 47,9 | nee |
| gpt-5.6-sol | 3 | 93,6 | 67,5 | 54,0 | nee |
| claude-sonnet-4-5 (thinking) | 3 | 93,4 | 33,8 | 49,7 | nee |
| Qwen3.6-27B-FP8 | 3 | 91,6 | 24,3 | 50,5 | ja |
| gemma-4-31B-it | 4 | 93,4 | 28,5 | 53,4 | ja |
| grok-4-1-fast-reasoning | 4 | 93,6 | 48,0 | 50,8 | nee |
| EuroLLM-9B-Instruct-2512 | 13 | 92,1 | 21,7 | 56,6 | ja |
Alle scores komen van EuroEval, van eind september 2026, en zijn afgerond op één decimaal. Alle acht modellen zijn op de validation split gedraaid, dus je kunt de rijen onderling vergelijken.
Waarom lijken de beste modellen zo op elkaar in het Nederlands?
Op gewone Nederlandse taaltaken is het verschil tussen de topmodellen verwaarloosbaar. Neem DBRD, een test die sentiment classificeert in Nederlandse boekrecensies van Hebban.nl. Bij de zeventien modellen in de bovenste vijf rangen loopt de score van 91,5 tot 94,0. Dat is een spreiding van 2,5 punt op een schaal van 100, terwijl diezelfde modellen in prijs en formaat ver uit elkaar liggen.
Begrijpend lezen geeft hetzelfde beeld. Op SQuAD-nl scoort diezelfde groep tussen 70,8 en 81,0. Ook dat is een smalle band.
Bij de grote algemene modellen ligt de Nederlandse taalprestatie dus dicht op elkaar. Kies je alleen op taalvaardigheid, dan kies je willekeurig.
Waar zitten de verschillen dan wel?
De echte verschillen zitten in kennis van Nederland. MultiLoKo-nl test precies dat: de Nederlandse vragen zijn apart geschreven voor het Nederlands, niet vertaald, en gaan over onderwerpen die hier relevant zijn. Het onderliggende onderzoek beschrijft MultiLoKo als een benchmark voor lokale kennis in 31 talen. Eén voorbeeldvraag gaat over de Nederlandse versie van het Correspondents’ Dinner, die Twan Huys en Mark Rutte in de Beurs van Berlage presenteerden.
Bij diezelfde zeventien modellen uit de bovenste vijf rangen loopt de score op deze test van 22,1 tot 84,2. Gemini 3.7 Flash haalt 83,0, gpt-5.6-sol 67,5, Claude Sonnet 4.5 met thinking 33,8 en Qwen3.6-27B-FP8 24,3. Dat zijn modellen die op sentiment binnen twee punten van elkaar zitten.
De tweede zwakke plek raakt Nederlandse organisaties direct. De dataset Duidelijke Taal meet of een model een ingewikkelde Nederlandse zin kan herschrijven naar begrijpelijke taal. Het taalmateriaal komt van het Instituut voor de Nederlandse Taal. Het bestaat uit 6.986 originele en 6.986 vereenvoudigde zinnen, die crowdworkers beoordeelden op eenvoud, accuratesse en vlotheid. De hoogste score in de bovenste vijf rangen is 55,6, lager dan de beste score die diezelfde modellen op elke andere Nederlandse taak halen.
Dat is precies de taak waar veel Nederlandse gemeenten, zorginstellingen en verzekeraars hun AI voor willen inzetten. De Rijksoverheid schrijft haar eigen webteksten op B1-niveau, en volgens het CBS hebben drie miljoen volwassenen tussen 16 en 75 jaar moeite met lezen, schrijven of rekenen. Herschrijven naar duidelijke taal is dus geen bijzaak, en het is de Nederlandse taak waar deze modellen het slechtst op scoren.
Kun je een Nederlandse benchmark vertrouwen?
Een Nederlandse benchmark is maar deels te vertrouwen, en het scheelt om te weten welk deel. Twee van de negen Nederlandse datasets in EuroEval zijn vertalingen uit het Engels. SQuAD-nl is met Google Translate vertaald, waarna acht studenten de testset met de hand hebben nagelopen. Winogrande-nl is een vertaalde en gefilterde versie van het Engelse origineel. De overige zeven gebruiken echt Nederlands materiaal: boekrecensies van Hebban.nl, Nederlandse WikiHow-artikelen, zinnen uit het SoNaR-corpus.
Maar Nederlandstalig is niet hetzelfde als Nederlands. CoNLL-nl bestaat uit annotaties van de Belgische krant De Morgen uit 2000. INCLUDE-nl bevat Vlaams examenmateriaal, inclusief zinnen over “op kot” zitten. Beide datasets zijn nuttig, maar het is niet het Nederlands van een Groningse gemeente. En maar één dataset, MultiLoKo-nl, is geschreven om te testen wat een model weet van het Nederlandse leven zelf.
De oudere Nederlandse benchmark DUMB van de Rijksuniversiteit Groningen wordt in discussies nog vaak aangehaald, maar meet iets anders. DUMB vergelijkt veertien encoder-modellen zoals DeBERTaV3 en XLM-R. Het zegt niets over ChatGPT, Claude of Gemini.
Tot slot vermeldt EuroEval zelf een detail dat telt. De topposities zijn gedraaid op de validation split, en de FAQ zegt daarover: “they aren’t strictly comparable to the regular test-split scores”. Kleine verschillen bovenaan zijn dus ruis. Gebruik een leaderboard daarom als vertrekpunt en niet als eindoordeel. Dat geldt ook voor het evalueren van LLM’s in het algemeen.
Wat publiceren OpenAI, Google en Anthropic over Nederlands?
Alle drie evalueren hun modellen in veel talen, maar vrijwel geen van hen publiceert een Nederlands cijfer dat je kunt aflezen. De meertalige benchmark MMMLU van OpenAI bevat precies veertien talen: Arabisch, Bengaals, Duits, Spaans, Frans, Hindi, Indonesisch, Italiaans, Japans, Koreaans, Portugees, Swahili, Yoruba en Chinees. Nederlands staat er niet tussen.
De meertalige documentatie van Anthropic gebruikt diezelfde veertien talen en heeft dus geen Nederlandse regel. Het system card van Claude Sonnet 4.6 gaat verder. Dat document draait Global MMLU over 42 talen en zet Nederlands in de groep talen met veel bronmateriaal, maar rapporteert één gemiddelde van 91,0 procent voor die hele groep en geen Nederlandse score. Anthropic publiceerde ook onderzoek naar hoe Claude’s waarden per taal verschuiven, over de twintig meestgebruikte talen op Claude.ai, met als bevinding dat Claude “leans toward candor in Dutch”.
Google evalueert Gemini 3 Pro op MMMLU en Global PIQA, zonder Nederlands apart te noemen. Mistral noemt Nederlands wel in zijn talenoverzicht, in de groep talen met “strong expected performance”, maar publiceert er geen cijfers bij.
Nederlands duikt dus wel op in de evaluaties van leveranciers, alleen bijna nooit als cijfer. In Global-MMLU van Cohere Labs en in Belebele van Meta heeft Nederlands wel een eigen regel. Wil je een getal, dan zijn onafhankelijke benchmarks nog steeds de plek.
Is een Nederlands of Europees model een veiligere keuze?
Op kwaliteit is een Nederlands of Europees model nog geen betere keuze. Dat is de nuchtere uitkomst van een onderzoek van de gemeente Amsterdam, gepubliceerd op 10 augustus 2026. De onderzoekers beoordeelden ruim dertig modellen op feitelijkheid, eerlijkheid, bias, energieverbruik, kosten en transparantie over trainingsdata. Op Nederlandse feitelijkheid scoort GPT-5 het hoogst met 0,76. De Nederlandse fine-tunes blijven ver achter: GEITje 7B Ultra komt op 0,39 en Fietje 2 op 0,43. EuroLLM 9B haalt 0,44 en EuroLLM 22B 0,47.
Datzelfde onderzoek levert meteen het beste tegenargument tegen simpel ranken. HonestCityBench, een speciaal gebouwde Nederlandse benchmark van 530 prompts, meet eerlijkheid. Daarop scoort GPT-4o het hoogst met 0,43, terwijl GPT-5 blijft steken op 0,14. De onderzoekers vatten het zo samen: “factuality and honesty are governed by distinct properties, with high factuality not implying high honesty”. Let wel: het onderzoek gebruikte alleen modellen die via de Azure-omgeving van de gemeente beschikbaar waren, dus Claude ontbreekt.
De Nederlandse optie kun je bovendien nog niet afnemen. GPT-NL is een samenwerking van TNO, NFI en SURF met 13,5 miljoen euro van RVO. Het project traint een model van 26 miljard parameters op rechtenvrije Nederlandse data. Momenteel is de HuggingFace-organisatie nog leeg en is het model alleen beschikbaar voor de launching customers van GPT-NL. De eigen doelstelling is eerlijk over de ambitie: het project mikt op prestaties die vergelijkbaar zijn met “the Llama2 7B model and GPT-3 175B (or equivalent) models”.
Eén cijfer gaat tegen dit patroon in. Op Duidelijke Taal scoort EuroLLM-9B-Instruct met 56,6 hoger dan elk commercieel topmodel in onze tabel. Europese modellen zijn dus niet overal zwakker. Ze zijn zwak op andere onderdelen. Wie open weights overweegt, vindt in ons overzicht van open-source LLM’s de bredere afweging.
Nog een les: van GEITje, het bekendste Nederlandse model, zijn de oorspronkelijke gewichten ingetrokken. Op de modelpagina staat dat alle gewichten en checkpoints zijn verwijderd op dringend verzoek van Stichting BREIN. In zijn takedownbericht legt maker Edwin Rijgersberg uit dat het Nederlandse trainingscorpus auteursrechtelijk beschermd materiaal bevatte.
Wat kost Nederlands extra?
Nederlands kost meer tokens dan Engels voor dezelfde inhoud. Dat verschil is wel kleiner dan een paar jaar geleden. Wij hebben het gemeten op het Europarl-corpus met 4.747 parallelle zinsparen. Met de oude GPT-4-tokenizer (cl100k_base) had de Nederlandse tekst 56 procent meer tokens nodig dan de Engelse. Met de tokenizer van alle huidige OpenAI-modellen (o200k_base) is dat nog 16 procent.
Die 16 procent kost je op twee plekken: je betaalt per token, en je contextvenster raakt sneller vol. Lange samenstellingen zijn het duurst. “Arbeidsongeschiktheidsverzekering” kost acht tokens, tegenover drie voor “disability insurance”.
Schaarste aan Nederlandse tekst is niet het probleem. In de laatste Common Crawl-meting (CC-MAIN-2026-34) is 1,78 procent van de pagina’s Nederlands, goed voor plek elf van 161 talen. Er is genoeg Nederlands op het web. Er is te weinig Nederlandse evaluatie.
Hoe kies je een model voor Nederlandstalig werk?
Je begint bij de taak en niet bij het leaderboard. Deze volgorde werkt in de praktijk:
- Bepaal welke van de drie vaardigheden je nodig hebt. Gaat het om taal verwerken, dan voldoet vrijwel elk actueel model en kies je op prijs en latency. Gaat het om Nederlandse feiten, personen of regelgeving, dan is de modelkeuze bepalend.
- Reken voor kennis over Nederland nooit op het model zelf. Het verschil van 62 punten op MultiLoKo-nl verdwijnt grotendeels als je de feiten zelf aanlevert, via RAG of een vaste bron. Vertrouw niet op wat het model onthouden heeft.
- Toets op je eigen materiaal. Neem vijftig echte stukken tekst uit je organisatie, met je eigen jargon en afkortingen, en laat twee of drie modellen dezelfde opdracht doen.
- Laat een mens het beoordelen als het om duidelijke taal gaat. De scores zijn hier de laagste van alle Nederlandse taken, dus een redactieslag blijf je nodig hebben.
- Kijk daarna pas naar de randvoorwaarden: dataresidentie, kosten per token en wat de AI Act sinds augustus 2026 van je vraagt.
Veelgestelde vragen (FAQ)
Welk AI-model is het beste in het Nederlands?
Van de modellen die EuroEval heeft getest, voert Gemini 3.7 Flash het Nederlandse leaderboard aan met een rank score van 1,24. Nieuwere modellen als Gemini 3.8 Flash en GPT-6 Astra staan er nog niet op. Voor puur taalwerk ontlopen de topmodellen elkaar nauwelijks; voor kennis van Nederland is het verschil groot.
Kan ChatGPT goed Nederlands?
Ja, ChatGPT verwerkt Nederlands goed. Op Nederlandse sentimentclassificatie scoort gpt-5.6-sol 93,6 van de 100, net als de andere topmodellen. Op kennis van specifiek Nederlandse onderwerpen komt het model op 67,5, waar de Gemini Flash-modellen boven de 81 uitkomen. Voor feitelijke vragen over Nederland is dat een merkbaar verschil.
Is er een goed Nederlands taalmodel?
Er is nog geen Nederlands taalmodel dat het niveau van de internationale modellen haalt. GPT-NL van TNO, NFI en SURF is in training en alleen beschikbaar voor launching customers. De Nederlandse fine-tunes GEITje 7B Ultra en Fietje 2 scoren in het Amsterdamse onderzoek lager op Nederlandse feitelijkheid dan grote algemene modellen.
Waarom staan er geen Nederlandse cijfers in de benchmarks van OpenAI en Anthropic?
De meertalige benchmark MMMLU van OpenAI bevat veertien talen en Nederlands zit daar niet bij. Anthropic gaat verder: het system card van Claude Sonnet 4.6 draait Global MMLU over 42 talen met Nederlands erbij, maar rapporteert alleen het groepsgemiddelde en geen Nederlands cijfer. Voor Nederlandse getallen blijf je aangewezen op onafhankelijke benchmarks zoals EuroEval.
Kost Nederlands meer dan Engels bij een AI-model?
Ja, Nederlands kost ongeveer 16 procent meer tokens voor dezelfde inhoud met de huidige OpenAI-tokenizer, gemeten op een parallel corpus van 4.747 zinsparen. Met de oudere GPT-4-tokenizer was dat nog 56 procent. Je betaalt per token, dus dat verschil werkt door in je kosten en in hoe snel je contextvenster vol raakt.
Wil je weten welk model het beste past bij jullie Nederlandstalige processen? In een AI Assessment toetsen we modellen op jullie eigen documenten en data, en in onze AI-consultancy begeleiden we de keuze en de implementatie.