{"id":3444308,"date":"2026-10-01T12:48:26","date_gmt":"2026-10-01T10:48:26","guid":{"rendered":"https:\/\/datanorth.ai\/?p=3444308"},"modified":"2026-10-01T12:49:51","modified_gmt":"2026-10-01T10:49:51","slug":"welk-ai-model-is-het-beste-in-nederlands","status":"publish","type":"post","link":"https:\/\/datanorth.ai\/nl\/blog\/welk-ai-model-is-het-beste-in-nederlands","title":{"rendered":"Welk AI-model is het beste in Nederlands?"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Van de modellen die nu op het Nederlandse leaderboard van EuroEval zijn getest, staat Gemini 3.7 Flash begin oktober 2026 bovenaan, gevolgd door Gemini 3.6 Flash en gpt-5.6-sol. Daarmee is het niet het nieuwste model: <a href=\"https:\/\/blog.google\/innovation-and-ai\/models-and-research\/gemini-models\/3-8-flash-and-3-8-flash-cyber\/\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">Gemini 3.8 Flash<\/a> kwam op 2 september uit en <a href=\"https:\/\/openai.com\/index\/introducing-gpt-6-1-sol\/\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">GPT-6.1 Sol<\/a> op 29 September, en geen van beide is nog in het Nederlands gebenchmarkt.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Die ranglijst is bovendien niet genoeg om een model te kiezen. Er bestaat niet \u00e9\u00e9n beste AI-model voor Nederlands, want \u201cgoed in Nederlands\u201d is niet \u00e9\u00e9n vaardigheid, maar minstens drie: de taal verwerken, Nederland kennen, en schrijven voor een Nederlandse lezer.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">De korte versie<\/p>\n\n\n\n<ul class=\"wp-block-list\">\n<li>Van de geteste modellen voert Gemini 3.7 Flash het Nederlandse leaderboard van EuroEval aan met een rank score van 1,24, waarbij lager beter is.<\/li>\n\n\n\n<li>Nederlandse taalvaardigheid is een gelopen race. De zeventien modellen in de bovenste vijf rangen zitten op sentiment binnen 2,5 punt van elkaar.<\/li>\n\n\n\n<li>Kennis van Nederland is dat niet. Diezelfde zeventien modellen lopen van 22,1 tot 84,2, dus daar bepaalt je modelkeuze de uitkomst.<\/li>\n<\/ul>\n\n\n\n<p class=\"wp-block-paragraph\">Hieronder staan de cijfers per model, wat de benchmarks wel en niet meten, en hoe je zelf toetst welk model jouw Nederlandstalige werk aankan.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img decoding=\"async\" width=\"1152\" height=\"547\" src=\"https:\/\/datanorth.ai\/wp-content\/uploads\/2026\/09\/three-layers-of-good-at-dutch-3-1.jpg\" alt=\"three layers of ''good at dutch'' (3)\" class=\"wp-image-3444391\" srcset=\"https:\/\/datanorth.ai\/wp-content\/uploads\/2026\/09\/three-layers-of-good-at-dutch-3-1.jpg 1152w, https:\/\/datanorth.ai\/wp-content\/uploads\/2026\/09\/three-layers-of-good-at-dutch-3-1-1024x486.jpg 1024w, https:\/\/datanorth.ai\/wp-content\/uploads\/2026\/09\/three-layers-of-good-at-dutch-3-1-767x364.jpg 767w, https:\/\/datanorth.ai\/wp-content\/uploads\/2026\/09\/three-layers-of-good-at-dutch-3-1-300x142.jpg 300w\" sizes=\"(max-width: 1152px) 100vw, 1152px\" \/><figcaption class=\"wp-element-caption\"><em>Goed in Nederlands valt uiteen in drie lagen, en de topmodellen zijn het alleen eens over de bovenste.<\/em><\/figcaption><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\">Wat is nu het beste AI-model voor Nederlands?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Gemini 3.7 Flash voert het Nederlandse <a href=\"https:\/\/euroeval.com\/leaderboards\/dutch\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">leaderboard van EuroEval<\/a> aan met een rank score van 1,24. EuroEval, tot vorig jaar bekend als ScandEval, test modellen op negen Nederlandse datasets en berekent de gemiddelde positie op die negen datasets. Lager is dus beter. Gemini 3.6 Flash volgt met 1,34 en gpt-5.6-sol met 1,43. Op het moment van lezen stonden er 786 modellen op de lijst.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Het eerste dat opvalt, is welke modellen bovenaan staan. Het zijn de snelle, goedkope Flash-varianten, niet de grootste topmodellen. Voor Nederlandstalig werk is dat goed nieuws: je hoeft niet het duurste model te nemen.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table><thead><tr><th>Model (zoals EuroEval het noteert)<\/th><th>Rang<\/th><th>Sentiment (DBRD)<\/th><th>Kennis van Nederland (MultiLoKo-nl)<\/th><th>Duidelijke Taal<\/th><th>Open weights<\/th><\/tr><\/thead><tbody><tr><td>gemini-3.7-flash<\/td><td>1<\/td><td>92,0<\/td><td>83,0<\/td><td>49,2<\/td><td>nee<\/td><\/tr><tr><td>gemini-3.6-flash<\/td><td>2<\/td><td>91,5<\/td><td>81,3<\/td><td>47,9<\/td><td>nee<\/td><\/tr><tr><td>gpt-5.6-sol<\/td><td>3<\/td><td>93,6<\/td><td>67,5<\/td><td>54,0<\/td><td>nee<\/td><\/tr><tr><td>claude-sonnet-4-5 (thinking)<\/td><td>3<\/td><td>93,4<\/td><td>33,8<\/td><td>49,7<\/td><td>nee<\/td><\/tr><tr><td>Qwen3.6-27B-FP8<\/td><td>3<\/td><td>91,6<\/td><td>24,3<\/td><td>50,5<\/td><td>ja<\/td><\/tr><tr><td>gemma-4-31B-it<\/td><td>4<\/td><td>93,4<\/td><td>28,5<\/td><td>53,4<\/td><td>ja<\/td><\/tr><tr><td>grok-4-1-fast-reasoning<\/td><td>4<\/td><td>93,6<\/td><td>48,0<\/td><td>50,8<\/td><td>nee<\/td><\/tr><tr><td>EuroLLM-9B-Instruct-2512<\/td><td>13<\/td><td>92,1<\/td><td>21,7<\/td><td>56,6<\/td><td>ja<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Alle scores komen van EuroEval, van eind september 2026, en zijn afgerond op \u00e9\u00e9n decimaal. Alle acht modellen zijn op de validation split gedraaid, dus je kunt de rijen onderling vergelijken.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Waarom lijken de beste modellen zo op elkaar in het Nederlands?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Op gewone Nederlandse taaltaken is het verschil tussen de topmodellen verwaarloosbaar. Neem DBRD, een test die sentiment classificeert in Nederlandse boekrecensies van Hebban.nl. Bij de zeventien modellen in de bovenste vijf rangen loopt de score van 91,5 tot 94,0. Dat is een spreiding van 2,5 punt op een schaal van 100, terwijl diezelfde modellen in prijs en formaat ver uit elkaar liggen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Begrijpend lezen geeft hetzelfde beeld. Op SQuAD-nl scoort diezelfde groep tussen 70,8 en 81,0. Ook dat is een smalle band.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Bij de grote algemene modellen ligt de Nederlandse taalprestatie dus dicht op elkaar. Kies je alleen op taalvaardigheid, dan kies je willekeurig.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Waar zitten de verschillen dan wel?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">De echte verschillen zitten in kennis van Nederland. MultiLoKo-nl test precies dat: de Nederlandse vragen zijn apart geschreven voor het Nederlands, niet vertaald, en gaan over onderwerpen die hier relevant zijn. Het <a href=\"https:\/\/arxiv.org\/abs\/2504.10356\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">onderliggende onderzoek<\/a> beschrijft MultiLoKo als een benchmark voor lokale kennis in 31 talen. E\u00e9n voorbeeldvraag gaat over de Nederlandse versie van het Correspondents\u2019 Dinner, die Twan Huys en Mark Rutte in de Beurs van Berlage presenteerden.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Bij diezelfde zeventien modellen uit de bovenste vijf rangen loopt de score op deze test van 22,1 tot 84,2. Gemini 3.7 Flash haalt 83,0, gpt-5.6-sol 67,5, Claude Sonnet 4.5 met thinking 33,8 en Qwen3.6-27B-FP8 24,3. Dat zijn modellen die op sentiment binnen twee punten van elkaar zitten.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">De tweede zwakke plek raakt Nederlandse organisaties direct. De dataset Duidelijke Taal meet of een model een ingewikkelde Nederlandse zin kan herschrijven naar begrijpelijke taal. Het <a href=\"https:\/\/taalmaterialen.ivdnt.org\/download\/tekstvereenvoudiging-resultaten-crowdsourcing\/\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">taalmateriaal<\/a> komt van het Instituut voor de Nederlandse Taal. Het bestaat uit 6.986 originele en 6.986 vereenvoudigde zinnen, die crowdworkers beoordeelden op eenvoud, accuratesse en vlotheid. De hoogste score in de bovenste vijf rangen is 55,6, lager dan de beste score die diezelfde modellen op elke andere Nederlandse taak halen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Dat is precies de taak waar veel Nederlandse gemeenten, zorginstellingen en verzekeraars hun AI voor willen inzetten. De Rijksoverheid schrijft haar eigen webteksten <a href=\"https:\/\/www.communicatierijk.nl\/vakkennis\/rijkswebsites\/aanbevolen-richtlijnen\/taalniveau-b1\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">op B1-niveau<\/a>, en volgens het CBS hebben <a href=\"https:\/\/www.cbs.nl\/nl-nl\/corporate\/2025\/42\/dashboard-basisvaardigheden-brengt-laaggeletterdheid-in-beeld\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">drie miljoen volwassenen<\/a> tussen 16 en 75 jaar moeite met lezen, schrijven of rekenen. Herschrijven naar duidelijke taal is dus geen bijzaak, en het is de Nederlandse taak waar deze modellen het slechtst op scoren.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Kun je een Nederlandse benchmark vertrouwen?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Een Nederlandse benchmark is maar deels te vertrouwen, en het scheelt om te weten welk deel. Twee van de negen Nederlandse datasets in EuroEval zijn vertalingen uit het Engels. SQuAD-nl is met Google Translate vertaald, waarna acht studenten de testset met de hand hebben nagelopen. Winogrande-nl is een vertaalde en gefilterde versie van het Engelse origineel. De overige zeven gebruiken echt Nederlands materiaal: boekrecensies van Hebban.nl, Nederlandse WikiHow-artikelen, zinnen uit het SoNaR-corpus.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Maar Nederlandstalig is niet hetzelfde als Nederlands. CoNLL-nl bestaat uit annotaties van de Belgische krant De Morgen uit 2000. INCLUDE-nl bevat Vlaams examenmateriaal, inclusief zinnen over \u201cop kot\u201d zitten. Beide datasets zijn nuttig, maar het is niet het Nederlands van een Groningse gemeente. En maar \u00e9\u00e9n dataset, MultiLoKo-nl, is geschreven om te testen wat een model weet van het Nederlandse leven zelf.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">De oudere Nederlandse benchmark <a href=\"https:\/\/aclanthology.org\/2023.emnlp-main.447\/\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">DUMB<\/a> van de Rijksuniversiteit Groningen wordt in discussies nog vaak aangehaald, maar meet iets anders. DUMB vergelijkt veertien encoder-modellen zoals DeBERTaV3 en XLM-R. Het zegt niets over ChatGPT, Claude of Gemini.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Tot slot vermeldt EuroEval zelf een detail dat telt. De topposities zijn gedraaid op de validation split, en de <a href=\"https:\/\/euroeval.com\/faq#why-do-some-model-names-end-in-val\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">FAQ<\/a> zegt daarover: \u201cthey aren\u2019t strictly comparable to the regular test-split scores\u201d. Kleine verschillen bovenaan zijn dus ruis. Gebruik een leaderboard daarom als vertrekpunt en niet als eindoordeel. Dat geldt ook voor <a href=\"https:\/\/datanorth.ai\/nl\/blog\/llms-evalueren-op-meer-dan-de-benchmarks\" target=\"_blank\" rel=\"noopener\">het evalueren van LLM\u2019s in het algemeen<\/a>.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat publiceren OpenAI, Google en Anthropic over Nederlands?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Alle drie evalueren hun modellen in veel talen, maar vrijwel geen van hen publiceert een Nederlands cijfer dat je kunt aflezen. De meertalige benchmark <a href=\"https:\/\/huggingface.co\/datasets\/openai\/MMMLU\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">MMMLU<\/a> van OpenAI bevat precies veertien talen: Arabisch, Bengaals, Duits, Spaans, Frans, Hindi, Indonesisch, Italiaans, Japans, Koreaans, Portugees, Swahili, Yoruba en Chinees. Nederlands staat er niet tussen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">De <a href=\"https:\/\/platform.claude.com\/docs\/en\/build-with-claude\/multilingual-support\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">meertalige documentatie<\/a> van Anthropic gebruikt diezelfde veertien talen en heeft dus geen Nederlandse regel. Het <a href=\"https:\/\/anthropic.com\/claude-sonnet-4-6-system-card\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">system card van Claude Sonnet 4.6<\/a> gaat verder. Dat document draait Global MMLU over 42 talen en zet Nederlands in de groep talen met veel bronmateriaal, maar rapporteert \u00e9\u00e9n gemiddelde van 91,0 procent voor die hele groep en geen Nederlandse score. Anthropic publiceerde ook <a href=\"https:\/\/www.anthropic.com\/research\/claude-values-models-languages\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">onderzoek naar hoe Claude\u2019s waarden per taal verschuiven<\/a>, over de twintig meestgebruikte talen op Claude.ai, met als bevinding dat Claude \u201cleans toward candor in Dutch\u201d.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Google <a href=\"https:\/\/storage.googleapis.com\/deepmind-media\/gemini\/gemini_3_pro_model_evaluation.pdf\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">evalueert Gemini 3 Pro<\/a> op MMMLU en Global PIQA, zonder Nederlands apart te noemen. Mistral noemt Nederlands wel in zijn <a href=\"https:\/\/docs.mistral.ai\/resources\/languages\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">talenoverzicht<\/a>, in de groep talen met \u201cstrong expected performance\u201d, maar publiceert er geen cijfers bij.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Nederlands duikt dus wel op in de evaluaties van leveranciers, alleen bijna nooit als cijfer. In Global-MMLU van Cohere Labs en in Belebele van Meta heeft Nederlands wel een eigen regel. Wil je een getal, dan zijn onafhankelijke benchmarks nog steeds de plek.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Is een Nederlands of Europees model een veiligere keuze?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Op kwaliteit is een Nederlands of Europees model nog geen betere keuze. Dat is de nuchtere uitkomst van een <a href=\"https:\/\/arxiv.org\/abs\/2608.09925\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">onderzoek van de gemeente Amsterdam<\/a>, gepubliceerd op 10 augustus 2026. De onderzoekers beoordeelden ruim dertig modellen op feitelijkheid, eerlijkheid, bias, energieverbruik, kosten en transparantie over trainingsdata. Op Nederlandse feitelijkheid scoort GPT-5 het hoogst met 0,76. De Nederlandse fine-tunes blijven ver achter: GEITje 7B Ultra komt op 0,39 en Fietje 2 op 0,43. EuroLLM 9B haalt 0,44 en EuroLLM 22B 0,47.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Datzelfde onderzoek levert meteen het beste tegenargument tegen simpel ranken. HonestCityBench, een speciaal gebouwde Nederlandse benchmark van 530 prompts, meet eerlijkheid. Daarop scoort GPT-4o het hoogst met 0,43, terwijl GPT-5 blijft steken op 0,14. De onderzoekers vatten het zo samen: \u201cfactuality and honesty are governed by distinct properties, with high factuality not implying high honesty\u201d. Let wel: het onderzoek gebruikte alleen modellen die via de Azure-omgeving van de gemeente beschikbaar waren, dus Claude ontbreekt.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">De Nederlandse optie kun je bovendien nog niet afnemen. <a href=\"https:\/\/gpt-nl.nl\/\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">GPT-NL<\/a> is een samenwerking van TNO, NFI en SURF met 13,5 miljoen euro van RVO. Het project traint een model van 26 miljard parameters op rechtenvrije Nederlandse data. Momenteel is de <a href=\"https:\/\/huggingface.co\/GPT-NL\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">HuggingFace-organisatie<\/a> nog leeg en is het model alleen beschikbaar voor de launching customers van GPT-NL. De eigen <a href=\"https:\/\/gpt-nl.nl\/publish\/pages\/9062\/gptnl-rap-25-008_definition_of_success_final_v2_4-11.pdf\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">doelstelling<\/a> is eerlijk over de ambitie: het project mikt op prestaties die vergelijkbaar zijn met \u201cthe Llama2 7B model and GPT-3 175B (or equivalent) models\u201d.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">E\u00e9n cijfer gaat tegen dit patroon in. Op Duidelijke Taal scoort EuroLLM-9B-Instruct met 56,6 hoger dan elk commercieel topmodel in onze tabel. Europese modellen zijn dus niet overal zwakker. Ze zijn zwak op andere onderdelen. Wie open weights overweegt, vindt in <a href=\"https:\/\/datanorth.ai\/nl\/blog\/de-beste-open-source-llm\" target=\"_blank\" rel=\"noopener\">ons overzicht van open-source LLM\u2019s<\/a> de bredere afweging.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Nog een les: van GEITje, het bekendste Nederlandse model, zijn de oorspronkelijke gewichten ingetrokken. Op de modelpagina staat dat alle gewichten en checkpoints zijn verwijderd op dringend verzoek van Stichting BREIN. In zijn <a href=\"https:\/\/goingdutch.ai\/nl\/posts\/geitje-takedown\/\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">takedownbericht<\/a> legt maker Edwin Rijgersberg uit dat het Nederlandse trainingscorpus auteursrechtelijk beschermd materiaal bevatte.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Wat kost Nederlands extra?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Nederlands kost meer tokens dan Engels voor dezelfde inhoud. Dat verschil is wel kleiner dan een paar jaar geleden. Wij hebben het gemeten op het Europarl-corpus met 4.747 parallelle zinsparen. Met de oude GPT-4-tokenizer (cl100k_base) had de Nederlandse tekst 56 procent meer tokens nodig dan de Engelse. Met de tokenizer van alle huidige OpenAI-modellen (o200k_base) is dat nog 16 procent.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Die 16 procent kost je op twee plekken: je betaalt per token, en je <a href=\"https:\/\/datanorth.ai\/nl\/blog\/tokens-in-ai-wat-zijn-ze-en-waarom-bepalen-ze-de-kosten\" target=\"_blank\" rel=\"noopener\">contextvenster<\/a> raakt sneller vol. Lange samenstellingen zijn het duurst. \u201cArbeidsongeschiktheidsverzekering\u201d kost acht tokens, tegenover drie voor \u201cdisability insurance\u201d.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Schaarste aan Nederlandse tekst is niet het probleem. In de laatste <a href=\"https:\/\/commoncrawl.github.io\/cc-crawl-statistics\/plots\/languages\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">Common Crawl-meting<\/a> (CC-MAIN-2026-34) is 1,78 procent van de pagina\u2019s Nederlands, goed voor plek elf van 161 talen. Er is genoeg Nederlands op het web. Er is te weinig Nederlandse evaluatie.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img decoding=\"async\" width=\"1152\" height=\"547\" src=\"https:\/\/datanorth.ai\/wp-content\/uploads\/2026\/09\/which-ai-funding-route-fits-you-3-1.jpg\" alt=\"which ai funding route fits you (3)\" class=\"wp-image-3444394\" srcset=\"https:\/\/datanorth.ai\/wp-content\/uploads\/2026\/09\/which-ai-funding-route-fits-you-3-1.jpg 1152w, https:\/\/datanorth.ai\/wp-content\/uploads\/2026\/09\/which-ai-funding-route-fits-you-3-1-1024x486.jpg 1024w, https:\/\/datanorth.ai\/wp-content\/uploads\/2026\/09\/which-ai-funding-route-fits-you-3-1-300x142.jpg 300w, https:\/\/datanorth.ai\/wp-content\/uploads\/2026\/09\/which-ai-funding-route-fits-you-3-1-767x364.jpg 767w\" sizes=\"(max-width: 1152px) 100vw, 1152px\" \/><figcaption class=\"wp-element-caption\"><em>De modelkeuze doet er pas toe zodra er Nederlandse feiten bij komen kijken.<\/em><\/figcaption><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\">Hoe kies je een model voor Nederlandstalig werk?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Je begint bij de taak en niet bij het leaderboard. Deze volgorde werkt in de praktijk:<\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li>Bepaal welke van de drie vaardigheden je nodig hebt. Gaat het om taal verwerken, dan voldoet vrijwel elk actueel model en kies je op prijs en latency. Gaat het om Nederlandse feiten, personen of regelgeving, dan is de modelkeuze bepalend.<\/li>\n\n\n\n<li>Reken voor kennis over Nederland nooit op het model zelf. Het verschil van 62 punten op MultiLoKo-nl verdwijnt grotendeels als je de feiten zelf aanlevert, via RAG of een vaste bron. Vertrouw niet op wat het model onthouden heeft.<\/li>\n\n\n\n<li>Toets op je eigen materiaal. Neem vijftig echte stukken tekst uit je organisatie, met je eigen jargon en afkortingen, en laat twee of drie modellen dezelfde opdracht doen.<\/li>\n\n\n\n<li>Laat een mens het beoordelen als het om duidelijke taal gaat. De scores zijn hier de laagste van alle Nederlandse taken, dus een redactieslag blijf je nodig hebben.<\/li>\n\n\n\n<li>Kijk daarna pas naar de randvoorwaarden: dataresidentie, kosten per token en wat de <a href=\"https:\/\/datanorth.ai\/nl\/blog\/eu-ai-act-augustus-2026-de-stapsgewijze-compliance-checklist-voor-ondernemingen\" target=\"_blank\" rel=\"noopener\">AI Act sinds augustus 2026 van je vraagt<\/a>.<\/li>\n<\/ol>\n\n\n\n<h2 class=\"wp-block-heading\">Veelgestelde vragen (FAQ)<\/h2>\n\n\n\n<div class=\"wp-block-wpseopress-faq-block-v2 is-layout-flow wp-block-wpseopress-faq-block-v2-is-layout-flow\">\n<details id=\"welk-ai-model-is-het-beste-in-het-nederlands\" class=\"wp-block-details is-layout-flow wp-block-details-is-layout-flow\"><summary><strong>Welk AI-model is het beste in het Nederlands?<\/strong><\/summary>\n<p class=\"wp-block-paragraph\">Van de modellen die EuroEval heeft getest, voert Gemini 3.7 Flash het Nederlandse leaderboard aan met een rank score van 1,24. Nieuwere modellen als Gemini 3.8 Flash en GPT-6 Astra staan er nog niet op. Voor puur taalwerk ontlopen de topmodellen elkaar nauwelijks; voor kennis van Nederland is het verschil groot.<\/p>\n<\/details>\n\n\n\n<details id=\"kan-chatgpt-goed-nederlands\" class=\"wp-block-details is-layout-flow wp-block-details-is-layout-flow\"><summary><strong>Kan ChatGPT goed Nederlands?<\/strong><\/summary>\n<p class=\"wp-block-paragraph\">Ja, ChatGPT verwerkt Nederlands goed. Op Nederlandse sentimentclassificatie scoort gpt-5.6-sol 93,6 van de 100, net als de andere topmodellen. Op kennis van specifiek Nederlandse onderwerpen komt het model op 67,5, waar de Gemini Flash-modellen boven de 81 uitkomen. Voor feitelijke vragen over Nederland is dat een merkbaar verschil.<\/p>\n<\/details>\n\n\n\n<details id=\"is-er-een-goed-nederlands-taalmodel\" class=\"wp-block-details is-layout-flow wp-block-details-is-layout-flow\"><summary><strong>Is er een goed Nederlands taalmodel?<\/strong><\/summary>\n<p class=\"wp-block-paragraph\">Er is nog geen Nederlands taalmodel dat het niveau van de internationale modellen haalt. GPT-NL van TNO, NFI en SURF is in training en alleen beschikbaar voor launching customers. De Nederlandse fine-tunes GEITje 7B Ultra en Fietje 2 scoren in het Amsterdamse onderzoek lager op Nederlandse feitelijkheid dan grote algemene modellen.<\/p>\n<\/details>\n\n\n\n<details id=\"waarom-staan-er-geen-nederlandse-cijfers-in-de-benchmarks-van-openai-en-anthropic\" class=\"wp-block-details is-layout-flow wp-block-details-is-layout-flow\"><summary><strong>Waarom staan er geen Nederlandse cijfers in de benchmarks van OpenAI en Anthropic?<\/strong><\/summary>\n<p class=\"wp-block-paragraph\">De meertalige benchmark MMMLU van OpenAI bevat veertien talen en Nederlands zit daar niet bij. Anthropic gaat verder: het system card van Claude Sonnet 4.6 draait Global MMLU over 42 talen met Nederlands erbij, maar rapporteert alleen het groepsgemiddelde en geen Nederlands cijfer. Voor Nederlandse getallen blijf je aangewezen op onafhankelijke benchmarks zoals EuroEval.<\/p>\n<\/details>\n\n\n\n<details id=\"kost-nederlands-meer-dan-engels-bij-een-ai-model\" class=\"wp-block-details is-layout-flow wp-block-details-is-layout-flow\"><summary><strong>Kost Nederlands meer dan Engels bij een AI-model?<\/strong><\/summary>\n<p class=\"wp-block-paragraph\">Ja, Nederlands kost ongeveer 16 procent meer tokens voor dezelfde inhoud met de huidige OpenAI-tokenizer, gemeten op een parallel corpus van 4.747 zinsparen. Met de oudere GPT-4-tokenizer was dat nog 56 procent. Je betaalt per token, dus dat verschil werkt door in je kosten en in hoe snel je contextvenster vol raakt.<\/p>\n<\/details>\n<\/div>\n<script type=\"application\/ld+json\">{\"@context\":\"https:\/\/schema.org\",\"@type\":\"FAQPage\",\"url\":\"https:\/\/datanorth.ai\/nl\/blog\/welk-ai-model-is-het-beste-in-nederlands\",\"@id\":\"https:\/\/datanorth.ai\/nl\/blog\/welk-ai-model-is-het-beste-in-nederlands\",\"mainEntity\":[{\"@type\":\"Question\",\"url\":\"https:\/\/datanorth.ai\/nl\/blog\/welk-ai-model-is-het-beste-in-nederlands#welk-ai-model-is-het-beste-in-het-nederlands\",\"name\":\"Welk AI-model is het beste in het Nederlands?\",\"answerCount\":1,\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"\\u003Cp\\u003EVan de modellen die EuroEval heeft getest, voert Gemini 3.7 Flash het Nederlandse leaderboard aan met een rank score van 1,24. Nieuwere modellen als Gemini 3.8 Flash en GPT-6 Astra staan er nog niet op. Voor puur taalwerk ontlopen de topmodellen elkaar nauwelijks; voor kennis van Nederland is het verschil groot.\\u003C\/p\\u003E\"}},{\"@type\":\"Question\",\"url\":\"https:\/\/datanorth.ai\/nl\/blog\/welk-ai-model-is-het-beste-in-nederlands#kan-chatgpt-goed-nederlands\",\"name\":\"Kan ChatGPT goed Nederlands?\",\"answerCount\":1,\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"\\u003Cp\\u003EJa, ChatGPT verwerkt Nederlands goed. Op Nederlandse sentimentclassificatie scoort gpt-5.6-sol 93,6 van de 100, net als de andere topmodellen. Op kennis van specifiek Nederlandse onderwerpen komt het model op 67,5, waar de Gemini Flash-modellen boven de 81 uitkomen. Voor feitelijke vragen over Nederland is dat een merkbaar verschil.\\u003C\/p\\u003E\"}},{\"@type\":\"Question\",\"url\":\"https:\/\/datanorth.ai\/nl\/blog\/welk-ai-model-is-het-beste-in-nederlands#is-er-een-goed-nederlands-taalmodel\",\"name\":\"Is er een goed Nederlands taalmodel?\",\"answerCount\":1,\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"\\u003Cp\\u003EEr is nog geen Nederlands taalmodel dat het niveau van de internationale modellen haalt. GPT-NL van TNO, NFI en SURF is in training en alleen beschikbaar voor launching customers. De Nederlandse fine-tunes GEITje 7B Ultra en Fietje 2 scoren in het Amsterdamse onderzoek lager op Nederlandse feitelijkheid dan grote algemene modellen.\\u003C\/p\\u003E\"}},{\"@type\":\"Question\",\"url\":\"https:\/\/datanorth.ai\/nl\/blog\/welk-ai-model-is-het-beste-in-nederlands#waarom-staan-er-geen-nederlandse-cijfers-in-de-benchmarks-van-openai-en-anthropic\",\"name\":\"Waarom staan er geen Nederlandse cijfers in de benchmarks van OpenAI en Anthropic?\",\"answerCount\":1,\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"\\u003Cp\\u003EDe meertalige benchmark MMMLU van OpenAI bevat veertien talen en Nederlands zit daar niet bij. Anthropic gaat verder: het system card van Claude Sonnet 4.6 draait Global MMLU over 42 talen met Nederlands erbij, maar rapporteert alleen het groepsgemiddelde en geen Nederlands cijfer. Voor Nederlandse getallen blijf je aangewezen op onafhankelijke benchmarks zoals EuroEval.\\u003C\/p\\u003E\"}},{\"@type\":\"Question\",\"url\":\"https:\/\/datanorth.ai\/nl\/blog\/welk-ai-model-is-het-beste-in-nederlands#kost-nederlands-meer-dan-engels-bij-een-ai-model\",\"name\":\"Kost Nederlands meer dan Engels bij een AI-model?\",\"answerCount\":1,\"acceptedAnswer\":{\"@type\":\"Answer\",\"text\":\"\\u003Cp\\u003EJa, Nederlands kost ongeveer 16 procent meer tokens voor dezelfde inhoud met de huidige OpenAI-tokenizer, gemeten op een parallel corpus van 4.747 zinsparen. Met de oudere GPT-4-tokenizer was dat nog 56 procent. Je betaalt per token, dus dat verschil werkt door in je kosten en in hoe snel je contextvenster vol raakt.\\u003C\/p\\u003E\"}}]}<\/script>\n\n\n<p class=\"wp-block-paragraph\">Wil je weten welk model het beste past bij jullie Nederlandstalige processen? In een <a href=\"https:\/\/datanorth.ai\/nl\/dienst\/assessment\/kunstmatige-intelligentie\" target=\"_blank\" rel=\"noopener\">AI Assessment<\/a> toetsen we modellen op jullie eigen documenten en data, en in onze <a href=\"https:\/\/datanorth.ai\/nl\/dienst\/consulting\/kunstmatige-intelligentie\" target=\"_blank\" rel=\"noopener\">AI-consultancy<\/a> begeleiden we de keuze en de implementatie.<\/p>\n\n\n<div class=\"brxe-container newsletter-sign-up-blog\"><div class=\"brxe-div newsletter-sign-up-blog__headings-div\"><div class=\"brxe-div newsletter-sign-up-blog__heading-icon-div\"><i id=\"brxe-xdnylt\" class=\"fa fa-envelope brxe-icon newsletter-sign-up-blog__icon\"><\/i><div class=\"brxe-heading newsletter-sign-up-blog__heading\">Schrijf je in voor onze Nieuwsbrief<\/div><\/div><div id=\"brxe-yrmmzb\" class=\"brxe-heading newsletter-sign-up-blog__subheading\">Blijf op de hoogte van onze nieuwste AI blogs, onderzoeken, diensten en nog veel meer!<\/div><\/div><div class=\"brxe-shortcode newsletter-sign-up-blog__shortcode form--light\"><div class='fluentform ff-default fluentform_wrapper_15 ffs_default_wrap'><form data-form_id=\"15\" id=\"fluentform_15\" class=\"frm-fluent-form fluent_form_15 ff-el-form-top ff_form_instance_15_1 ff-form-loading ffs_default\" data-form_instance=\"ff_form_instance_15_1\" method=\"POST\" ><fieldset  style=\"border: none!important;margin: 0!important;padding: 0!important;background-color: transparent!important;box-shadow: none!important;outline: none!important; min-inline-size: 100%;\">\n                    <legend class=\"ff_screen_reader_title\" style=\"display: block; margin: 0!important;padding: 0!important;height: 0!important;text-indent: -999999px;width: 0!important;overflow:hidden;\">Newsletter Sign Up Form (Blog) (NL)<\/legend><input type='hidden' name='__fluent_form_embded_post_id' value='3444308' \/><input type=\"hidden\" id=\"_fluentform_15_fluentformnonce\" name=\"_fluentform_15_fluentformnonce\" value=\"ee0a55c2b9\" \/><input type=\"hidden\" name=\"_wp_http_referer\" value=\"\/nl\/wp-json\/wp\/v2\/posts\/3444308\" \/><div class='ff-el-group ff-el-form-hide_label'><div class=\"ff-el-input--label ff-el-is-required asterisk-right\"><label for='ff_15_email' id='label_ff_15_email' aria-label=\"Email\">Email<\/label><\/div><div class='ff-el-input--content'><input type=\"email\" name=\"email\" id=\"ff_15_email\" class=\"ff-el-form-control\" placeholder=\"E-mailadres\" data-name=\"email\"  aria-invalid=\"false\" aria-required=true><\/div><\/div><div class='ff-el-group ff-el-form-hide_label'><div class=\"ff-el-input--label ff-el-is-required asterisk-right\"><label   aria-label=\"Radio Field\">Radio Field<\/label><\/div><div class='ff-el-input--content'><div class='ff-el-form-check ff-el-form-check-'><label class='ff-el-form-check-label' for='input_radio_8307262e5e334fa15d89f1c9b89e565e'><input  type=\"radio\" name=\"input_radio\" data-name=\"input_radio\" class=\"ff-el-form-check-input ff-el-form-check-radio\" value=\"Ik wil graag marketing gerelateerde e-mails ontvangen van DataNorth\"  id='input_radio_8307262e5e334fa15d89f1c9b89e565e' aria-label='Ik wil graag marketing gerelateerde e-mails ontvangen van DataNorth' aria-invalid='false' aria-required=true> <span>Ik wil graag marketing gerelateerde e-mails ontvangen van DataNorth<\/span><\/label><\/div><\/div><\/div><div class='ff-el-group ff-text-left ff_submit_btn_wrapper'><button type=\"submit\" class=\"ff-btn ff-btn-submit ff-btn-md ff_btn_style\"  aria-label=\"Aanmelden!\">Aanmelden!<\/button><\/div><\/fieldset><\/form><div id='fluentform_15_errors' class='ff-errors-in-stack ff_form_instance_15_1 ff-form-loading_errors ff_form_instance_15_1_errors'><\/div><\/div>            <script type=\"text\/javascript\">\n                window.fluent_form_ff_form_instance_15_1 = {\"id\":\"15\",\"ajaxUrl\":\"https:\\\/\\\/datanorth.ai\\\/wp-admin\\\/admin-ajax.php\",\"settings\":{\"layout\":{\"labelPlacement\":\"top\",\"helpMessagePlacement\":\"with_label\",\"errorMessagePlacement\":\"inline\",\"cssClassName\":\"\",\"asteriskPlacement\":\"asterisk-right\"},\"restrictions\":{\"denyEmptySubmission\":{\"enabled\":false}}},\"form_instance\":\"ff_form_instance_15_1\",\"form_id_selector\":\"fluentform_15\",\"rules\":{\"email\":{\"required\":{\"value\":true,\"message\":\"This field is required\",\"global_message\":\"This field is required\",\"global\":true},\"email\":{\"value\":true,\"message\":\"This field must contain a valid email\",\"global_message\":\"This field must contain a valid email\",\"global\":true}},\"input_radio\":{\"required\":{\"value\":true,\"message\":\"This field is required\",\"global_message\":\"This field is required\",\"global\":true}}},\"debounce_time\":300,\"file_upload_settings\":[]};\n                            <\/script>\n            <\/div><\/div>\n","protected":false},"excerpt":{"rendered":"<p>Gemini 3.7 Flash voert het EuroEval-leaderboard aan, maar de ranglijst vertelt niet het hele verhaal. De topmodellen liggen op Nederlandse taalvaardigheid slechts 2,5 punt uit elkaar, terwijl het verschil op kennis van Nederland oploopt tot 62 punten. Bekijk de volledige scores, wat de benchmarks precies meten en hoe je zelf test welk model het beste presteert op jouw eigen materiaal.<\/p>\n","protected":false},"author":22,"featured_media":3444637,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"_seopress_titles_title":"Beste AI-model voor Nederlandse taal - DataNorth AI","_seopress_titles_desc":"Welk AI model kan het best Nederlands? We bekijken de cijfers, de benchmarks, en hoe je zelf toetst welk model jouw Nederlandstalige werk aankan.","_seopress_robots_index":"","_seopress_robots_follow":"","_seopress_robots_imageindex":"","_seopress_robots_snippet":"","_seopress_robots_primary_cat":"","_seopress_robots_breadcrumbs":"","_seopress_robots_freeze_modified_date":"","_seopress_robots_custom_modified_date":"","_seopress_robots_canonical":"","_seopress_social_fb_title":"","_seopress_social_fb_desc":"","_seopress_social_fb_img":"","_seopress_social_fb_img_attachment_id":0,"_seopress_social_fb_img_width":0,"_seopress_social_fb_img_height":0,"_seopress_social_twitter_title":"","_seopress_social_twitter_desc":"","_seopress_social_twitter_img":"","_seopress_social_twitter_img_attachment_id":0,"_seopress_social_twitter_img_width":0,"_seopress_social_twitter_img_height":0,"_seopress_redirections_value":"","_seopress_redirections_enabled":"","_seopress_redirections_enabled_regex":"","_seopress_redirections_logged_status":"","_seopress_redirections_param":"","_seopress_redirections_type":0,"_seopress_analysis_target_kw":"","_seopress_news_disabled":"","_seopress_video_disabled":"","_seopress_video":[],"_seopress_pro_schemas_manual":[],"_seopress_pro_rich_snippets_disable_all":"","_seopress_pro_rich_snippets_disable":[],"_seopress_pro_schemas":[],"footnotes":""},"categories":[7],"tags":[],"class_list":["post-3444308","post","type-post","status-publish","format-standard","has-post-thumbnail","category-geen-onderdeel-van-een-categorie"],"meta_box":{"faq_item":[]},"_links":{"self":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/posts\/3444308","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/users\/22"}],"replies":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/comments?post=3444308"}],"version-history":[{"count":3,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/posts\/3444308\/revisions"}],"predecessor-version":[{"id":3444641,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/posts\/3444308\/revisions\/3444641"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media\/3444637"}],"wp:attachment":[{"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/media?parent=3444308"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/categories?post=3444308"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/datanorth.ai\/nl\/wp-json\/wp\/v2\/tags?post=3444308"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}