Home  »  Blog  »  De beste open-source LLMs in 2026

De beste open-source LLMs in 2026

de beste open source llms in 2026

Open-source taalmodellen hebben de kloof met gesloten frontier-modellen grotendeels gedicht. In 2026 is de vraag niet langer “is open-source goed genoeg”, maar “welk open model past bij onze licentievoorwaarden, onze context behoeften en de hardware die we daadwerkelijk hebben.” Dit artikel rangschikt de beste open modellen op precies die drie assen.

Vóór de ranking eerst de licenties. Deze zijn namelijk belangrijker dan de meeste teams beseffen, totdat de juridische controle begint.

Open-source vs open weights

De meeste modellen die als “open-source” in de markt worden gezet, zijn technisch gezien open weights. Het verschil is als volgt:

Open-source (strikt): Weights, trainingscode en trainingsdata zijn allemaal openbaar onder een flexibele licentie. Je kunt ze volledig auditen, opnieuw trainen en herdistribueren. Bijna geen enkel frontier-model komt hiervoor in aanmerking. OLMo van AI2 en Pythia van EleutherAI komen het dichtst in de buurt.

Open weights: De getrainde model weights zijn te downloaden, maar de trainingsdata en de pipeline kunnen privé zijn. Dit is waar Llama, Qwen, Gemma, DeepSeek, Kimi, GLM en Mistral zich allemaal bevinden.

Voor het meeste commerciële werk is het onderscheid academisch. Wat er echt toe doet, is de licentie die aan de weights is gekoppeld.

open source vs open weight nederlands

De licenties die ertoe doen

Apache 2.0

De veiligste optie voor commercieel gebruik. Geen gebruikslimieten, geen royalty’s, geen geografische beperkingen en, cruciaal, een expliciete octrooiverlening (patent grant). Die octrooiverlening is belangrijk in enterprise-contexten; MIT bevat er geen. Qwen 3 en 3.5, Mistral Large 3, Mistral Small 4 en Gemma 4 (26B A4B) worden geleverd onder Apache 2.0.

MIT-licentie

In de praktijk net zo flexibel, met een iets eenvoudigere tekst, maar zonder expliciete octrooiverlening. Kimi K2.6, GLM-4.7, GLM-5, MiMo-V2-Flash, GPT-oss 120B, DeepSeek R1, DeepSeek V4 (Pro en Flash) en Phi-4 gebruiken allemaal MIT. Voor de meeste bedrijven geeft deze licentie nul frictie.

Llama community-licentie (Meta)

Flexibel genoeg voor bijna elk bedrijf, maar met twee specifieke valkuilen:

  • Commercieel gebruik is toegestaan voor organisaties met minder dan 700 miljoen maandelijkse actieve gebruikers. Boven die drempel heb je een aparte licentie van Meta nodig.
  • De Community-licentie van Llama 4 sluit in de EU gevestigde organisaties uit van gebruik onder deze licentievoorwaarden. Voor EU-gevestigde organisaties is dit in de praktijk een harde stop.
  • Naamsvermelding vereist (“Built with Llama”) op afgeleide producten.

Gemma voorwaarden (Google)

Hoewel de voorwaarden van Gemma flexibel lijken, moet je voorzichtig zijn met fine-tuning: het distribueren van een model dat is getraind op bedrijfseigen data creëert onduidelijkheid over de vraag of afgeleide modellen de beperkingen van Google erven. Intern gebruik is veilig, maar extern uitrollen vereist juridische goedkeuring.

Dezelfde kritische blik zou moeten gelden voor de bredere Llama-familie. Alleen focussen op Llama 4 Scout vanwege zijn context window van 10 miljoen tokens gaat voorbij aan cruciale varianten in het ecosysteem. Een volledige evaluatie moet ook Llama 4 Maverick bevatten, dat fungeert als het meer gebalanceerde, beter presterende kernmodel voor redeneren bij standaard workflows, en Behemoth, het enorme 2T-model dat voornamelijk wordt gebruikt voor enterprise distillation-pipelines.

DeepSeek-licentie

Oudere DeepSeek-modellen gebruiken niet altijd een standaard open-source licentie, dus commercieel gebruik moet per model afzonderlijk worden beoordeeld. DeepSeek V4, uitgebracht in april 2026, wordt geleverd onder MIT, wat een duidelijke verbetering is.

Niet-commerciële licenties

Een paar modellen die als “open” op de markt worden gebracht, verbieden commercieel gebruik volledig (Command R+ onder CC-BY-NC, sommige Grok-varianten beperken het gebruik van weights om andere modellen te trainen). Handig voor onderzoek, nutteloos voor producten.

Praktische vuistregel

Als de zuiverheid van de licentie de prioriteit is, zijn de veilige standaardkeuzes Qwen (Apache 2.0), DeepSeek V4 (MIT), GLM-5 (MIT), Mistral (Apache 2.0) of Phi-4 (MIT). Voor alles buiten deze groep moet je de voorwaarden zorgvuldig doorlezen.

Waar de ranking op gebaseerd is

De ranking is gebaseerd op de volgende 3 categorieën:

Context window 

Hoeveel tokens het model in het werkgeheugen kan houden. Dit bepaalt of je documenten, codebases en lange gesprekken in stukken (chunks) moet opbreken, of dat je het geheel in één keer kunt verwerken.

Modelgrootte (parameters) 

Het totale aantal parameters en, voor Mixture-of-Experts (MoE)-architecturen, de actieve parameters per token. Actieve parameters bepalen de inference-kosten; totale parameters bepalen de geheugenbehoeften.

Benodigde hardware 

Welke hardware je in de praktijk nodig hebt om dit model op bruikbare kwaliteit te draaien: een consumenten-GPU, een enkele H100, meerdere H100’s of een volledig datacentercluster.

Deze ranking negeert bewust ruwe benchmarkscores. Een model dat MMLU wint maar acht H100’s nodig heeft, is nutteloos voor een team met een enkel workstation.

De beste open source LLMs ranking

1. De Llama 4-familie

  • Varianten: Llama 4 Scout (The context king), Llama 4 Maverick (The agentic core), Llama 4 Behemoth (The enterprise teacher)
  • Architectuur: Sparse Mixture-of-Experts (MoE) met native multimodaliteit
  • Context windows: 130K tokens (Maverick) tot een toonaangevende 10 miljoen tokens (Scout)
  • Licentie: Llama 4 Community License (let op de EU-beperking)

De model cards van Meta schetsen een zeer gespecialiseerd ecosysteem dat is ontworpen om enterprise-workloads te verdelen. Llama 4 Scout (109B totaal, 17B actief) domineert enorme retrieval-taken en biedt een context window van 10M tokens, wat ideaal is voor reviews van volledige codebases en diepgaande onderzoeksarchieven waar token chunking de analyse verstoort. Llama 4 Maverick (400B totaal, 17B actief over 128 experts) verlegt de focus naar diepgang en fungeert als het beter presterende, meer gebalanceerde kernmodel voor redeneren bij standaard agentic en multi-tool workflows. Aan de absolute grens bevindt zich Llama 4 Behemoth (2T totaal, 288B actief), een gigantisch model dat is gebouwd om te dienen als krachtige teacher-engine voor het genereren van synthetische data en het aandrijven van enterprise distillation-pipelines.

De adder onder het gras: de EU-licentieblokkade. Voor EU-bedrijven introduceren de regionale beperkingen van Meta enorme compliance-horden, waardoor de volledige Llama 4-familie voor de meeste commerciële implementaties afvalt. Het verkrijgen van juridische goedkeuring is een absolute voorwaarde voordat je hier ook maar enige architectuur omheen bouwt.

2. DeepSeek V4 Pro: Het vlaggenschip voor redeneren

  • Context window: 1 miljoen tokens
  • Parameters: 1.6T totaal, 49B actief (MoE)
  • Hardware: 8x H100 80GB-klasse voor full-precision inference; gekwantiseerde varianten op kleinere configuraties
  • Licentie: MIT

DeepSeek V4 Pro is het vlaggenschip model voor maximale prestaties op het gebied van redeneren, coderen en agentic taken. Het model gebruikt een Mixture-of-Experts-architectuur met 1.6 biljoen totale parameters, waarvan ongeveer 49 miljard per token actief zijn, ondersteunt een context window van 1 miljoen tokens en wordt aangeboden onder een MIT-licentie.

3. Kimi K2.6 Thinking: De codeerspecialist

  • Context window: 256K tokens
  • Parameters: 1T totaal, 32B actief (MoE)
  • Hardware: 4x H100 80GB-klasse of gelijkwaardig
  • Licentie: MIT / Modified MIT, afhankelijk van distributiebron

In de momentopname van mei 2026 behoort Kimi K2.6 Thinking tot de sterkste open-weight modellen voor codeer- en agentic coding-workloads. Het model wordt breed gepositioneerd als een topkeuze voor agentic coderen, software engineering en langdurig toolgebruik.

4. DeepSeek V4 Flash: De beste mid-range optie

  • Context window: 1 miljoen tokens
  • Parameters: 284 miljard totaal, 13 miljard actief per token (MoE)
  • Hardware: Een 128 GB Mac Studio kan dit net aan; een enkele H100 met kwantisering
  • Licentie: MIT

De sweet spot voor teams die een model van frontier-klasse willen zonder een enterprise GPU-rack. DeepSeek V4 Flash ondersteunt standaard een context window van 1 miljoen tokens en deelt dezelfde MIT-licentie en MoE-opzet als V4 Pro, maar met een veel lagere geheugenvoetafdruk.

5. Qwen 3.6 / Qwen 3 235B: Het Apache 2.0-werkpaard

  • Context window: Tot 256K tokens
  • Parameters: 235B totaal in het vlaggenschip; kleinere varianten van 1.5B tot 35B
  • Hardware: Enkele H100 voor mid-range; multi-GPU voor 235B
  • Licentie: Apache 2.0 (de meeste varianten)

Qwen is de standaardaanbeveling wanneer de zuiverheid van de licentie belangrijk is. Qwen 3.5 loopt voorop qua redeneren onder de Apache 2.0-modellen. De kleinere Qwen-varianten (1.5B tot 32B onder Apache 2.0) dekken alles af, van on-device deployment tot mid-range GPU-werk. Sterke meertalige ondersteuning.

6. GLM-5.1: De leider op SWE-bench

  • Context window: 128K tokens (uitgebreide varianten beschikbaar)
  • Parameters: Meerdere groottes; vlaggenschip in de honderden miljarden
  • Hardware: Multi-GPU enterprise-klasse
  • Licentie: MIT

GLM-5 scoort 77,8% op SWE-bench Verified, het sterkste codeer-benchmarkresultaat onder open modellen. De juiste keuze als jouw use-case het autonoom oplossen van echte softwarebugs is, in plaats van het vanaf nul genereren van code.

7. Gemma 4 26B A4B: De standaard voor consumentenhardware

  • Context window: 256K tokens
  • Parameters: 26B (MoE, A4B = ongeveer 4B actief per token)
  • Hardware: Draait in 16 GB RAM op Q4, vanaf dag één ondersteund in elke grote lokale inference-stack
  • Licentie: Apache 2.0

Het model dat de meeste lezers daadwerkelijk zullen draaien. Native multimodaliteit, Apache 2.0-licentie, past op een Mac met 16 GB unified memory of een enkele consumenten-GPU. De prestaties zijn niet van het niveau van de reuzen hierboven, maar voor het hardwarebudget is het uitstekend. Let op de fine-tuningvoorwaarden van Gemma als je van plan bent een getunede versie te distribueren.

8. Mistral Large 3 / Small 4: De Europese keuze

  • Context window: 128K tokens
  • Parameters: Small 4 is efficiënt; Large 3 is het vlaggenschip
  • Hardware: Breed scala; Small 4 draait comfortabel op een enkele H100
  • Licentie: Apache 2.0

Zowel Mistral Large 3 als Mistral Small 4 worden nu geleverd onder Apache 2.0, een aanzienlijke verschuiving ten opzichte van de eerdere beperkende licenties van Mistral. Europees bedrijf, geen EU-toegangsproblemen, schone licentie. Voor organisaties die kiezen op basis van rechtsgebied én technische fit, is Mistral het logische startpunt. DataNorth organiseert een speciale Mistral-workshop voor teams die opties voor deployment, fine-tuning en de praktische afwegingen tegenover andere open alternatieven willen evalueren.

9. Phi-4: De on-device optie

  • Context window: 16K tot 128K afhankelijk van de variant
  • Parameters: Vanaf 3.8B (Phi-3.5 Mini) en hoger
  • Hardware: Draait op telefoons en laptops bij kleine groottes
  • Licentie: MIT

Het juiste antwoord wanneer de hardware een laptop, een edge-device of een telefoon is. MIT-licentie, verrassend sterk in redeneren voor zijn grootte, en klein genoeg om binnen een applicatie te verschepen.

Wanneer gebruik je welke open source LLM?

Als je prioriteit … isKies dan
Langst mogelijke contextLlama 4 Scout (let op de EU-licentie)
Maximale kwaliteit van redenerenDeepSeek V4 Pro
Agentic coderenKimi K2.6 Thinking
Echte bugs oplossenGLM-5.1
Schone Apache 2.0-licentieQwen 3 of Mistral
Draaien op een enkel workstationGemma 4 26B of Qwen 3.6-35B-A3B
Draaien op een telefoon of edge-devicePhi-4
Europees rechtsgebied, geen licentierisicoMistral Large 3 of Small 4
Beste prijs/kwaliteit op een gehoste APIDeepSeek V4 Flash

Welke hardware heb je nodig?

Een paar praktische opmerkingen die in benchmark-berichten vaak over het hoofd worden gezien:

  • 8GB VRAM is genoeg voor kleinere 7B- tot 8B-modellen, 24GB VRAM is een praktischere ondergrens voor modellen in de 30B-klasse, en 40GB+ is meestal vereist zodra je in het 70B-terrein komt, tenzij je agressief kwantiseert.
  • 4-bit kwantisering (Q4_K_M) halveert de VRAM-vereisten ruwweg met minimaal kwaliteitsverlies. Llama 3.3 70B op Q4_K_M draait in ongeveer 40GB.
  • Apple Silicon met een hoog unified memory (64GB en meer) is echt levensvatbaar voor middelgrote open modellen. Minder levensvatbaar voor de 100B+-klasse zonder kwantisering.
  • Voor MoE-modellen moeten alle expert weights nog steeds in het geheugen passen, ook al activeert er slechts een fractie per token. Een 1T MoE-model heeft ongeveer 1T parameters aan geheugen nodig, niet 32B.

Conclusie

In 2026 is het kiezen van een open model geen kwestie van “de beste” vinden. Het is een kwestie van het afstemmen op drie beperkingen: de licentie die je juridische team accepteert, het context window dat je workflow daadwerkelijk nodig heeft en het hardwarebudget dat al bestaat of goedgekeurd kan worden.

Voor de meeste MKB’ers en Enterprise-teams is de praktische route hybride: een Gemma 4 of Qwen 3.6 die lokaal draait op bestaande hardware voor gevoelige data en werk met een hoog volume, gecombineerd met een gehoste API naar een open model van frontier-klasse, zoals DeepSeek V4 Flash of Kimi K2.6, voor de moeilijkere taken. Die opzet geeft volledige AVG-controle over de gevoelige workload, voorspelbare kosten voor de bulk-workload en toegang tot frontier-redeneren wanneer het er echt toe doet.

De open-source LLM-stack is eindelijk goed genoeg om serieuze producten op te bouwen. Kies eerst de licentie, daarna het context window en als derde de hardware. De benchmarkcijfers wijzen zich vanzelf uit vanaf dat punt.

Veelgestelde vragen (FAQ’s)

Is open-source daadwerkelijk goed genoeg om gesloten modellen zoals GPT-5 of Claude te vervangen?

Voor de meeste workloads wel. Kimi K2.6 Thinking loopt voorop bij open modellen op het gebied van agentic coderen, DeepSeek V4 Pro concurreert op puur redeneren en GLM-5.1 voert de lijst aan op SWE-bench Verified. Het resterende gat zit voornamelijk in de allermoeilijkste redeneertaken en in de tool-ecosystemen rond de gesloten API’s. Voor 80% van de praktische use-cases (RAG, samenvattingen, classificatie, coderen van gemiddelde complexiteit, agent workflows) is een open model goed genoeg en vaak goedkoper per token.

Kan ik Llama 4 gebruiken als ik in de EU gevestigd ben?

Niet zonder meer. De Community-licentie van Llama 4 blokkeert in de EU gevestigde bedrijven expliciet om de licentievoorwaarden te accepteren. Voor Europese organisaties is dit een harde stop voor commerciële deployment. Oudere Llama 3.x-modellen hebben deze beperking niet, en Qwen, Mistral, DeepSeek V4, GLM-5 en Gemma zijn allemaal haalbare alternatieven zonder het EU-probleem.

Wat is het verschil tussen totale en actieve parameters in een MoE-model?

Totale parameters bepalen hoeveel geheugen het model nodig heeft. Actieve parameters bepalen hoeveel rekenkracht (compute) elk token kost. DeepSeek V4 Pro heeft in totaal 1.6T parameters, maar slechts 49B actieve parameters. Dit betekent dat je genoeg GPU-geheugen nodig hebt voor de volledige 1.6T aan weights, maar dat de inference-kosten per token dichter bij een dichte (dense) 49B-model liggen. Dit is waarom MoE aantrekkelijk is voor gehoste inference en lastig voor lokale deployment: de geheugen eis krimpt niet.

Heb ik echt een H100 nodig om een van deze modellen te draaien?

Nee. Gemma 4 26B A4B draait in 16GB RAM met Q4-kwantisering, wat past op een MacBook Pro of een consumenten-GPU. Phi-4 draait op een telefoon. Qwen 3 heeft varianten vanaf 1.5B en hoger. De H100-vraag is alleen van belang als je kwaliteit van frontier-klasse on-premise wilt draaien. Voor de meeste interne tooling volstaat een workstation met 24GB tot 64GB aan VRAM of unified memory.

Welk model moet ik kiezen als mkb-bedrijf (SME) dat ergens wil beginnen?

Kies standaard voor Gemma 4 26B of Qwen 3 (Apache 2.0, draait op bestaande hardware, geen licentierisico) voor lokale workloads, en combineer dit met een gehoste API naar DeepSeek V4 Flash of Kimi K2.6 voor de moeilijkere taken. Dat geeft je AVG-controle (GDPR-controle) over gevoelige data en frontier-redeneren wanneer je het nodig hebt, zonder dat je je vastlegt aan een H100-cluster.

Is kwantisering veilig te gebruiken in productie?

Voor Q4_K_M en Q5_K_M wel, voor de meeste use-cases. Het kwaliteitsverlies is klein en de geheugenbesparing is ongeveer de helft. Waar het wel uitmaakt, is bij nauwkeurige taken: gestructureerde output, wiskunde, long-context retrieval. Test het op je daadwerkelijke workload voordat je ervan uitgaat dat een gekwantiseerd model zich exact hetzelfde gedraagt als een full-precision model. Valideer voor gevoelige domeinen (medisch, juridisch) met je eigen evaluaties (evals) in plaats van te vertrouwen op geaggregeerde benchmarks.

Hoe controleer ik of een licentie veilig is voor commercieel gebruik?

Drie snelle controles. Ten eerste, noemt de licentie een drempel voor commercieel gebruik (de 700M MAU-clausule van Llama)? Ten tweede, beperkt het op basis van rechtsgebied (Llama 4 en de EU)? Ten derde, wordt de licentie overgedragen naar gefine-tunede afgeleiden die je mogelijk distribueert (de onduidelijkheid bij Gemma)? Apache 2.0 en MIT slagen voor alle drie. Krijg voor al het andere juridische goedkeuring voordat je erop voortbouwt.

Maak DataNorth AI je Google-favoriet