Geplubliceerd: 18 september 2026
PrismML bracht op 17 september 2026 Ternary Bonsai 2 27B uit, een gecomprimeerde versie van Alibaba’s Qwen3.8 27B die in 5,9 GB past en 98,2 procent van het benchmarkgemiddelde van het origineel behoudt. Dat is ongeveer negen keer kleiner dan het volledige model, klein genoeg om een redeneermodel van 27B op een laptop of op één consumenten-GPU te draaien. De gewichten staan op Hugging Face onder de Apache 2.0-licentie.
Wat is Ternary Bonsai 2 27B?
Het is geen nieuw model dat vanaf nul is getraind. PrismML nam Qwen3.8 27B en herschreef de gewichten, de getallen die een model tijdens de training leert, als ternaire waarden: elk gewicht is -1, 0 of +1. Een gewoon gewicht neemt 16 bits opslag in. Een ternair gewicht ongeveer 1,7 bits, waardoor het taalmodel krimpt van ruwweg 54 GB naar 5,9 GB terwijl de architectuur gelijk blijft.
Het model behoudt wat het basismodel kan: een contextvenster van 262K tokens, tekst en beeld als invoer, een denkmodus en tool calling. Het visuele deel wordt als apart bestand van 0,63 GB geleverd dat je alleen laadt als je afbeeldingen meestuurt, zodat je bij tekstgebruik nooit voor betaalt.
Dit is de tweede generatie. De eerste Bonsai 27B, uitgebracht in juli 2026, behield 95 procent van het benchmarkgemiddelde van zijn basismodel. Bonsai 2 27B brengt dat op een sterkere basis naar 98,2 procent, en daarom noemt PrismML het vrijwel verliesvrij. Die claim verdient een nauwkeurige lezing, zoals de tabel hieronder laat zien.
Benchmarks van Ternary Bonsai 2 27B tegenover Qwen3.8 27B
De compressie kost vrijwel niets op wiskunde, programmeren en het opvolgen van instructies. Het verlies zit in kennis, redeneren en beeldbegrip.
| Wat wordt gemeten | Bonsai 2 27B (5,9 GB) | Qwen3.8 27B (volledige precisie, 54 GB) |
|---|---|---|
| Wiskunde (GSM8K, MATH-500, AIME 2025 en 2026) | 96,57 | 97,06 |
| Programmeren (HumanEval+, MBPP+, LiveCodeBench) | 89,42 | 89,07 |
| Instructies opvolgen (IFEval, IFBench) | 82,66 | 81,25 |
| Agentisch tools aanroepen (BFCL v3) | 74,92 | 76,74 |
| Kennis en redeneren (MMLU-Redux, MuSR) | 79,86 | 85,55 |
| Beeldbegrip (MMMU-Pro, OCR Bench v2) | 66,19 | 71,36 |
| Totaal, 14 benchmarks | 84,78 | 86,32 |
Dit zijn de eigen cijfers van PrismML, gedraaid met EvalScope en vLLM op een NVIDIA H100 in denkmodus, met identieke instellingen voor beide modellen. Een onafhankelijke evaluatie bestaat nog niet. Het kennisverlies is echt: MuSR, een test van redeneren over lange verhalen, zakt negen punten, en OCR Bench v2, dat tekst in afbeeldingen leest, zakt vier punten.
De meer zeggende vergelijking is die met gewone kwantisatie, de standaardmanier om een model te verkleinen. Een conventionele 2-bit versie van dezelfde Qwen3.8 27B (IQ2_XXS, 9,4 GB) scoort 72,59 op dezelfde 14 benchmarks en stort in op de moeilijke tests, tot 57,5 op AIME 2026. Een 4-bit versie (UD-Q4_K_XL, 17,6 GB) scoort 85,18. Bonsai 2 27B komt binnen 0,4 punt van die 4-bit versie, op een derde van de omvang.
Hoe snel Ternary Bonsai 2 27B draait en wat je nodig hebt
- Licentie: Apache 2.0, vrij voor commercieel gebruik
- Download: Hugging Face, collectie prism-ml/bonsai-2, als GGUF voor llama.cpp en als MLX voor Apple Silicon
- Omvang: 5,95 GB (PTQ1_0-verpakking) of 7,21 GB (PQ2_0-verpakking), plus het optionele beeldbestand van 0,63 GB
- Runtime: de eigen fork van llama.cpp van PrismML op CUDA, Metal en CPU; de standaardversie van llama.cpp laadt deze bestanden niet
- Snelheid: ongeveer 130 tokens per seconde op een RTX 5090, 81 tot 91 op een RTX 4090, 47 op een MacBook met M5 Max en 28 op een M5 Pro
- Context: 262K tokens, zowel op de kaarten van 24 GB en 32 GB als op de laptops hierboven
PrismML publiceert ook een energiecijfer: 0,581 mWh per token op een RTX 4090, volgens het bedrijf 40 procent minder dan een 8B-model op volledige precisie. Op de M5 Pro-laptop trekt de GPU 27,5 W tijdens het genereren, tegenover 300 tot 455 W bordvermogen voor de NVIDIA-kaarten. De twee verpakkingen ruilen omvang tegen snelheid: het kleinere PTQ1_0-bestand is sneller op kaarten van de RTX 4090-klasse, het grotere PQ2_0-bestand is sneller op H100, A100 en de Blackwell-kaarten.
Wat PrismML niet vertelt over Bonsai 2 27B
Elke vergelijking in de release is met andere versies van hetzelfde 27B-model. De vraag die een koper echt heeft is een andere: is een gecomprimeerde 27B bij 6 GB beter dan een natief 8B- of 9B-model dat naar 4 bits is gekwantiseerd en ongeveer evenveel geheugen vraagt? PrismML noemt die concurrent nergens en geeft er geen score van. De energieclaim van 40 procent verwijst naar “een 8B-model” zonder te zeggen welk.
De afhankelijkheid van de runtime weegt zwaarder dan het lijkt. De bestanden hebben de fork van llama.cpp van PrismML nodig, en de modelkaart waarschuwt dat de standaardversie ze weigert of laadt en onzin produceert. Zolang de ternaire kernels niet in de hoofdversie zitten, draaien Ollama, LM Studio en de andere tools die je team al gebruikt dit model niet zonder de binaries van PrismML. Twee van de drie snelheidscijfers voor Apple zijn bovendien gemeten op een oudere build en staan gemarkeerd als nog opnieuw te meten.
Wat dit betekent
Dit is nu het testen waard als je een capabel model nodig hebt op hardware die je al hebt en je geen data naar de cloud kunt sturen. Denk aan een kantoor met drie advocaten dat klantdocumenten op MacBooks analyseert, een team van vier ontwikkelaars dat een codeeragent draait op een werkstation met één RTX 4090, of een product dat een model in een app moet meeleveren. Programmeren is gelijk aan het volledige model en wiskunde zit binnen een half punt, en dat is het deel van de score dat voor agents telt. Test eerst je eigen codeerloop, met Cline of een vergelijkbare agent, en zet die naast de 4-bit Qwen3.8 27B als je de 18 GB hebt om die te draaien. Heb je dat geheugen wel, dan scoort de 4-bit versie 0,4 punt hoger, dus de zaak voor Bonsai 2 27B is het sterkst onder 12 GB of wanneer je ruimte wilt voor langere contexten en batches.
Bouw er nog geen product op. De fork van llama.cpp is een onderhoudsrisico, de scores op kennis en beeldbegrip zijn wel degelijk gezakt, en elk cijfer hier komt van PrismML zelf. Wat de release het volgen waard maakt is het patroon: na Edge0 dat eerder deze maand een 35B-model vanaf SSD streamde en MiniCPM5-2B van OpenBMB beweegt de on-device kant van de markt sneller dan de frontier-kant. PrismML zegt dat zijn volgende gecomprimeerde modellen binnen een paar maanden in de klasse van enkele honderden miljarden parameters zitten. Als die ook 98 procent behouden, verandert de rekensom voor het draaien van open modellen op eigen hardware voor iedereen.
Voor meer informatie, bekijk de officiële aankondiging van Ternary Bonsai 2 27B op de blog van PrismML.