JetBrains bracht op 8 oktober 2026 Mellum2.1 uit, een open codeermodel dat 47% van de bugfixes in SWE-bench Verified oplost. De vorige versie, Mellum2, haalde 2%. Met vooral reinforcement learning maakte JetBrains van een snel model voor code-aanvulling een model dat als coding agent kan werken. In de eigen tests van JetBrains lost Qwen3.5-9B van Alibaba nog steeds meer bugs op.
Mellum2.1 wint op programmeerpuzzels en tool calls, Qwen in echte repositories
Van de 12 miljard parameters van Mellum2.1 draaien er per woord maar 2,5 miljard, een opzet die mixture of experts heet. Bijna al het nieuwe werk zat in reinforcement learning (leren door proberen en belonen), over miljoenen runs in een afgeschermde omgeving. De tabel laat de verdeling zien: Mellum2.1 wint de korte taken, Qwen3.5-9B de lange taken in echte codebases.
| Benchmark | Mellum2.1 | Qwen3.5-9B |
|---|---|---|
| SWE-bench Verified (echte bugfixes uit GitHub) | 47,0 (Mellum2: 2,0) | 50,0 |
| SWE-bench Pro (moeilijkere bugfixes) | 28,0 | 38,0 |
| Terminal-Bench 2.1 (taken op de command line) | 17,4 | 21,7 |
| LiveCodeBench v6 (programmeerpuzzels) | 82,0 | 75,4 |
| BFCL v4 (tools en functies aanroepen) | 62,3 | 58,5 |
| GPQA Diamond (lastige wetenschapsvragen) | 64,6 | 77,8 |
JetBrains testte alle modellen zelf, in thinking mode, en gebruikte voor de agenttests één open-source harness (Pi v0.73.1 met shell- en bestandstools). De vergelijking is daardoor consistent, maar niemand buiten JetBrains heeft hem nog herhaald.
Een model uit Amsterdam dat je volledig op eigen servers draait
Voor Nederlandse organisaties is de herkomst interessant. JetBrains heeft volgens Wikipedia zijn hoofdkantoor in Amsterdam, en Mellum2.1 heeft geen hosted API: je draait het altijd op eigen hardware, dus je broncode verlaat je eigen omgeving niet. Voor teams die door inkoopbeleid geen Chinese modellen zoals Qwen mogen gebruiken, is dat een open alternatief van vergelijkbare grootte. JetBrains noemt geen ondersteuning voor Nederlands, maar voor code speelt dat weinig.
Het snelheidsvoordeel is wel een claim. Op één H200-GPU onder zware belasting levert Mellum2.1 volgens JetBrains bijna twee keer zoveel tokens als Qwen3.5-9B. De exacte waarden staan alleen in een grafiek. Een extra versnelling van 1,6 keer voor losse verzoeken hangt af van een multi-token prediction head (een add-on die meerdere tokens tegelijk voorspelt) die nog niet uit is.
- Model: JetBrains/Mellum2.1-12B-A2.5B-Thinking op Hugging Face
- Licentie: Apache 2.0, commercieel gebruik toegestaan
- Context window: 131.072 tokens
- Draait met: vLLM nu; ondersteuning voor Ollama en LM Studio aangekondigd
- Hosted API en prijs: geen, je draait het op eigen hardware
- Hardware: niet vermeld; de BF16-gewichten vragen zo’n 24 GB (onze schatting)
Draai je Qwen3.5-9B al zelf voor coding agents, houd het dan zo: het scoort hoger op de taken die het meest op dagelijks werk lijken. Mellum2.1 verdient een proef als je veel agents of sub-agents op een vast GPU-budget draait en je code niet buiten de deur mag. Meet dan op je eigen repository, met dezelfde harness voor beide modellen, twee dingen: tokens per seconde en tickets die echt zijn opgelost. Klopt de snelheidsclaim, dan kan iets minder raak bij twee keer zoveel volume de betere keuze zijn voor routinewerk, zoals falende tests repareren.
Voor meer informatie, bekijk de officiële aankondiging van Mellum2.1 op de blog van JetBrains.