Gepubliceerd: 20 augustus 2026
Ornith bracht op 19 augustus 2026 Ornith-1.5 uit, een modelfamilie met open gewichten onder de MIT-licentie in 397B en 35B mixture-of-experts en 9B dense. In eigen metingen van Ornith scoort de 397B 86,1 op Terminal-Bench 2.1 tegenover 85,0 voor Claude Opus 4.8. De gewichten van alle formaten staan al klaar op Hugging Face.
Wat is Ornith-1.5 en hoe is het getraind?
Ornith-1.5 is een modelfamilie voor programmeren en agentisch werk van DeepReinforce, het team achter Ornith-1.0 uit juni 2026. Er zijn drie formaten: een 397B mixture-of-experts als vlaggenschip, een 35B mixture-of-experts die 3B parameters per token activeert, en een 9B dense model met een gekwantiseerde Mobile-versie voor iPhone en Android.
De trainingsmethode is waar Ornith op inzet. In plaats van een vaste set door mensen geschreven taken bedenkt het model zijn eigen taken, bouwt het per taak een scaffold en genereert het de oplossingen die als leersignaal dienen. De beloning vermenigvuldigt validiteit, nieuwheid en moeilijkheid, met een streefwaarde van 0,2 slagingskans.
Benchmarks, contextvenster en licentie van Ornith-1.5
- De 397B haalt 86,0 op SWE-bench Verified,
- 92,8 op GPQA Diamond,
- 86,6 op BrowseComp.
Het contextvenster is 262.144 tokens en is met YaRN-schaling op factor 4,0 uit te breiden naar ongeveer 1M. Alle cijfers komen uit eigen runs van Ornith, gemiddeld over vijf pogingen, met per benchmark de harness en instellingen erbij.
- De 35B komt op 68,5 op Terminal-Bench 2.1,
- 79,0 op SWE-bench Verified met 3B actieve parameters.
- De 9B haalt 47,0 op Terminal-Bench 2.1,
- 70,6 op SWE-bench Verified.
Alle formaten verschijnen onder de MIT-licentie in BF16, FP8, NVFP4, GGUF en MLX. Er is geen gehoste API en geen gepubliceerde prijslijst.
Hoe verhoudt Ornith-1.5 zich tot Claude Opus 4.8 en Kimi K3?
Tegenover Claude Opus 4.8 is het beeld gemengd en geen duidelijke winst. Ornith-1.5-397B wint op Terminal-Bench 2.1, SWE-bench Verified, WideSearch en SWE-bench Multilingual, en verliest op de zwaardere agentische onderdelen: 13,5 tegen 21,1 op Frontier-Bench v0.1, 59,5 tegen 69,7 op NL2Repo en 56,0 tegen 59,0 op DeepSWE.
Kimi K3 blijft met 88,3 op Terminal-Bench 2.1 de leider bij open gewichten, maar dat is een model van 2,8T tegenover 397B. Tegenover GLM-5.2 met 81,0 en DeepSeek-V4-Flash-0731 met 82,7 wint Ornith-1.5 op gelijke of kleinere schaal. Het zijn allemaal cijfers van de leverancier, nog niet onafhankelijk gereproduceerd.
Wie zit er achter Ornith-1.5 en hoe draai je het?
Ornith is de modellijn van DeepReinforce, dat in juni 2026 Ornith-1.0 uitbracht onder MIT in de varianten 9B, 31B, 35B en 397B, na-getraind op checkpoints van Gemma 4 en Qwen 3.5. Reward hacking is een terugkerend thema in het gepubliceerde werk van het team, en Ornith-1.5 trekt die verdediging door naar het genereren van taken.
Draaien vraagt recente runtimes: Transformers 5.8.1, vLLM 0.19.1 of SGLang 0.5.9 en hoger. Het gepubliceerde vLLM-recept voor de 397B gaat uit van tensor-parallellisme over acht GPU’s op één node, bijvoorbeeld acht H200-kaarten van 141GB. GGUF-builds draaien via Ollama en llama.cpp, en het model biedt OpenAI-compatibel tool calling voor agent-CLI’s zoals OpenCode.
Wat dit betekent
Dit is nu het testen waard als je zelf een programmeeragent draait. Een MIT-licentie op een model dat een gesloten vlaggenschip evenaart op Terminal-Bench haalt zowel de rekening per token als de gebruiksvoorwaarden weg. De 35B is het interessantst: agentisch programmeren bijna op vlaggenschipniveau, op hardware die een middelgroot team kan betalen.
Twee kanttekeningen. De 397B vraagt ongeveer 800GB in BF16 en tensor-parallellisme over acht GPU’s, dus dat is een cluster beslissing en geen weekend experiment. En een model dat traint op taken die het zelf heeft bedacht, kent een voor de hand liggend risico. Daarom telt het gat op Frontier-Bench en NL2Repo zwaarder dan de kopscore.
De aankondiging van Ornith, de volledige benchmark tabellen en de model cards staan op de officiële aankondiging van Ornith 1.5 op de Ornith blog.