Gepubliceerd: 17 augustus 2026
Alibaba bracht op 14 augustus 2026 Qwen3.8-27B uit, een gesloten model met open gewichten dat tekst, beeld en video verwerkt en verschijnt onder de Apache 2.0-licentie. Qwen3.8-27B heeft een native contextvenster van 262.144 tokens dat volgens Alibaba uitbreidbaar is naar 1.000.000 tokens, en is de kleinere metgezel van Qwen3.8-Max, waarvan het Qwen-team twee dagen eerder de gewichten publiceerde. In eigen metingen van Alibaba scoort Qwen3.8-27B 61,7 procent op SWE-bench Pro tegenover 53,4 procent voor Claude Opus 4.6 Max.
Wat kan Qwen3.8-27B?
Qwen3.8-27B is een native vision language model en geen tekstmodel met een adapter erop geschroefd. De gepubliceerde gewichten accepteren tekst, beeld en video als invoer en geven tekst terug, en het Qwen-team levert werkende beeld- en videovoorbeelden mee die tegen het lokale checkpoint draaien. Dat is relevant, omdat vroege berichtgeving over de Qwen3.8-familie de open gewichten omschreef als alleen tekst. Dat klopte voor het Qwen3.8-Max-checkpoint van 12 augustus, maar niet voor Qwen3.8-27B. Het configuratiebestand van Qwen3.8-27B bevat een volledige vision encoder en zet de vlag voor alleen taalmodel op false.
Alibaba positioneert het model voor lokaal agentwerk. In de aankondiging schrijft het Qwen-team dat het model Qwen3.7-Plus in het algemeen overtreft en, in zijn eigen woorden, uitblinkt in praktische programmeer- en kantoorworkflows. De praktische claim is dat een gesloten checkpoint van 27B, dat op een enkele high end consumenten- of workstation-GPU past, nu het soort langlopende tool calling aankan waarvoor eerder een gehost frontiermodel nodig was. Qwen3.8-27B verschijnt ook in een FP8-variant, Qwen3.8-27B-FP8, met fijnmazige FP8-kwantisatie op blokgrootte 128, die volgens Alibaba vrijwel identiek presteert aan het origineel.
Benchmarks en technische specificaties van Qwen3.8-27B
Alibaba noemt 27B als parameteraantal voor het taalmodel. Het gepubliceerde checkpoint telt 27.781.427.952 parameters in BF16 zodra de vision encoder wordt meegeteld, en daar komt het cijfer van 27,78B uit de berichtgeving vandaan. Het model is dicht en geen mixture of experts. Het draait 64 lagen op een verborgen dimensie van 5.120, in een herhalend patroon van drie Gated DeltaNet-blokken op een Gated Attention-blok, en is getraind met multi token prediction. Het contextvenster is native 262.144 tokens en Alibaba documenteert uitbreiding naar 1.000.000 tokens via YaRN, met de kanttekening, uit de eigen modelkaart, dat de gangbare opensourceframeworks YaRN statisch implementeren en daardoor nauwkeurigheid kunnen verliezen op kortere invoer.
De benchmarktabel komt van Alibaba zelf en de harness is vermeld: alle modellen liepen door de Claude Code-harness bij temperatuur 1,0, top_p 0,95 en een contextvenster van 256K, met als enige uitzondering Claude Opus 4.6 Max op SWE-bench Pro, waar Alibaba de officieel gerapporteerde score gebruikt.
- Op die tabel haalt Qwen3.8-27B 61,7 procent op SWE-bench Pro tegenover 53,4 procent voor Claude Opus 4.6 Max, 57,6 procent voor Qwen3.7-Plus en 51,2 procent voor Muse Glimmer-30B van Meta.
- Het scoort 73,0 procent op Terminal Bench 2.1, achter Claude Opus 4.6 Max met 78,2 procent maar ruim voor Muse Glimmer-30B met 51,7 procent.
- De grootste sprong tussen generaties zit op DeepSWE 1.1, waar Qwen3.8-27B 42,2 procent noteert tegenover 13,3 procent voor Qwen3.6-27B.
Bij twee cijfers hoort een kanttekening. De grootste marges van Alibaba staan op QwenSWEBench, met:
- 79,0 procent tegenover 63,8 procent voor Claude Opus 4.6 Max,
- 70,7 procent op CoWorkBench tegenover 68,2 procent.
Beide zijn interne benchmarks met een omschrijving van een regel en zonder gepubliceerde takenlijst of steekproefomvang, dus ze zijn niet onafhankelijk te controleren. Alibaba meldt daarnaast dat het problematische taken in SWE-bench Pro heeft gecorrigeerd en alle baselines opnieuw heeft gemeten op de aangepaste set, en dat het een klein aantal onjuiste ground truth-annotaties in MathVision en CharXiv heeft hersteld. Dat zijn verdedigbare keuzes, maar de scores zijn daardoor niet een op een vergelijkbaar met cijfers op de onaangepaste benchmarks.
Op algemeen redeneren is het beeld gemengder dan de programmeerresultaten suggereren.
- Qwen3.8-27B scoort 89,2 procent op GPQA Diamond tegenover 91,3 procent voor Claude Opus 4.6 Max,
- 30,8 procent op Humanity’s Last Exam tegenover 40,0 procent.
- Het leidt op LiveCodeBench v6 met 90,3 procent tegenover 88,8 procent,
- IFBench met 79,5 procent tegenover 62,5 procent.
- Aan de visuele kant zijn de verschillen groter in het voordeel van Alibaba: 84,3 procent op OSWorld-Verified tegenover 72,7 procent, 81,9 procent op AndroidWorld tegenover 62,0 procent en 90,0 procent op MathVision tegenover 65,5 procent.
Hoe verhoudt Qwen3.8-27B zich tot Muse Glimmer en Qwen3.8-Max?
De directe vergelijking is Muse Glimmer van Meta, een agentmodel van 30B met open gewichten dat op 10 augustus 2026 verscheen onder dezelfde Apache 2.0-licentie en op hetzelfde gebruik mikt: een lokale agent die permanent meedraait. Op de vier benchmarks waar Alibaba beide rapporteert, wint Qwen3.8-27B alle vier: Terminal Bench 2.1 met 73,0 tegen 51,7, SWE-bench Pro met 61,7 tegen 51,2, IFBench met 79,5 tegen 77,0 en GPQA Diamond met 89,2 tegen 83,5. Dit zijn cijfers van Alibaba over het model van een concurrent, dus de marges verdienen de gebruikelijke voorzichtigheid, maar de harness en samplingparameters zijn gepubliceerd en dat is meer dan de meeste van dit soort vergelijkingen bieden.
Binnen de eigen familie is Qwen3.8-27B de inzetbare helft van de Qwen3.8-release. Qwen3.8-Max is een mixture of experts van 2,4 biljoen parameters met ongeveer 95 miljard actieve parameters, die Alibaba op 3 augustus uitbracht en waarvan de open gewichten op 12 augustus verschenen. Die Max-gewichten zijn alleen tekst. Qwen3.8-27B is ruwweg een honderdste van dat formaat, behoudt beeld- en video-invoer en is het checkpoint dat de meeste teams daadwerkelijk kunnen draaien. Alibaba kondigde het model op 3 augustus al aan in de lancering van Qwen3.8-Max, met de mededeling dat ook de 27B open gewichten zou krijgen, en leverde elf dagen later.
Beschikbaarheid, licentie en prijs van Qwen3.8-27B
De gewichten staan op Hugging Face als Qwen/Qwen3.8-27B en Qwen/Qwen3.8-27B-FP8, en op ModelScope. Beide dragen Apache 2.0, bevestigd in het licentiebestand en niet alleen in de front matter van de modelkaart, wat betekent dat commercieel gebruik is toegestaan zonder clausule over omzetdeling. Dat is een wezenlijk verschil met Qwen3.8-Max, dat onder een eigen licentie verscheen. Er zijn recepten gepubliceerd voor SGLang en vLLM.
Een eigen gehoste prijs bestaat nog niet. De modelkaart zegt dat de dienst op Qwen Cloud eraan komt, en de Qwen Cloud-pagina voor het model gaf op 17 augustus 2026 een 404. Wie vandaag een gehost eindpunt wil, komt uit bij OpenRouter, dat Qwen3.8-27B aanbiedt voor 0,45 dollar per miljoen inputtokens en 3,20 dollar per miljoen outputtokens met een contextvenster van 262.144 tokens. Wie een officiële API-prijs van Alibaba voor dit model citeert, citeert iets dat Alibaba niet heeft gepubliceerd.
Ga voor meer informatie naar de officiële aankondiging van Qwen3.8-27B