Gepubliceerd: 4 augustus 2026
Het Qwen-team van Alibaba heeft Qwen3.8-Max op 3 augustus 2026 uitgebracht en het nieuwe vlaggenschipmodel algemeen beschikbaar gemaakt via QwenCloud en Alibaba Cloud Model Studio, vooruitlopend op een open-weights-release volgende week. Qwen3.8-Max is een Mixture-of-Experts-model met 2,4 biljoen parameters waarvan er 95 miljard per query actief zijn, verwerkt tekst, beeld en video als invoer en ondersteunt een contextvenster van 1 miljoen tokens voor 2,00 dollar per miljoen invoertokens en 6,00 dollar per miljoen uitvoertokens. Alibaba brengt daarnaast een tweede checkpoint uit met open gewichten, Qwen3.8-27B, waarmee Qwen3.8-Max het eerste model in de Qwen-Max-klasse is waarvan de gewichten worden gepubliceerd.
Wat heeft Alibaba uitgebracht met Qwen3.8-Max?
Qwen3.8-Max is het nieuwe vlaggenschipmodel van Alibaba en het meest capabele model in de Qwen-familie tot nu toe. Het is een Mixture-of-Experts-model met in totaal 2,4 biljoen parameters, waarvan er 95 miljard per query actief zijn, gebouwd op de Qwen3.5-architectuur. Het model is natively multimodaal: het verwerkt tekst, afbeeldingen en video als invoer en geeft tekst terug. Alibaba toonde het model half juli 2026 al als preview en zette het op 3 augustus 2026 om naar algemene beschikbaarheid, met daarbij de volledige benchmarktabel die bij de preview nog ontbrak.
De release bestaat uit twee checkpoints. Qwen3.8-Max is het vlaggenschip en draait vandaag via de gehoste API. Qwen3.8-27B is een kleiner checkpoint dat bedoeld is voor gewone GPU-hardware op locatie. De gewichten van beide staan volgende week gepland op Hugging Face en ModelScope. Daarmee keert Alibaba terug naar het open-sourcen van zijn topmodellen, na een aantal vlaggenschipreleases in 2026 die proprietary bleven, en komen voor het eerst de gewichten van een Max-model beschikbaar. Het aandeel Alibaba steeg op de aankondiging ongeveer 7 procent in Hongkong en 4,5 procent in de voorbeurshandel in New York.
Alibaba positioneert het model rond langlopend agentisch werk in plaats van losse vraag-en-antwoordsessies. De genoemde toepassingen zijn codeeragents op repository-schaal, kennisbanken met lange documenten, indexering van lange video, gestructureerde data-extractie en meerstapsonderzoeksassistenten. Volgens het bedrijf kan het model softwareapplicaties nabouwen op basis van screenshots, interactieve games en educatieve animaties genereren en tweedimensionale plattegronden omzetten naar 3D-visualisaties.
Benchmarks en technische specificaties van Qwen3.8-Max
Qwen3.8-Max heeft een contextvenster van 1 miljoen tokens.
De maximale invoer is 991.000 tokens en zakt naar 983.000 tokens als thinking aanstaat.
De maximale uitvoer is in beide modi 131.000 tokens en het maximale redeneerbudget is 262.000 tokens.
De limieten liggen op 2 miljoen tokens per minuut en 15.000 verzoeken per minuut.
Met de parameter reasoning_effort zijn drie niveaus te kiezen die snelheid afwegen tegen grondigheid. Ondersteund worden function calling, gestructureerde uitvoer, batchverzoeken, prefix completion en fine-tuning, en op de Responses API zitten vijf ingebouwde tools: code_interpreter, web_search, web_extractor, t2i_search en i2i_search.
In de benchmarktabel die Alibaba bij de release publiceerde scoort Qwen3.8-Max:
- 86,6 op Terminal-Bench 2.1, voor Claude Opus 4.8 en Claude Fable 5 op 84,6 en achter GPT-5.6 Sol op 88,8.
- Het model komt op 67,7 op SWE-bench Pro tegenover 80,0 voor Claude Fable 5, en op 73,5 op FrontierSWE tegenover 88,8 voor Claude Fable 5.
- Het leidt de vergelijking op PaperBench met 93,0 en op IFBench met 82,8.
- GPQA Diamond komt uit op 92,6, marginaal hoger dan de 92,4 van Qwen3.7-Max.
- De multimodale rijen zijn sterker: OSWorld-Verified 86,1, Parametric CAD Bench 91,5 en OmniDocBench 1.5 op 92,1.
- en opzichte van de eigen voorganger is de agentische sprong groot: DeepSWE 1.1 gaat van 21,6 naar 56,6, FrontierSWE van 40,7 naar 73,5 en JobBench van 31,3 naar 53,4.
Bij die cijfers horen twee kanttekeningen. Alle scores komen uit interne runs van de leverancier zelf en onafhankelijke verificatie ontbreekt nog. Daarnaast vergelijkt de multimodale tabel Qwen3.8-Max met Qwen3.7-Plus in plaats van met Qwen3.7-Max, wat het verschil tussen de generaties gunstiger laat lijken. Ook de eigen schaalcurve voor reinforcement learning is het lezen waard: de interne scoreindex over ruim tien benchmarks steeg van 0,474 naar 0,725, maar piekt rond 4.000 trainingsomgevingen en zakt daarna terug naar 0,719 en 0,689.
Wat kan Qwen3.8-Max bij langlopende agenttaken?
Alibaba publiceerde vijf casestudies waarin Qwen3.8-Max zonder menselijke tussenkomst werkte. In de eerste bouwde het model in 16 dagen het commandoregelprogramma oh-my-cli. Het zette binnenkomende gebruikersverzoeken om in GitHub-issues, wees die aan zichzelf toe, schreef de code en draaide tests. Op 30 juli 2026 stonden er 265 commits, 127 pull requests en 151 issues, zonder één menselijke commit. In de tweede kreeg het model het onderzoekspaper “Unified Data Selection for LLM Reasoning” zonder startcode. In ongeveer vijf dagen en 125 uur rekentijd schreef het 7.600 regels code, draaide het 33 GPU-trainingsjobs, reproduceerde het alle zes hoofdresultaten en versloeg het daarna de methode uit het paper op de AIME24-benchmark met 2,7 punten.
In de derde casestudy deed het model mee aan de WWW2025 Multimodal Dialogue Intent Recognition Challenge op Alibaba’s Tianchi-platform, tegen 526 menselijke teams. Binnen 24 uur en over 45 inzendingen liep de nauwkeurigheid op van 0,60 naar 0,853, waarmee het model boven 458 van de 526 teams eindigde. In de vierde ontwierp het model een cryptografisch circuit en bracht het een werkend ontwerp in ongeveer 500 iteraties terug van 8.298 naar 678 logische poorten, waarbij het fysieke oppervlak kromp van 106 bij 106 naar 46 bij 46 micrometer, een reductie van 81 procent. De vijfde, E-Commerce-Bench, simuleert een volledig boekjaar online retail op geanonimiseerde data van Taobao en Tmall, inclusief 152 verborgen oplichters onder de leveranciers. Startend met 100.000 yuan eindigde Qwen3.8-Max op 416.252 yuan, 38 procent boven nummer twee GLM 5.2 en ruim 2,5 keer zoveel als Qwen3.7-Max haalde.
Multimodaal verwerkt het model volgens Alibaba documenten van meer dan 200 pagina’s en video’s van meer dan 100 uur. Het bedrijf introduceert daarnaast RecreationBench, een benchmark waarin een model een draaiende applicatie moet nabouwen zonder toegang tot de broncode, waarbij het de doelapplicatie alleen mag observeren via klikken en toetsaanslagen op Ubuntu, macOS, Windows, Android en het web. Daarnaast verschijnt Qwen-MM-Plugins, een uitbreidingsbibliotheek die beeld- en videoverwerking, visueel toolgebruik en multimodaal geheugen toevoegt aan bestaande agentsystemen.
Hoe verhoudt Qwen3.8-Max zich tot Claude Fable 5, GPT-5.6 Sol en Kimi K3?
In de tabellen van Alibaba zelf zit Qwen3.8-Max dicht bij, maar over het algemeen onder de westerse top op puur software-engineeringwerk. GPT-5.6 Sol leidt Terminal-Bench 2.1 nog met 88,8 tegen 86,6, en Claude Fable 5 leidt SWE-bench Pro met 80,0 tegen 67,7 en FrontierSWE met 88,8 tegen 73,5. Waar Qwen3.8-Max wel voorop loopt is agentische breedte en multimodaliteit: PaperBench op 93,0, IFBench op 82,8 en de meeste visionrijen. Op het crowdsourced platform Arena.AI werd Qwen3.8-Max bij de lancering het hoogst geplaatste Chinese model voor teksttaken, maar bleef het achter bij meerdere modellen van Anthropic, waaronder Claude Fable 5.
De directere concurrent komt uit eigen land. Kimi K3 van Moonshot AI is een multimodaal Mixture-of-Experts-model met 2,8 biljoen parameters en een contextvenster van 1 miljoen tokens, in juli 2026 uitgebracht met open gewichten. Qwen3.8-Max is kleiner in totaal aantal parameters, maar komt met een gehoste API, een gepubliceerde benchmarktabel en een aangekondigde open-weights-release, wat een breder lanceerpakket is dan Kimi K3 had. Praktisch relevant voor kopers is dat Qwen3.8-Max zowel het Chat Completions-formaat van OpenAI als het API-protocol van Anthropic ondersteunt, waardoor het zonder aanpassingen werkt in Claude Code, Codex, Qoder CLI, Qwen Code en OpenClaw. Volgens Alibaba presteert het model in die harnasomgevingen ongeveer gelijk en is het niet specifiek afgestemd op het eigen QwenWork.
Beschikbaarheid, prijzen en open gewichten van Qwen3.8-Max
Qwen3.8-Max is nu beschikbaar via QwenCloud en de Model Studio-API’s van Alibaba Cloud, via QwenWork, het agentplatform van Alibaba voor werk, en in Qwen Studio op chat.qwen.ai. De API is compatibel met OpenAI en DashScope, waardoor integreren neerkomt op het wijzigen van de base URL en de model-ID. De prijs is 2,00 dollar per miljoen invoertokens en 6,00 dollar per miljoen uitvoertokens. Impliciete cache-reads kosten 0,25 dollar per miljoen tokens, het aanmaken van een expliciete cache 2,50 dollar en expliciete cache-reads 0,17 dollar per miljoen tokens. Invoer uit cache is acht keer goedkoper dan verse invoer, dus een stabiele prompt-prefix bepaalt de kosten sterker dan de lengte van de prompt.
Zelf hosten is een ander verhaal. Met 2,4 biljoen parameters in totaal blijft elke expert in het geheugen staan, ook al zijn er per query maar 95 miljard actief. Daarmee is het vlaggenschip-checkpoint een datacenterartefact over meerdere nodes en niet iets wat op één server past. Qwen3.8-27B is het checkpoint dat bedoeld is voor gewone GPU-hardware op locatie. Alibaba heeft de licentievoorwaarden voor beide checkpoints nog niet gepubliceerd en de gewichten verschijnen volgende week op Hugging Face en ModelScope, dus teams die een deployment op locatie plannen kunnen beter eerst de licentie afwachten.
Je vindt de volledige technische details van Qwen 3.7 op de Qwen-blog.