Alibaba lanceert Qwen3.8-Flash-Next

27-08-2026

Alibaba bracht Qwen3.8-Flash-Next op 26 augustus 2026 uit. Het open-weight multimodale model geeft een vroege blik op Qwen4 en activeert slechts 6 miljard hoofdmodel parameters per token. Standaard ondersteunt het model 262.144 tokens context, met uitbreiding tot één miljoen tokens.

Geschreven door:

Jorick van Weelie

Marketing Lead bij DataNorth | Next-Gen AI-enthousiast & Tech Storyteller

Meld je aan voor de Nieuwsbrief

Publicatiedatum: 27 augustus 2026

Alibaba’s Qwen-team heeft Qwen3.8-Flash-Next uitgebracht, een open-weight multimodaal model dat vooruitblikt op de architectuur van Qwen4. Per token zijn slechts 6 miljard parameters van het hoofdmodel actief, terwijl het model standaard 262.144 tokens context ondersteunt.

De interessantste vernieuwing zit niet in een nieuwe benchmarkscore. Alibaba experimenteert met een architectuur die grote modellen goedkoper moet maken bij lange context vensters, coding agents en omvangrijke document taken.

Wat is Qwen3.8-Flash-Next?

Qwen3.8-Flash-Next gebruikt een mixture-of-experts-architectuur. Daarbij wordt voor iedere token slechts een deel van het model ingeschakeld. Het hoofdmodel telt 125 miljard parameters en gebruikt daarnaast 51 miljard parameters voor N-gram embeddings.

Alibaba presenteert het model expliciet als een vroege blik op technologie die richting Qwen4 gaat. Een belangrijk onderdeel is Qwen Sparse Attention. Die techniek probeert eerst de relevante delen uit een lange context te selecteren voordat zwaardere aandachtberekeningen plaatsvinden.

Het model ondersteunt standaard 262.144 tokens. Met YaRN kan dat volgens Alibaba worden uitgebreid tot één miljoen tokens. De productievariant Qwen3.8-Flash is juist rond dat grotere contextvenster opgebouwd.

Voor teams die grote codebases of lange agentgeschiedenissen verwerken, kan dit direct interessant zijn. De belangrijkste onzekerheid is nog hoeveel van de beloofde efficiëntie overeind blijft buiten Alibaba’s eigen tests.

Qwen3.8-Flash-Next benchmarks, toegang en prijs

Alibaba publiceert sterke resultaten voor softwareontwikkeling en agenttaken. Het gaat om cijfers van Alibaba zelf en niet om onafhankelijke evaluaties.

Wat wordt gemetenQwen3.8-Flash-NextVergelijking
DeepSWE 1.1, coding agents58,7DeepSeek-V4-Flash-0731: 54,4
SWE-bench Pro, softwareontwikkeling62,5Claude Opus 4.6 Max: 53,4
CoWorkBench, lange kantoortaken73,9Claude Opus 4.6 Max: 68,2
Toolathlon Verified, toolgebruik73,5DeepSeek-V4-Flash-0731: 70,3
AndroidWorld, mobiele agents84,5Qwen3.8-27B: 81,9

De gewichten zijn beschikbaar via Hugging Face en ModelScope. Op Hugging Face neemt de repository ongeveer 360 GB in beslag.

Belangrijk is dat Alibaba deze versie niet onder Apache 2.0 uitbrengt. Qwen Community License 1.0 staat veel vormen van gebruik en aanpassing toe, maar bevat extra voorwaarden voor bepaalde grote producten, modeldiensten en AI-assistenten voor kantoorwerk of programmeren.

Dat maakt de licentie relevant voor bedrijven die het model commercieel willen hosten. Vooral aanbieders van coding assistants of generieke werkassistenten moeten de voorwaarden vooraf controleren.

De productievariant Qwen3.8-Flash wordt aangekondigd voor $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens. Bij publicatie meldde Alibaba echter dat de API nog niet actief was. De open weights zijn wel beschikbaar.

Hoe vergelijkt Qwen3.8-Flash-Next met eerdere Qwen-modellen?

Alibaba vergelijkt de nieuwe architectuur vooral met Qwen3.7-Plus. Qwen3.8-Flash-Next zou ongeveer een negende van de trainingskosten vragen en tegelijkertijd beter scoren op verschillende programmeer- en kantoortaken.

Dat maakt het model vooral interessant als efficiëntie-experiment. Het is geen klein model dat toevallig goed scoort. De volledige set gewichten blijft groot, ook al zijn er per token weinig parameters actief.

Een belangrijk ontbrekend stuk is onafhankelijke praktijktesting. Alibaba levert veel eigen benchmarkdata, maar er is nog weinig onafhankelijke informatie over doorvoer, geheugenverbruik en langere agenttaken in productie.

Wat dit betekent

Nu het testen waard. Een klein technisch team dat coding agents of documentagents op eigen infrastructuur draait, heeft voldoende reden om Qwen3.8-Flash-Next te evalueren. De combinatie van open weights, sterke codingresultaten en slechts 6 miljard actieve parameters is opvallend.

Meet vooral het geheugenverbruik, de snelheid en het percentage volledig afgeronde taken in je eigen workflow. Controleer daarnaast de nieuwe Qwen-licentie voordat het model onderdeel wordt van een commerciële AI-assistent.

Voor meer informatie, bekijk de officiële aankondiging van Qwen3.8-Flash-Next op de website van Alibaba Qwen.

Maak DataNorth AI je Google favoriet