Publicatiedatum: 27 augustus 2026
Z.ai heeft GLM-5.3-Flash uitgebracht, een open-weight multimodaal model met 320 miljard parameters waarvan er per token 18 miljard actief zijn. Volgens Z.ai presteert het model beter dan GLM-5.2 tegen ongeveer een tiende van de prijs.
De naam doet vermoeden dat het om een kleine variant gaat, maar technisch verandert er meer. GLM-5.3-Flash gebruikt een nieuw getraind basismodel en is vanaf de basis ontworpen voor multimodale en lange agenttaken.
Wat kan GLM-5.3-Flash?
GLM-5.3-Flash is volgens Z.ai het eerste native multimodale model binnen de GLM-5-serie. Het combineert sparse attention en linear attention om lange context goedkoper te verwerken.
Het model telt 320 miljard parameters. Daarvan zijn 18 miljard parameters per token actief. Het ondersteunt volgens Z.ai contextvensters tot één miljoen tokens.
Daarmee richt het model zich op taken zoals lange coding sessions, browseragents, computergebruik en complexe kenniswerkprocessen. GLM-5.3-Flash is inmiddels beschikbaar voor gebruikers van het Coding Plan en als downloadbare gewichten.
De officiële Hugging Face-versie gebruikt de MIT-licentie. Dat maakt lokaal gebruik, aanpassing en commerciële toepassing relatief eenvoudig.
GLM-5.3-Flash benchmarks en kosten
Z.ai positioneert GLM-5.3-Flash dicht bij duurdere frontiermodellen voor coding en agenttaken. De onderstaande resultaten zijn afkomstig van Z.ai zelf en zijn dus geen onafhankelijke metingen.
| Wat wordt gemeten | GLM-5.3-Flash | Claude Opus 4.8 |
|---|---|---|
| Terminal Bench 2.1 | 84,3 | 85,0 |
| DeepSWE 1.1 | 63,4 | 58,0 |
| Toolathlon Verified | 78,4 | 76,2 |
| AutomationBench | 48,8 | 41,0 |
| OfficeQA Pro | 62,4 | 48,9 |
Op de Artificial Analysis Intelligence Index rapporteert Z.ai een score van 57 tegen een kortingsprijs van $0,045 per taak. De fabrikant spreekt daarnaast van ongeveer een tiende van de prijs van GLM-5.2.
Een concrete standaardtabel met input- en outputprijzen ontbreekt echter in de releasepost. Voor bedrijven die API-kosten willen vergelijken is dat een duidelijke beperking van de aankondiging.
Hoe vergelijkt GLM-5.3-Flash met GLM-5.2?
De stap is groter dan een normale Flash-variant. GLM-5.3 gebruikte volgens Z.ai nog hetzelfde basismodel als GLM-5.2, met verbeteringen uit verdere post-training. GLM-5.3-Flash begint juist met een nieuw getrainde multimodale basis.
Op verschillende eigen benchmarks meldt Z.ai duidelijke verbeteringen ten opzichte van GLM-5.2. Vooral bij softwareontwikkeling en geautomatiseerde taken zijn de verschillen groot.
Toch ontbreekt nog onafhankelijke praktijkdata. Een benchmark kan niet aantonen hoeveel pogingen een agent nodig heeft om een interne programmeertaak volledig af te ronden.
Wat dit betekent
Nu het testen waard. Vooral teams met veel coding-agentverkeer of behoefte aan self-hosting hebben reden om GLM-5.3-Flash te testen. De MIT-licentie verlaagt daarbij de juridische en technische drempel.
Vergelijk niet alleen de prijs per token. Meet de kosten per volledig afgeronde taak, het aantal herstelpogingen en de snelheid bij lange context. Daarmee wordt duidelijk of Z.ai’s efficiëntieclaim ook financieel relevant is in echte workflows.
Voor meer informatie, bekijk de officiële aankondiging van GLM-5.3-Flash op de website van Z.ai.