Meta brengt Muse Glimmer uit: Agentic model

11-08-2026

Muse Glimmer is een agentisch model van 30 miljard parameters met open gewichten van Meta, uitgebracht op 10 augustus 2026 onder Apache 2.0 en gebouwd om lokale agents op een enkele consumenten-GPU te draaien.

Geschreven door:

Jorick van Weelie

Marketing Lead bij DataNorth | Next-Gen AI-enthousiast & Tech Storyteller

Meld je aan voor de Nieuwsbrief

Gepubliceerd: 11 augustus 2026

Meta bracht op 10 augustus 2026 Muse Glimmer uit, een model van 30 miljard parameters met open gewichten van Meta Superintelligence Labs, gebouwd voor lokale agent-workflows die continu draaien en gepubliceerd op Hugging Face onder de Apache 2.0-licentie. Muse Glimmer is gedestilleerd uit het grotere Muse Spark-model van Meta en gecomprimeerd naar ongeveer 4 bit, waardoor het binnen 24 GB geheugen past op een enkele consumenten-GPU of een Mac met Apple silicon. Het is het eerste agentische model van Meta met open gewichten en een licentie die commercieel gebruik zonder extra voorwaarden toestaat.

Wat kan Muse Glimmer?

Muse Glimmer is getraind op de agent-loop en niet op vrije conversatie. Meta noemt vier kerncapaciteiten: taken van begin tot eind afronden, nauwkeurig functies aanroepen volgens een vast schema, redeneren over meerdere stappen, en herstellen na fouten. Dat laatste betekent dat het model is getraind om een mislukte tool-aanroep te analyseren en opnieuw te proberen in plaats van te stoppen. Via een aparte perception encoder verwerkt het model tekst en afbeeldingen door elkaar, zodat een agent screenshots, grafieken en documenten kan lezen naast het gesprek. Audio wordt niet ondersteund en video wordt per frame verwerkt.

Het model biedt instelbare redeneerniveaus, zodat ontwikkelaars per verzoek kwaliteit tegen snelheid kunnen afwegen, en het werkt met agent-scaffolds zoals OpenClaw. Meta trainde het op data uit meer dan 100 talen. De beoogde toepassingen zijn lokale agents, lokale programmeertools, function calling, gestructureerde extractie en evaluatie met een model als beoordelaar. Die kunnen allemaal draaien zonder internetverbinding.

Muse Glimmer benchmarks en technische specificaties

Muse Glimmer is een dichte causale transformer met ongeveer 30 miljard parameters in totaal, inclusief een vision tower van circa 1,8 miljard parameters op basis van een ViT-G/14 perception encoder die tot 4.096 visuele tokens per afbeelding accepteert. Grouped-query attention gebruikt 32 query heads en 2 key-value heads, en de attention-stack herhaalt een patroon van lokaal, lokaal, lokaal, globaal met een schuifvenster van 2.048 tokens. De contextlengte is 131.072 tokens, de vocabulaire telt 202.048 tokens en de kennisgrens ligt op 4 januari 2026.

De training verliep in drie fasen:

  • In de pre-training gebruikte Meta logit-distillatie op de uitvoer van Muse Spark, het grotere foundation model van het bedrijf.
  • In de mid-training kwam data met langere context en meer agent-taken erbij, met uitgebreidere redeneersporen.
  • In de post-training combineerde Meta supervised fine-tuning met on-policy distillatie en reinforcement learning over algemene, redeneer-, programmeer- en agent-taken.

Meta zegt het model voor publicatie te hebben getoetst aan het eigen Advanced AI Scaling Framework. Volgens die toets valt Muse Glimmer niet onder de definitie van Frontier AI, met risico’s rond chemie en biologie, cyber en verlies van controle beoordeeld als matig of lager. Op de Siren AgentDojo-evaluatie voor prompt injection meldt Meta een aanvalssuccespercentage van 28,4 bij een utility-score van 94,2.

Hoe verhoudt Muse Glimmer zich tot Gemma4-31B en Qwen3.6-27B?

Meta positioneert Muse Glimmer tegenover Gemma4-31B van Google en Qwen3.6-27B van Alibaba. Alle vergelijkingscijfers hieronder komen uit Meta’s eigen evaluaties, waarbij de concurrenten in thinking mode draaiden.

  • Muse Glimmer staat voorop op MCP Atlas met 75,5 tegen 54,2 voor Gemma4-31B en 62,5 voor Qwen3.6-27B.
  • Ook op DeepSearch QA met 74,6, op Gaia2 met 43,3 en op SWE-Bench Pro met 51,2 scoort het model het hoogst.
  • Op redeneren en instructies volgen meldt Meta 94,7 op AIME 2026, 77,0 op IFBench en 80,0 op AA-LCR.

Bij het aansturen van een computer of terminal draait het beeld om. Qwen3.6-27B blijft voor op OSWorld-Verified met 75,6 tegen 65,9 voor Muse Glimmer, op TerminalBench 2.1 met 60,7 en op SWE-Bench Verified met 77,2.

Het patroon in de tabel van Meta is consistent: Muse Glimmer wint op agentische orkestratie en redeneren, en verliest op computergebruik en terminalwerk. Meta publiceerde een methodologierapport bij de resultaten, zodat de harness en instellingen per score te controleren zijn, maar geen onafhankelijke partij heeft de cijfers tot nu toe gereproduceerd.

Hoe Muse Glimmer op een consumenten-GPU van 24 GB past

Op volledige precisie heeft een model van 30 miljard parameters meer dan 55 GB geheugen nodig, meer dan welke consumenten-GPU dan ook biedt. Meta comprimeert de gewichten naar ongeveer 4 bit, waarmee het taalmodel onder 20 GB blijft en er binnen een envelop van 24 GB of 32 GB ruimte overblijft voor de key-value cache, de perception encoder en de drafter voor speculative decoding. Er zijn twee gekwantiseerde builds: K-Quant-Dynamic richt zich op 32 GB VRAM met gemiddeld 0,2% kwaliteitsverlies, en K-Quant-17GB op 24 GB met 1,0%, beide gemiddeld over 15 gangbare benchmarks.

De snelheidswinst komt van DFlash, een lichte block-diffusion drafter die 16 tokens in een enkele forward pass voorstelt, waarna het hoofdmodel het blok parallel verifieert. De drafter gebruikt 5 lagen, een schuifvenster van 2.048 tokens en 32 query heads tegenover 8 key-value heads. Gemeten op de K-Quant-17GB build bij batchgrootte 1 met greedy decoding meldt Meta een stijging van 74,9 naar 233,4 tokens per seconde op een RTX 5090, een factor 3,1, van 26,6 naar 50,2 op een Apple M5 Max en van 23,7 naar 37,8 op een M4 Max. Dit zijn cijfers die Meta zelf heeft gemeten op de eigen harness.

Beschikbaarheid, licentie en prijs van Muse Glimmer

De gewichten staan nu op Hugging Face, in een collectie met BF16-gewichten, GGUF k-quants, ExecuTorch-builds en de DFlash-drafter, met documentatie voor ontwikkelaars in het AI Developer Center van Meta. Omdat de licentie Apache 2.0 is, geldt er geen prijs per token en geen gebruiksvoorwaarde buiten de licentie om: zelf hosten is de route vanaf dag een, en commercieel gebruik, aanpassen en herdistribueren zijn toegestaan. Dat is een breuk met de recente praktijk van Meta, want Muse Spark bleef gesloten en Muse Spark 1.1 verscheen alleen als gehoste API.

Geoptimaliseerde integraties voor llama.cpp, MLX en ExecuTorch volgen de komende dagen, met geplande toegang via Ollama, LM Studio, Unsloth, vLLM, SGLang, Together AI, Fireworks AI en OpenRouter. Meta werkt samen met AMD, Arm, Dell, Intel en NVIDIA aan optimalisatie op apparaatniveau. Bij de release zei Mark Zuckerberg dat Meta ook de gewichten van Muse Spark 1.2 gaat vrijgeven, het nieuwste foundation model van het bedrijf. Er is nog geen datum genoemd en die gewichten zijn nog niet beschikbaar.

De volledige details, de benchmarktabel en het methodologierapport staan in de Muse Glimmer aankondiging van Meta, en de gewichten van Muse Glimmer staan op HuggingFace.

Maak DataNorth AI je Google favoriet