Meta Superintelligence Labs heeft Muse Glimmer gelanceerd, een open-weight model met 30 miljard parameters onder de Apache 2.0-licentie. Het model is specifiek ontworpen voor lokale 'always-on' agentic workflows, waardoor functies zoals function calling en lokaal coderen mogelijk worden op consumentenhardware (zoals Mac M4/M5 Max of RTX-5090).
Belangrijkste kenmerken:
- Training: Ontwikkeld via logit distillatie van Muse Spark, gevolgd door mid-training voor complexer redeneren en post-training via SFT en reinforcement learning.
- Capaciteiten: Het model blinkt uit in end-to-end agentische taken, betrouwbaar toolgebruik, multi-step reasoning, foutherstel en meertaligheid (>100 talen). Daarnaast ondersteunt het multimodale input (tekst en beeld).
- Lokale optimalisatie: Door 4-bit kwantisatie past het model in minder dan 20 GB geheugen. Voor verhoogde generatiesnelheid wordt gebruikgemaakt van speculative decoding via een DFlash-drafter.
Het model is beschikbaar op Hugging Face en wordt ondersteund door populaire tools zoals Ollama, llama.cpp en MLX.
Introductie van Muse Glimmer: Een open agentic model dat lokaal op je apparaat draait
Vandaag introduceren we Muse Glimmer, het nieuwste model van Meta Superintelligence Labs. We stellen de modelgewichten open source beschikbaar onder een permissieve Apache 2.0-licentie.
Muse Glimmer is een model met 30 miljard parameters dat is geoptimaliseerd voor 'always-on' lokale agent-workflows. Het is compact genoeg om te draaien op een Mac of pc met één consumenten-GPU, wat gebruiksmogelijkheden ontsluit die variëren van lokale agents en function calling tot lokaal coderen en evaluaties via LLM-as-a-judge. Vergeleken met toonaangevende modellen in dezelfde groottecategorie levert Muse Glimmer sterke prestaties bij belangrijke agentic use cases en benchmarks.
Foundation-modellen hebben opmerkelijke mogelijkheden ontwikkeld op het gebied van redeneren, codegeneratie en toolgebruik, maar de meeste implementaties zijn nog steeds afhankelijk van cloudinfrastructuur en netwerktoegang. Het lokaal draaien van modellen maakt het mogelijk om AI overal en altijd te gebruiken, met of zonder internetverbinding. Dit is steeds haalbaarder: de open-source community heeft aangetoond dat kleinere modellen, mits effectief getraind, kunnen benaderen tot prestaties op frontier-niveau voor specifieke taken. Muse Glimmer is specifiek geoptimaliseerd voor deze lokale use cases.
In lijn met onze traditie om fundamenteel AI-onderzoek te delen, brengen we de open gewichten van Muse Glimmer vandaag uit op Hugging Face, samen met documentatie voor ontwikkelaars. Muse Glimmer is ontworpen om te werken met tools die ontwikkelaars al gebruiken. Geoptimaliseerde integraties voor llama.cpp, MLX en ExecuTorch volgen in de komende dagen, zodat gebruikers binnen enkele minuten van download naar een werkende agent kunnen gaan.
Hoe we Muse Glimmer hebben getraind
Een agent die je agenda beheert, berichten opstelt, bestanden organiseert en leert hoe je werkt, heeft diepe toegang nodig tot persoonlijke context. Daarnaast moeten verschillende capaciteiten in harmonie samenwerken: uitvoering over een lange horizon (long-horizon execution), nauwkeurige tool calling, multimodaal begrip, geheugen met een lange context en het vermogen om instructies op te volgen.
We hebben Muse Glimmer zo ontworpen dat er een balans is tussen functionaliteit en de beperkingen van het geheugen en de rekenkracht van lokale hardware. Dit vereiste een compacte architectuur, een innovatief distillatierecept dat agentisch redeneren overdraagt van een veel groter teacher-model, en optimalisaties voor inferentie — inclusief kwantisatie — om aan de latency-verwachtingen te voldoen. Dit hebben we bereikt in de volgende fasen:
- Pre-Training: We hebben Muse Glimmer getraind op de outputs van Muse Spark met behulp van logit distillation, waarbij we gebruikmaakten van een vergelijkbare datamix als het teacher-model.
- Mid-Training: We hebben het model getraind op data met een langere context en meer agent-specifieke inhoud met rijkere redeneersporen, naast organische data.
- Post-Training: We combineerden supervised fine-tuning met een mix van on-policy distillation en reinforcement learning over algemene domeinen, redeneren, coderen en agentische taken.
Muse Glimmer is geëvalueerd volgens de standaarden van Meta's Advanced AI Scaling Framework en is getoetst voor open-weight release in alle relevante categorieën.
Gebouwd voor agents: Wat Muse Glimmer kan
Het bouwen van effectieve agents vereist dat verschillende kerncapaciteiten samenwerken om de doelen van de gebruiker te bereiken. Muse Glimmer is getraind en geëvalueerd op de volgende punten:
- End-to-end voltooiing van agentische taken: Muse Glimmer behaalt sterke succespercentages op volledige taakbenchmarks, waaronder DeepSearch QA, MCP-Atlas, $\tau$-Bench en SWE-Bench. Deze meten het vermogen om binnen scaffolds te werken, code te schrijven en debuggen, en multi-turn verzoeken van begin tot eind op te lossen.
- Betrouwbaar toolgebruik: Het model handelt een breed scala aan function calls af en roept tools aan met nauwkeurige schema's gedurende uitgebreide workflows.
- Redeneren in meerdere stappen: Muse Glimmer kan redeneerketens over lange horizons combineren en coherente plannen handhaven tijdens complexe, uitgebreide workflows.
- Herstel na fouten: Wanneer een tool-aanroep mislukt of een onverwacht resultaat geeft, is het model getraind om de fout te diagnosticeren en opnieuw te proberen in plaats van te stoppen.
- Multimodale input en redenering: Via een speciale perceptie-encoder accepteert het model afwisselend tekst en afbeeldingen. Hierdoor kunnen agents screenshots, grafieken en documenten interpreteren naast het gesprek.
- Compatibiliteit met scaffolds: Muse Glimmer werkt met OpenClaw en andere agentische orchestratiepatronen.
- Controleerbare inspanning: Muse Glimmer ondersteunt verschillende redeneringssterktes om de juiste balans te kiezen tussen kwaliteit en snelheid.
- Meertaligheid: Muse Glimmer is getraind op data uit meer dan 100 talen.
Prestaties
We hebben Muse Glimmer getest via een breed scala aan benchmarks om de diverse capaciteiten te beoordelen die nodig zijn voor effectief autonoom agent-gedrag. Vergeleken met Gemma4-31B en Qwen3.6-27B presteert Muse Glimmer sterk voor zijn grootteklasse op verschillende veelgebruikte LLM-benchmarks.
Voor meer details over onze evaluaties, zie ons rapport.
Geoptimaliseerd voor lokale implementatie
Een lokale agent is pas echt nuttig als hij snel genoeg is om responsief aan te voelen. Een agent die minuten nodig heeft om te antwoorden of de volgende stap te plannen, doorbreekt de flow van het echte werk. We hebben twee optimalisaties toegepast om Muse Glimmer op praktische snelheden te laten draaien op consumentenhardware zonder kwaliteitsverlies.
Het model op je apparaat passen
Bij volledige precisie zou een model met 30 miljard parameters meer dan 55 GB geheugen vereisen — veel meer dan elke consumenten-GPU biedt. We gebruiken kwantisatietechnieken om de gewichten van het model te comprimeren naar ongeveer 4-bit precisie, waardoor het taalmodel krimpt tot minder dan 20 GB.
Dit laat voldoende ruimte over voor het werkgeheugen van het model (de "KV cache"), de perceptie-encoder voor beeldbegrip en de speculative decoding drafter om gelijktijdig te draaien binnen een envelop van 24 GB of 32 GB. We hebben gevalideerd dat deze compressie minimale tot geen degradatie veroorzaakt bij agentische taken.
Snellere generatie via speculatieve decoding
Taalmodellen genereren normaal gesproken tekst token voor token, wat traag kan aanvoelen tijdens lange redeneerketens of tool-aanroepen in meerdere stappen. Muse Glimmer wordt geleverd met een lichtgewicht "drafter"-model gebaseerd op DFlash — een klein begeleidend netwerk dat volledige blokken tokens tegelijk voorstelt.
Het hoofdmodel verifieert deze voorstellen vervolgens parallel, accepteert correcte tokens en corrigeert onjuiste. Deze techniek stelt Muse Glimmer in staat om tekst aanzienlijk sneller te genereren dan standaard token-voor-token generatie, terwijl de outputkwaliteit identiek blijft. We leveren gekwantiseerde drafter-versies mee om de geheugenbelasting te beperken.
Het resultaat
We hebben de snelheid van ons K-Quant-17GB model samen met de gekwantiseerde DFlash-drafter gemeten op de MacBook M4-Max, M5-Max en op een RTX-5090. Het model is snel genoeg voor vloeiende gesprekken en real-time agentinteractie, volledig draaiend op je eigen apparaat.
Nu aan de slag met Muse Glimmer
Muse Glimmer is nu beschikbaar; je kunt de gewichten downloaden op Hugging Face. In de komende dagen kun je het lokaal draaien via partners zoals Ollama, LM Studio en Unsloth; implementeren met edge-frameworks waaronder llama.cpp, ExecuTorch en MLX; op schaal serveren met vLLM en SGLang; of snel starten via partners als Together AI, Fireworks AI en OpenRouter. Je kunt het model zelfs aanpassen aan jouw specifieke use-case door gebruik te maken van de TorchTitan trainingsfunctie van PyTorch.
We werken daarnaast samen met partners waaronder AMD, Arm, Dell, Intel en NVIDIA om de prestaties op verschillende apparaten te optimaliseren. Daarnaast brengen we documentatie uit zodat ontwikkelaars de middelen hebben om verantwoord met Muse Glimmer te bouwen. Dit omvat richtlijnen voor het instellen van aangepaste scaffolds, zodat het nog gemakkelijker is om vanaf dag één persoonlijke agents te bouwen en implementeren. Meer informatie en bronnen zijn te vinden op Meta's AI Developer Center.
Dit werk bouwt voort op de lange staat van dienst van Meta in open AI-onderzoek, breidt dit uit naar agentische AI en geeft ontwikkelaars toegang tot lokale agentische mogelijkheden. Zoals altijd verwelkomen we feedback van de community en kijken we uit naar wat ontwikkelaars zullen bouwen met dit open-weight model.
Introductie van Muse Glimmer: Een open agentic model dat lokaal op je apparaat draait
Vandaag introduceren we Muse Glimmer, het nieuwste model van Meta Superintelligence Labs. We stellen de modelgewichten open source beschikbaar onder een permissieve Apache 2.0-licentie.
Muse Glimmer is een model met 30 miljard parameters dat is geoptimaliseerd voor 'always-on' lokale agent-workflows. Het is compact genoeg om te draaien op een Mac of pc met één consumenten-GPU, wat gebruiksmogelijkheden ontsluit die variëren van lokale agents en function calling tot lokaal coderen en evaluaties via LLM-as-a-judge. Vergeleken met toonaangevende modellen in dezelfde groottecategorie levert Muse Glimmer sterke prestaties bij belangrijke agentic use cases en benchmarks.
Foundation-modellen hebben opmerkelijke mogelijkheden ontwikkeld op het gebied van redeneren, codegeneratie en toolgebruik, maar de meeste implementaties zijn nog steeds afhankelijk van cloudinfrastructuur en netwerktoegang. Het lokaal draaien van modellen maakt het mogelijk om AI overal en altijd te gebruiken, met of zonder internetverbinding. Dit is steeds haalbaarder: de open-source community heeft aangetoond dat kleinere modellen, mits effectief getraind, kunnen benaderen tot prestaties op frontier-niveau voor specifieke taken. Muse Glimmer is specifiek geoptimaliseerd voor deze lokale use cases.
In lijn met onze traditie om fundamenteel AI-onderzoek te delen, brengen we de open gewichten van Muse Glimmer vandaag uit op Hugging Face, samen met documentatie voor ontwikkelaars. Muse Glimmer is ontworpen om te werken met tools die ontwikkelaars al gebruiken. Geoptimaliseerde integraties voor llama.cpp, MLX en ExecuTorch volgen in de komende dagen, zodat gebruikers binnen enkele minuten van download naar een werkende agent kunnen gaan.
Hoe we Muse Glimmer hebben getraind
Een agent die je agenda beheert, berichten opstelt, bestanden organiseert en leert hoe je werkt, heeft diepe toegang nodig tot persoonlijke context. Daarnaast moeten verschillende capaciteiten in harmonie samenwerken: uitvoering over een lange horizon (long-horizon execution), nauwkeurige tool calling, multimodaal begrip, geheugen met een lange context en het vermogen om instructies op te volgen.
We hebben Muse Glimmer zo ontworpen dat er een balans is tussen functionaliteit en de beperkingen van het geheugen en de rekenkracht van lokale hardware. Dit vereiste een compacte architectuur, een innovatief distillatierecept dat agentisch redeneren overdraagt van een veel groter teacher-model, en optimalisaties voor inferentie — inclusief kwantisatie — om aan de latency-verwachtingen te voldoen. Dit hebben we bereikt in de volgende fasen:
- Pre-Training: We hebben Muse Glimmer getraind op de outputs van Muse Spark met behulp van logit distillation, waarbij we gebruikmaakten van een vergelijkbare datamix als het teacher-model.
- Mid-Training: We hebben het model getraind op data met een langere context en meer agent-specifieke inhoud met rijkere redeneersporen, naast organische data.
- Post-Training: We combineerden supervised fine-tuning met een mix van on-policy distillation en reinforcement learning over algemene domeinen, redeneren, coderen en agentische taken.
Muse Glimmer is geëvalueerd volgens de standaarden van Meta's Advanced AI Scaling Framework en is getoetst voor open-weight release in alle relevante categorieën.
Gebouwd voor agents: Wat Muse Glimmer kan
Het bouwen van effectieve agents vereist dat verschillende kerncapaciteiten samenwerken om de doelen van de gebruiker te bereiken. Muse Glimmer is getraind en geëvalueerd op de volgende punten:
- End-to-end voltooiing van agentische taken: Muse Glimmer behaalt sterke succespercentages op volledige taakbenchmarks, waaronder DeepSearch QA, MCP-Atlas, $\tau$-Bench en SWE-Bench. Deze meten het vermogen om binnen scaffolds te werken, code te schrijven en debuggen, en multi-turn verzoeken van begin tot eind op te lossen.
- Betrouwbaar toolgebruik: Het model handelt een breed scala aan function calls af en roept tools aan met nauwkeurige schema's gedurende uitgebreide workflows.
- Redeneren in meerdere stappen: Muse Glimmer kan redeneerketens over lange horizons combineren en coherente plannen handhaven tijdens complexe, uitgebreide workflows.
- Herstel na fouten: Wanneer een tool-aanroep mislukt of een onverwacht resultaat geeft, is het model getraind om de fout te diagnosticeren en opnieuw te proberen in plaats van te stoppen.
- Multimodale input en redenering: Via een speciale perceptie-encoder accepteert het model afwisselend tekst en afbeeldingen. Hierdoor kunnen agents screenshots, grafieken en documenten interpreteren naast het gesprek.
- Compatibiliteit met scaffolds: Muse Glimmer werkt met OpenClaw en andere agentische orchestratiepatronen.
- Controleerbare inspanning: Muse Glimmer ondersteunt verschillende redeneringssterktes om de juiste balans te kiezen tussen kwaliteit en snelheid.
- Meertaligheid: Muse Glimmer is getraind op data uit meer dan 100 talen.
Prestaties
We hebben Muse Glimmer getest via een breed scala aan benchmarks om de diverse capaciteiten te beoordelen die nodig zijn voor effectief autonoom agent-gedrag. Vergeleken met Gemma4-31B en Qwen3.6-27B presteert Muse Glimmer sterk voor zijn grootteklasse op verschillende veelgebruikte LLM-benchmarks.
Voor meer details over onze evaluaties, zie ons rapport.
Geoptimaliseerd voor lokale implementatie
Een lokale agent is pas echt nuttig als hij snel genoeg is om responsief aan te voelen. Een agent die minuten nodig heeft om te antwoorden of de volgende stap te plannen, doorbreekt de flow van het echte werk. We hebben twee optimalisaties toegepast om Muse Glimmer op praktische snelheden te laten draaien op consumentenhardware zonder kwaliteitsverlies.
Het model op je apparaat passen
Bij volledige precisie zou een model met 30 miljard parameters meer dan 55 GB geheugen vereisen — veel meer dan elke consumenten-GPU biedt. We gebruiken kwantisatietechnieken om de gewichten van het model te comprimeren naar ongeveer 4-bit precisie, waardoor het taalmodel krimpt tot minder dan 20 GB.
Dit laat voldoende ruimte over voor het werkgeheugen van het model (de "KV cache"), de perceptie-encoder voor beeldbegrip en de speculative decoding drafter om gelijktijdig te draaien binnen een envelop van 24 GB of 32 GB. We hebben gevalideerd dat deze compressie minimale tot geen degradatie veroorzaakt bij agentische taken.
Snellere generatie via speculatieve decoding
Taalmodellen genereren normaal gesproken tekst token voor token, wat traag kan aanvoelen tijdens lange redeneerketens of tool-aanroepen in meerdere stappen. Muse Glimmer wordt geleverd met een lichtgewicht "drafter"-model gebaseerd op DFlash — een klein begeleidend netwerk dat volledige blokken tokens tegelijk voorstelt.
Het hoofdmodel verifieert deze voorstellen vervolgens parallel, accepteert correcte tokens en corrigeert onjuiste. Deze techniek stelt Muse Glimmer in staat om tekst aanzienlijk sneller te genereren dan standaard token-voor-token generatie, terwijl de outputkwaliteit identiek blijft. We leveren gekwantiseerde drafter-versies mee om de geheugenbelasting te beperken.
Het resultaat
We hebben de snelheid van ons K-Quant-17GB model samen met de gekwantiseerde DFlash-drafter gemeten op de MacBook M4-Max, M5-Max en op een RTX-5090. Het model is snel genoeg voor vloeiende gesprekken en real-time agentinteractie, volledig draaiend op je eigen apparaat.
Nu aan de slag met Muse Glimmer
Muse Glimmer is nu beschikbaar; je kunt de gewichten downloaden op Hugging Face. In de komende dagen kun je het lokaal draaien via partners zoals Ollama, LM Studio en Unsloth; implementeren met edge-frameworks waaronder llama.cpp, ExecuTorch en MLX; op schaal serveren met vLLM en SGLang; of snel starten via partners als Together AI, Fireworks AI en OpenRouter. Je kunt het model zelfs aanpassen aan jouw specifieke use-case door gebruik te maken van de TorchTitan trainingsfunctie van PyTorch.
We werken daarnaast samen met partners waaronder AMD, Arm, Dell, Intel en NVIDIA om de prestaties op verschillende apparaten te optimaliseren. Daarnaast brengen we documentatie uit zodat ontwikkelaars de middelen hebben om verantwoord met Muse Glimmer te bouwen. Dit omvat richtlijnen voor het instellen van aangepaste scaffolds, zodat het nog gemakkelijker is om vanaf dag één persoonlijke agents te bouwen en implementeren. Meer informatie en bronnen zijn te vinden op Meta's AI Developer Center.
Dit werk bouwt voort op de lange staat van dienst van Meta in open AI-onderzoek, breidt dit uit naar agentische AI en geeft ontwikkelaars toegang tot lokale agentische mogelijkheden. Zoals altijd verwelkomen we feedback van de community en kijken we uit naar wat ontwikkelaars zullen bouwen met dit open-weight model.