Muse Glimmer sur Ollama : le modèle agent ouvert 30B de Meta expliqué
Le 10 août 2026 Meta Superintelligence Labs a publié son premier modèle ouvert : Muse Glimmer. C'est un modèle multimodal de 30 milliards de paramètres conçu pour les charges agentiques qui tournent en local. Il est distillé depuis Muse Spark, publié sous licence Apache 2.0 et disponible sur Ollama dès le premier jour.
Là où la plupart des modèles ouverts d'IA récents visent la qualité générale du chat, Muse Glimmer a une mission plus étroite : alimenter des agents de code comme Claude Code, Codex, Pi et OpenCode ainsi que des assistants personnels longue durée comme OpenClaw et Hermes — entièrement sur votre matériel, sans cloud et sans facturation au token.
Ce guide couvre le modèle en profondeur : architecture, modes de raisonnement, besoins matériels, configuration Ollama, benchmarks et comparaison détaillée avec Gemma 4, Qwen 3.6 et les autres modèles ouverts récents pour décider si Muse Glimmer a sa place sur votre machine.
Ce qu'est vraiment Muse Glimmer
| Propriété | Valeur |
|---|---|
| Date de sortie | 10 août 2026 par Meta Superintelligence Labs |
| Paramètres | Environ 30B |
| Fenêtre de contexte | 128K tokens par défaut avec un maximum de 131072 tokens |
| Langues | Plus de 100 langues |
C'est un modèle dense et non un mélange d'experts. Chacun des 30B paramètres est actif sur chaque token. Cela apporte une latence prévisible, un suivi d'instructions fiable et moins de modes d'échec de routage sur de longues chaînes d'outils. Le prix est un calcul par token plus élevé qu'un MoE parcimonieux comme Qwen 3.6 35B-A3B où seuls environ 3B paramètres sont actifs par token.
Pourquoi il est conçu pour les agents
Muse Glimmer a été entraîné et évalué pour la réalisation des tâches agentiques de bout en bout plutôt que pour des questions-réponses en un seul tour. Cinq capacités le définissent :
Usage d'outils fiable. Le modèle appelle des outils avec des schémas précis sur des flux étendus. Notez le format de sortie : Muse Glimmer émet un raisonnement à canaux séparés plus des appels d'outils ATEM de style XML plutôt que du simple JSON. Les frameworks ont besoin des parseurs dédiés muse_glimmer pour appels d'outils et raisonnement dans vLLM. Sur Ollama tout est pris en charge pour vous via les intégrations ollama launch.
Raisonnement multi-étapes. Muse Glimmer enchaîne le raisonnement sur de longs horizons et maintient des plans cohérents sur des flux qui couvrent des dizaines d'appels d'outils.
Reprise sur erreur. Quand un appel d'outil échoue ou renvoie un résultat inattendu le modèle diagnostique l'erreur et réessaie au lieu de s'arrêter. C'est l'un des comportements que Meta a réglés explicitement pour les agents permanents.
Compatibilité avec les frameworks. Il fonctionne avec OpenClaw, Hermes Agent et d'autres schémas d'orchestration sans ajustement (fine-tuning) spécifique à un framework.
Effort contrôlable. Quatre forces de raisonnement sont exposées : low, medium, high et xhigh. Utilisez high ou xhigh pour le code complexe et les tâches agentiques. Utilisez low ou medium quand la vitesse compte plus que la profondeur.
Si vous souhaitez seulement discuter avec le modèle, désactivez le mode de réflexion : consultez notre guide pour désactiver le mode de réflexion.
L'entrée multimodale complète le portrait agentique. L'encodeur de perception 1,8B lit captures d'écran, graphiques, reçus, maquettes et documents aux côtés du texte. Les usages pratiques incluent la construction d'un site depuis un dessin, le pilotage d'agents de type computer-use depuis des captures et la lecture de documents scannés en local.
L'exécuter avec Ollama
Il faut Ollama 0.31 ou plus récent pour la meilleure expérience, surtout sur Apple Silicon où DFlash et l'entrée image sont arrivés récemment. Le flux de base est familier :
# Construction dense par défaut, environ 18 Go
ollama run muse-glimmer
Besoins matériels
Muse Glimmer est conçu pour tenir sur un seul GPU grand public, mais « tenir » dépend de la quantization et de la longueur de contexte. À titre indicatif pour les quants Ollama par défaut :
| Votre machine | À quoi vous attendre |
|---|---|
| 8 Go de VRAM comme RTX 3070 | Possible seulement avec des constructions GGUF communautaires à très bas nombre de bits comme UD-IQ2_XXS à environ 11 Go de téléchargement plus déport CPU et RAM. Attendez-vous à un contexte par défaut réduit vers 8K et une vitesse modeste. |
| 16 Go de VRAM ou mémoire unifiée | Juste pour la construction officielle 18 Go. Préférez la construction MLX sur un Mac 24 Go ou un modèle plus petit comme Gemma 4 12B ou Qwen 3.6 avec des quants plus bas. |
| 24 Go de VRAM comme RTX 4090 | Le point idéal. La construction Q4 18 Go tient avec de la place pour un grand num_ctx. |
| 32 Go de VRAM comme RTX 5090 ou Mac 32 Go | Confortable. Exécutez la construction MLX ou NVFP4 à 128K de contexte complet avec de la marge pour des agents qui conservent beaucoup de résultats d'outils. |
| Station comme DGX Spark | Hôte idéal pour des agents permanents à contexte complet avec décodage spéculatif via la tête d'ébauche DFlash 5 Go. |
Deux leviers contrôlent l'empreinte exactement comme décrit dans notre guide Ollama complet : le nombre de paramètres et la quantization. Un troisième levier compte beaucoup ici : num_ctx. La fenêtre 128K est généreuse pour des agents qui accumulent des sorties d'outils, mais elle coûte de la mémoire via le cache KV. Si le modèle déborde de la VRAM vers la RAM système et ralentit, baissez num_ctx à 32768 ou 8192 avant d'accuser le modèle. Muse Glimmer est inhabituellement indulgent ici grâce à son cache de 52 Kio par token.
Un agent qui lit des fichiers, exécute des commandes et conserve les sorties terminal remplit vite 32K tokens. Commencez avec un grand num_ctx sur une carte 24 Go et réduisez-le seulement si vous voyez un débordement dans ollama ps. Associez cela aux règles mémoire de notre guide des modèles de code.
Apple Silicon, MLX et DFlash
Sur Mac, utilisez le tag MLX : ollama pull muse-glimmer:30b-mlx. Il est optimisé pour le moteur MLX d'Ollama et en tire deux avantages : le décodage spéculatif DFlash (jusqu'à 15 tokens proposés d'un coup par une petite tête d'ébauche, vérifiés en une seule passe) pour une génération 1,5x à 1,8x plus rapide sans aucune configuration, et l'entrée image native dans le chemin MLX pour des agents pilotés par captures et des flux maquette-vers-code à faible latence.
Muse Glimmer est plus lourd que les petits modèles de notre guide Gemma 4 sur Apple Silicon (30 à 50 tokens par seconde pour E2B et E4B sur M4, environ 25 tokens par seconde pour le 12B sur machines 16 Go). Attendez-vous aux meilleures vitesses sur des Mac 24 Go et plus. La construction MLX reste le tag recommandé sur tout Mac M-series.
Ce que NVIDIA annonce
NVIDIA présente Muse Glimmer comme un équilibre optimal pour les agents locaux : assez grand pour un raisonnement multi-étapes complexe mais assez petit pour éviter le partitionnement de modèle ou le déport CPU sur un seul GPU. Les chiffres annoncés sur Blackwell Ultra dépassent 20000 tokens par seconde par GPU en précision BF16 et NVF4 avec une concurrence élevée maintenue sans surcoût de routage MoE.
Benchmarks en contexte
Meta a comparé Muse Glimmer en mode raisonnement élevé à Gemma 4 31B en mode réflexion et Qwen 3.6 27B en mode réflexion. Le suivi indépendant via Artificial Analysis raconte une histoire globalement similaire avec de petites différences de classement. Voici les chiffres principaux de l'évaluation Meta :
| Catégorie | Benchmark | Muse Glimmer 30B | Gemma 4 31B | Qwen 3.6 27B |
|---|---|---|---|---|
| Agentique générale | MCP Atlas public | 75,5 | 54,2 | 62,5 |
| Agentique générale | DeepSearch QA | 74,6 | 61,7 | 71,1 |
| Agentique générale | Tau3-Banking | 23,5 | 15,1 | 16,7 |
| Agentique générale | WildClawBench | 47,6 | 37,6 | 43,2 |
| Agentique générale | Gaia2 | 43,3 | 36,4 | 40,0 |
| Code agentique | SWE-Bench Pro | 51,2 | 36,9 | 50,2 |
| Code agentique | SWE-Bench Verified | 76,0 | 66,6 | 77,2 |
| Code agentique | TerminalBench 2.1 | 51,7 | 43,4 | 60,7 |
| Code agentique | SciCode | 43,6 | 43,4 | 39,8 |
| Multimodal | Charxiv reasoning | 78,8 | 77,7 | 78,4 |
| Multimodal | ScreenSpot Pro | 75,4 | 75,9 | 76,1 |
| Multimodal | OmniDocBench 1.5 | 75,8 | 72,5 | 77,8 |
| Raisonnement | AIME 2026 | 94,7 | 89,2 | 94,1 |
| Raisonnement | IFBench | 77,0 | 76,0 | 70,8 |
| Raisonnement | AA-LCR contexte long | 80,0 | 68,3 | 73,3 |
| Raisonnement | Beam128K | 65,1 | 58,2 | 63,0 |
Trois enseignements. Muse Glimmer domine les benchmarks agentiques (MCP Atlas avec 13 points d'avance sur Qwen et 21 sur Gemma, plus des avances nettes sur DeepSearch QA, Tau3-Banking, WildClawBench et Gaia2). Sur le code il est au coude à coude avec Qwen : Muse Glimmer mène SWE-Bench Pro et SciCode, Qwen mène SWE-Bench Verified et TerminalBench, et Gemma 4 suit derrière les deux. Le multimodal et le raisonnement à contexte long favorisent Muse Glimmer, tandis que Qwen garde un petit avantage sur les tâches serveur de style OSWorld et GDPVal.
Comparaison avec les modèles ouverts récents
Résumé côte à côte
| Modèle | Params et archi | Contexte | Licence | Taille | Idéal pour |
|---|---|---|---|---|---|
| Muse Glimmer 30B | 29,6B dense plus 1,8B visuel | 128K | Apache 2.0 | Environ 18 Go | Agents locaux permanents, boucles d'outils et reprise sur erreur |
| Gemma 4 31B | 30,7B dense | 256K | Apache 2.0 | Environ 19 Go | Chat multilingue, étendue multimodale et préférence humaine |
| Gemma 4 26B-A4B | 25,2B MoE avec 3,8B actifs | 256K | Apache 2.0 | Environ 15 Go | Meilleure qualité par Go sur portables et GPU milieu de gamme |
| Gemma 4 12B | 11,95B unifié | 256K | Apache 2.0 | Environ 7 Go | Modèle unique pour chat plus code léger sur machines 16 Go |
| Qwen 3.6 27B | 27B dense | 262K | Apache 2.0 | Environ 16 Go | Génération de code pure et raisonnement sur cartes 24 Go |
| Qwen 3.6 35B-A3B | 35B MoE avec 3B actifs | 262K | Apache 2.0 | Environ 21 Go | Code agentique efficace à faible coût par token |
| DeepSeek-R1 distillat 32B | 32B dense | 128K | MIT | Environ 20 Go | Maths, débogage pas à pas et tâches lourdes en logique |
| GLM-5.2 | 744B MoE | 1M | MIT | Serveur seul | Agents d'ingénierie logicielle à long horizon |
| Kimi K3 | 1000B MoE | 1M | Poids ouverts bespoke | Serveur seul | Agents marathon et meilleurs scores de code ouverts |
Limites et compromis honnêtes
Muse Glimmer est fort mais pas universel. Son contexte 128K reste derrière Gemma 4 à 256K, Qwen 3.6 à 262K et les modèles de frontière à 1M. L'analyse d'un dépôt à l'échelle de centaines de fichiers favorise toujours les fenêtres plus grandes. Sa conception dense coûte plus par token que les rivaux MoE à qualité similaire. Le format d'outils ATEM de style XML demande une prise en charge du parseur hors Ollama, tandis que Qwen et Gemma restent sur des schémas d'outils JSON plus conventionnels. La vision couvre l'entrée texte plus image seule, sans pistes audio ou vidéo comme les modèles E de Gemma. Les benchmarks de sécurité montrent une utilité solide mais confirment que tout agent avec accès shell a besoin de bac à sable, de délais d'expiration et de revue humaine pour les actions destructrices.
Aucun de ces points n'est disqualifiant. Ils définissent où Muse Glimmer s'insère : le meilleur cerveau agent ouvert qui tourne encore sur un bon GPU grand public avec une licence Apache 2.0 propre et un petit cache KV qui garde les longues sessions d'outils pratiques.
Meta revient aux poids ouverts après le long silence de l'ère Llama. Muse Glimmer n'est pas le plus grand modèle de 2026 et il ne cherche pas à l'être. C'est le modèle 30B le plus centré agent que vous pouvez auto-héberger aujourd'hui — et cela en fait l'un des modèles les plus utiles à télécharger avec Ollama cette année.