Meta publie Muse Glimmer, un modèle local pensé pour les agents
Meta met en open source Muse Glimmer, un modèle de 30 milliards de paramètres conçu pour tourner localement sur Mac ou PC. L’objectif: exécuter des agents, du code et des appels d’outils sans dépendre du cloud.
Meta a présenté Muse Glimmer, un modèle de 30 milliards de paramètres optimisé pour des workflows d’agents en local, et publié ses poids sous licence Apache 2.0. Concrètement, le modèle est pensé pour tourner sur un Mac ou un PC équipé d’un seul GPU grand public, sans connexion permanente au cloud. L’enjeu est simple: rendre l’IA plus réactive, plus privée et plus utile sur la machine de l’utilisateur, surtout pour les tâches longues ou répétitives.
Un modèle de 30 milliards de paramètres, mais pas une usine à gaz
Muse Glimmer vise des usages très concrets: agents locaux, appel de fonctions, assistance au code et évaluation de réponses de modèles, avec exécution sur matériel grand public. Meta explique avoir compressé le modèle en 4 bits environ, ce qui ramène son poids à moins de 20 Go, contre plus de 55 Go en précision complète. Ce choix laisse assez de marge pour la mémoire de travail, l’analyse d’images et le décodage spéculatif sur une enveloppe de 24 Go ou 32 Go. Le modèle a aussi été conçu pour répondre vite, car un agent qui réfléchit trois minutes perd un peu son charme, et beaucoup de productivité.
La société affirme que cette approche permet un usage fluide en conversation comme en interaction agentique, entièrement sur l’appareil. Le modèle est distribué sur Hugging Face, avec de la documentation pour démarrer et des intégrations annoncées dans les prochains jours pour llama.cpp, MLX et ExecuTorch. Meta dit aussi travailler avec des partenaires comme AMD, Arm, Dell, Intel et NVIDIA pour optimiser les performances sur différents appareils.
Une recette d’entraînement centrée sur le raisonnement agentique
Pour entraîner Muse Glimmer, Meta dit avoir combiné plusieurs étapes. D’abord du pré-entraînement sur les sorties de Muse Spark via distillation logit, puis un milieu d’entraînement sur des données plus longues et plus orientées agents, enfin une phase post-entraînement mêlant supervision, distillation sur politique et apprentissage par renforcement. L’idée est de transférer une partie du raisonnement d’un modèle enseignant plus large vers un modèle plus compact, sans sacrifier trop de capacité.
Le modèle a été évalué selon le cadre Advanced AI Scaling Framework de Meta, avec un contrôle sur les catégories pertinentes pour une publication en poids ouverts. Les benchmarks cités incluent DeepSearch QA, MCP-Atlas, ℱ-Bench [à vérifier] et SWE-Bench, qui testent la résolution de tâches de bout en bout, le code et les requêtes multi-tours. Meta dit que Muse Glimmer se compare bien à Gemma4-31B et Qwen3.6-27B sur plusieurs tests utilisés dans la famille des grands modèles de langage.
Pourquoi Meta pousse le local maintenant
Le mouvement n’est pas anodin. Depuis des mois, les modèles les plus visibles se concentrent dans le cloud, avec leurs coûts d’inférence, leurs contraintes de réseau et leurs questions de confidentialité. En poussant un modèle local et ouvert, Meta cherche à élargir le terrain de jeu des développeurs, mais aussi à s’installer sur une brique stratégique: celle des agents personnels capables d’agir sur des fichiers, des messages ou un agenda avec plus de contexte que ne le permet une simple fenêtre de chat.
Le modèle prend en charge plus de 100 langues, gère du texte et des images, et peut récupérer après un échec de fonction au lieu de s’arrêter net. Cette robustesse compte pour les usages professionnels, où l’agent doit enchaîner plusieurs étapes sans se perdre en route. Pour les développeurs, Muse Glimmer arrive avec des partenaires de distribution comme Ollama, LM Studio, Unsloth, Together AI, Fireworks AI et OpenRouter, ainsi qu’avec des outils de déploiement comme vLLM et SGLang.
En chiffres
- 30 milliards — paramètres du modèle Muse Glimmer.
- Moins de 20 Go — taille visée après quantification, selon Meta.
- Plus de 55 Go — mémoire requise en précision complète, selon Meta.
- Plus de 100 langues — langues couvertes par l’entraînement.
- 2 modèles cités — comparaison avec Gemma4-31B et Qwen3.6-27B.