Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Meta Muse Glimmer : une avancée pour l'IA locale
Meta a récemment dévoilé Muse Glimmer, un modèle d'agent IA conçu pour fonctionner efficacement sur des GPU grand public. Publié sous une licence Apache 2.0, ce modèle de 30 milliards de paramètres est désormais accessible via la plateforme Hugging Face. Meta a mis en avant l'utilisation de Muse Glimmer pour diverses applications, telles que le codage local, l'appel de fonctions, et l'évaluation des modèles de langage de grande taille (LLM) en tant que juges. Cette initiative vise à surmonter les limitations des modèles hébergés dans le cloud, qui nécessitent une connexion réseau constante et une infrastructure centralisée. En proposant Muse Glimmer, Meta offre une solution pour les charges de travail nécessitant un traitement sur appareil, incluant des agents personnels capables d'accéder à des informations privées comme les calendriers, messages et fichiers.
Des performances de pointe dans les benchmarks d'agents
Les tests de performance menés par Meta ont placé Muse Glimmer en tête sur plusieurs benchmarks d'agents généraux. Par exemple, sur le benchmark MCP Atlas, Muse Glimmer a obtenu un score impressionnant de 75,5, surpassant Gemma4-31B qui a marqué 54,2, et Qwen3.6-27B avec 62,5. Dans le test DeepSearch QA, Muse Glimmer a également dominé avec un score de 74,6, comparé aux 61,7 de Gemma4-31B et 71,1 de Qwen3.6-27B. Ces benchmarks évaluent la capacité des agents à exécuter des tâches complexes et à gérer des demandes multi-tours. Sur τ²-Banking, Muse Glimmer a enregistré 23,5, tandis que Gemma4-31B et Qwen3.6-27B ont respectivement obtenu 15,1 et 16,7. De plus, dans le benchmark WildClawBench, Muse Glimmer a marqué 47,6, surpassant les scores de ses concurrents.
Cependant, certains benchmarks ont favorisé Qwen3.6-27B, notamment sur GDPval-AA où il a obtenu 1 141 points contre 953 pour Muse Glimmer. Sur SkillsBench, Qwen3.6-27B a également pris la tête avec un score de 46,6, tandis que Muse Glimmer a marqué 44,3. Le benchmark OSWorld-Verified a montré le plus grand écart, avec Qwen3.6-27B à 75,6, Muse Glimmer à 65,9, et Gemma4-31B à 58,5. Ces résultats démontrent la compétitivité de Muse Glimmer, bien qu'ils ne reflètent pas nécessairement son comportement une fois intégré dans des systèmes d'entreprise.
Comparaison des capacités de codage
Dans le domaine du codage, Muse Glimmer a montré des performances remarquables. Sur le benchmark SWE-Bench Pro, il a obtenu un score de 51,2, surpassant Gemma4-31B à 36,9 et Qwen3.6-27B à 50,2. Sur SciCode, Muse Glimmer a légèrement devancé Gemma4-31B avec un score de 43,6 contre 43,4, tandis que Qwen3.6-27B a obtenu 39,8. Cependant, Qwen3.6-27B a dominé d'autres évaluations, notamment SWE-Bench Verified avec 77,2 contre 76,0 pour Muse Glimmer, et TerminalBench 2.1 avec 60,7, où Muse Glimmer a marqué 51,7.
Un agent de codage local doit être capable de plus que simplement générer du code. Il doit pouvoir interagir avec des dépôts, des terminaux, et des environnements de test. Muse Glimmer prend en charge des modèles d'orchestration d'agents comme OpenClaw, et sa documentation développe des structures personnalisées pour les développeurs. Les entreprises doivent définir les commandes et dépôts accessibles à l'agent pour évaluer ses performances. Le modèle inclut des mécanismes pour gérer les appels d'outils échoués, nécessitant des contrôles sur les tentatives répétées pour éviter des modifications indésirables du code source.
Performance multimodale : texte et images
Muse Glimmer est également conçu pour traiter des données multimodales, intégrant texte et images grâce à un encodeur de perception dédié. Ce design permet aux agents d'interpréter des captures d'écran, graphiques et documents dans le cadre de conversations. Dans le benchmark Charxiv Reasoning, Muse Glimmer a obtenu un score de 78,8, surpassant Gemma4-31B à 77,7 et Qwen3.6-27B à 78,4. Cependant, Qwen3.6-27B a dominé d'autres tests comme ScreenSpot Pro avec 76,1, où Muse Glimmer a marqué 75,4.
Ces résultats sont cruciaux pour les équipes qui envisagent d'utiliser des agents capables d'interagir avec des interfaces visuelles. Bien que Muse Glimmer montre des capacités prometteuses, des tests locaux doivent encore évaluer les permissions, mises en page d'affichage, et erreurs potentielles des outils connectés.
Sécurité : une évaluation des risques
Meta a également évalué Muse Glimmer sur des critères de sécurité, notamment avec les tests CI Memories et Siren AgentDojo. Sur CI Memories, Muse Glimmer a enregistré un taux de violation de 26,4 et une couverture de 64,8, tandis que Gemma4-31B a montré un taux de violation de 12,1 et une couverture de 53,0. Qwen3.6-27B a affiché un taux de violation de 53,4 avec une couverture de 66,9.
Dans Siren AgentDojo, Muse Glimmer a obtenu un taux de succès d'attaque de 28,4 et un score d'utilité de 94,2. Gemma4-31B a marqué 25,6 pour le taux de succès d'attaque et 90,8 pour l'utilité, tandis que Qwen3.6-27B a enregistré 40,3 et 92,7 respectivement.
Raisonnement général : une comparaison nuancée
Dans les tests de raisonnement général, Muse Glimmer a dominé quatre des six évaluations. Sur IFBench, il a obtenu 77,0, surpassant Gemma4-31B à 76,0 et Qwen3.6-27B à 70,8. Sur AIME 2026, Muse Glimmer a marqué 94,7, contre 89,2 pour Gemma4-31B et 94,1 pour Qwen3.6-27B. Le modèle a également mené sur AA-LCR avec 80,0, devant 68,3 et 73,3.
Cependant, Gemma4-31B a pris la tête sur GPQA Diamond avec 85,7, suivi par Muse Glimmer à 83,5 et Qwen3.6-27B à 84,2. Sur Humanity’s Last Exam, Text No Tools, Gemma4-31B a marqué 23,6, tandis que Muse Glimmer a obtenu 22,0.
Défis de mémoire et solutions de déploiement
Meta a conçu Muse Glimmer pour fonctionner avec une mémoire réduite. Un modèle à pleine précision de 30 milliards de paramètres nécessiterait plus de 55 Go de mémoire, mais grâce à une quantification de poids à environ 4 bits, le modèle est réduit à moins de 20 Go. Cela permet de libérer de la mémoire pour un cache KV, un encodeur de perception, et un rédacteur de décodage spéculatif. Meta recommande une enveloppe mémoire de 24 Go ou 32 Go pour ces composants.
Le rédacteur basé sur DFlash propose des blocs de jetons vérifiés en parallèle par le modèle principal, accélérant ainsi la génération tout en maintenant une qualité de sortie élevée. Bien que Meta n'ait pas fourni de chiffres précis sur les performances en termes de jetons par seconde ou de consommation d'énergie, les tests sur des matériels comme MacBook M4-Max, MacBook M5-Max, et RTX-5090 ont montré une interaction fluide et en temps réel avec l'agent.
Les poids du modèle sont disponibles sur Hugging Face, et Meta prévoit des intégrations avec llama.cpp, MLX, et ExecuTorch dans un avenir proche.




