Tu codes avec l’IA ?
Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un montage reliant Muse Glimmer au serveur llama.cpp et à l’agent Pi permet de coder et de tester un projet entièrement en local, avec accélération par DFlash. Des mesures font état d’environ 46 tokens/s au démarrage et jusqu’à 127 tokens/s sur des tâches longues. Sur un scénario FastAPI, un projet complet a été généré en environ 2 minutes. Des limites subsistent selon les essais, notamment face à Qwen3.8-27B pour des jeux et applications HTML.
Des tests locaux affichent 46 à 127 tokens/s et un build en 2 minutes
Des essais locaux ont mesuré environ 46 tokens par seconde lors des premières utilisations, et jusqu’à environ 127 tokens par seconde sur des tâches de codage plus longues. Sur un scénario complet, une API de gestion de tâches avec FastAPI a été générée en environ 2 minutes, puis l’agent a été chargé de tester l’API et de fournir un rapport final. Selon ces retours, l’agent a été rapide, a enchaîné les étapes et a corrigé en quelques secondes certains problèmes lors du débogage. Les résultats restent toutefois contrastés : un jeu HTML généré ne fonctionnait pas correctement, et Qwen3.8-27B a mieux réussi pour des applications et jeux HTML.
Pi se connecte au serveur local et détecte les modèles sans models.json
L’installation de l’agent de codage Pi s’effectue à l’aide d’un script unique, suivie par l’ajout de l’extension pi-llama de Hugging Face, un redémarrage du terminal étant recommandé. L’extension établit d’elle-même la connexion à l’API locale à l’adresse http://localhost:8080/v1 et identifie les modèles proposés par llama.cpp sans nécessiter de configuration manuelle de models.json. Un projet vide peut être initialisé dans /workspace/glimmer-test, et Muse Glimmer apparaît comme modèle disponible via le fournisseur llama-cpp de Pi. L’interface Web de llama.cpp reste accessible à l’adresse http://localhost:8080/ pour des essais interactifs.
Télécharger les GGUF et démarrer llama.cpp avec DFlash sur GPU
Le modèle principal et le rédacteur DFlash se récupèrent sur Hugging Face, puis sont stockés dans /workspace/muse-glimmer. Le fichier principal muse-glimmer-30B-kquant-17gb.gguf pèse 16,8 Go et le rédacteur dflash-kquant.gguf 1,63 Go. Le CLI Hugging Face s’installe par script avant le téléchargement. llama.cpp est cloné depuis le dépôt officiel, compilé en Release avec l’option CUDA, et un lien symbolique vers llama-server est ajouté dans /root/.local/bin. Le service est lancé en utilisant le décodage spéculatif DFlash (spec-type draft-dflash), avec un spec-draft-n-max fixé à 15, spec-draft-ngl à all, un contexte de 16384 et l’hôte 0.0.0.0. Le serveur charge le modèle principal et le rédacteur DFlash sur le GPU, le décodage spéculatif étant utilisé pour accélérer la génération.
Comparaisons annoncées et perspectives d’évolution
Dans l’écosystème local, Muse Glimmer est rapproché de modèles de classe 27B comme ceux de Qwen, avec des retours faisant état d’un avantage fréquent pour le codage local et les flux agentiques. La mise en place décrite a été jugée simple, malgré des imperfections encore présentes. Des améliorations sont anticipées pour Muse Glimmer, llama.cpp, DFlash et les outils associés, visant de meilleurs résultats, des vitesses plus élevées et une performance agentique renforcée en local. Il est par ailleurs suggéré d’essayer ces modèles sur des cartes RTX 3090, 4090 ou 5090, tandis que l’expérience des modèles locaux est décrite comme se rapprochant de celle de systèmes comme GLM-5.2.






