Brief IA : Muse Glimmer 30B génère un projet FastAPI complet en 2 minutes

Muse Glimmer 30B génère un projet FastAPI complet en 2 minutes

Brief IA
Tom Levy·3 min·1 vues

En local, des mesures rapportent environ 46 tokens/s au début et près de 127 tokens/s sur des tâches longues. Une API FastAPI complète a été générée en environ 2 minutes et documentée sur http://localhost:8000/docs. pi-llama se connecte à http://localhost:8080/v1 et détecte les modèles sans models.json.

En bref
1En local, des mesures rapportent environ 46 tokens/s au début et près de 127 tokens/s sur des tâches longues.
2Une API FastAPI complète a été générée en environ 2 minutes et documentée sur http://localhost:8000/docs.
3pi-llama se connecte à http://localhost:8080/v1 et détecte les modèles sans models.json.
💡Pourquoi c'est importantCette configuration permet de construire, tester et déboguer un projet intégralement en local via un agent, sans recourir à des services externes.
Le brief IA que lisent les pros

Tu codes avec l’IA ?

Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Un montage reliant Muse Glimmer au serveur llama.cpp et à l’agent Pi permet de coder et de tester un projet entièrement en local, avec accélération par DFlash. Des mesures font état d’environ 46 tokens/s au démarrage et jusqu’à 127 tokens/s sur des tâches longues. Sur un scénario FastAPI, un projet complet a été généré en environ 2 minutes. Des limites subsistent selon les essais, notamment face à Qwen3.8-27B pour des jeux et applications HTML.

Des tests locaux affichent 46 à 127 tokens/s et un build en 2 minutes

Des essais locaux ont mesuré environ 46 tokens par seconde lors des premières utilisations, et jusqu’à environ 127 tokens par seconde sur des tâches de codage plus longues. Sur un scénario complet, une API de gestion de tâches avec FastAPI a été générée en environ 2 minutes, puis l’agent a été chargé de tester l’API et de fournir un rapport final. Selon ces retours, l’agent a été rapide, a enchaîné les étapes et a corrigé en quelques secondes certains problèmes lors du débogage. Les résultats restent toutefois contrastés : un jeu HTML généré ne fonctionnait pas correctement, et Qwen3.8-27B a mieux réussi pour des applications et jeux HTML.

Pi se connecte au serveur local et détecte les modèles sans models.json

L’installation de l’agent de codage Pi s’effectue à l’aide d’un script unique, suivie par l’ajout de l’extension pi-llama de Hugging Face, un redémarrage du terminal étant recommandé. L’extension établit d’elle-même la connexion à l’API locale à l’adresse http://localhost:8080/v1 et identifie les modèles proposés par llama.cpp sans nécessiter de configuration manuelle de models.json. Un projet vide peut être initialisé dans /workspace/glimmer-test, et Muse Glimmer apparaît comme modèle disponible via le fournisseur llama-cpp de Pi. L’interface Web de llama.cpp reste accessible à l’adresse http://localhost:8080/ pour des essais interactifs.

Télécharger les GGUF et démarrer llama.cpp avec DFlash sur GPU

Le modèle principal et le rédacteur DFlash se récupèrent sur Hugging Face, puis sont stockés dans /workspace/muse-glimmer. Le fichier principal muse-glimmer-30B-kquant-17gb.gguf pèse 16,8 Go et le rédacteur dflash-kquant.gguf 1,63 Go. Le CLI Hugging Face s’installe par script avant le téléchargement. llama.cpp est cloné depuis le dépôt officiel, compilé en Release avec l’option CUDA, et un lien symbolique vers llama-server est ajouté dans /root/.local/bin. Le service est lancé en utilisant le décodage spéculatif DFlash (spec-type draft-dflash), avec un spec-draft-n-max fixé à 15, spec-draft-ngl à all, un contexte de 16384 et l’hôte 0.0.0.0. Le serveur charge le modèle principal et le rédacteur DFlash sur le GPU, le décodage spéculatif étant utilisé pour accélérer la génération.

Comparaisons annoncées et perspectives d’évolution

Dans l’écosystème local, Muse Glimmer est rapproché de modèles de classe 27B comme ceux de Qwen, avec des retours faisant état d’un avantage fréquent pour le codage local et les flux agentiques. La mise en place décrite a été jugée simple, malgré des imperfections encore présentes. Des améliorations sont anticipées pour Muse Glimmer, llama.cpp, DFlash et les outils associés, visant de meilleurs résultats, des vitesses plus élevées et une performance agentique renforcée en local. Il est par ailleurs suggéré d’essayer ces modèles sur des cartes RTX 3090, 4090 ou 5090, tandis que l’expérience des modèles locaux est décrite comme se rapprochant de celle de systèmes comme GLM-5.2.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires