Brief IA : Mythos et llama.cpp : révolutionner le codage local

Mythos et llama.cpp : révolutionner le codage local

Brief IA
Tom Levy·8 min·1 vues

Le modèle Qwythos-9B-Claude-Mythos-5-1M est un modèle de codage de 9 milliards de paramètres, conçu pour les tâches locales et capable de fonctionner sur du matériel grand public comme une RTX 4070 Ti Super. Son utilisation avec llama.cpp permet de démocratiser l'accès à des modèles puissants pour le développement local, sans dépendre d'APIs externes, facilitant ainsi le développement d'agents et d'outils CLI.

En bref
1Qwythos-9B-Claude-Mythos-5-1M est un modèle de codage de 9 milliards de paramètres, adapté aux tâches locales.
2L'installation de llama.cpp permet d'exécuter ce modèle sur du matériel grand public, comme une RTX 4070 Ti Super.
3Pi peut être intégré pour utiliser le modèle comme agent de codage, facilitant le développement de jeux et outils CLI.
💡Pourquoi c'est importantCette approche démocratise l'accès à des modèles puissants pour le développement local, sans dépendre d'APIs externes.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Introduction au modèle Qwythos-9B-Claude-Mythos-5-1M

Le modèle Qwythos-9B-Claude-Mythos-5-1M est un outil de raisonnement et de codage doté de 9 milliards de paramètres. Basé sur Qwen3.5, il est spécialement conçu pour les flux de travail de codage locaux, le développement d'agents et les tâches nécessitant un contexte étendu. Sa particularité réside dans sa capacité à fonctionner efficacement sur du matériel grand public tout en offrant des performances suffisantes pour des tâches de codage pratiques.

Exécution locale avec llama.cpp

Pour exécuter ce modèle localement, nous utilisons llama.cpp. Ce guide explique comment installer et configurer cet outil pour faire tourner le modèle Qwythos amélioré par Mythos. L'installation se fait sur une RTX 4070 Ti Super avec 16 Go de VRAM, permettant de gérer confortablement la quantification Q6_K MTP. Pour les utilisateurs disposant d'un GPU de 8 Go, il est recommandé de commencer avec la variante Q4_K_M, qui offre un bon compromis entre qualité, vitesse et utilisation de la mémoire.

Installation de llama.cpp

Commencez par installer l'interface de ligne de commande officielle de llama.cpp. Cela vous donnera accès à la commande llama, y compris llama serve, que nous utiliserons pour exécuter le modèle localement.

curl -LsSf https://llama.app/install.sh | sh

Ensuite, ajoutez le répertoire d'installation à votre chemin de shell afin que votre terminal puisse trouver la commande llama :

echo 'export PATH="$HOME/.local/bin:$PATH"' >> ~/.bashrc
source ~/.bashrc

Pour confirmer que l'installation a fonctionné, exécutez :

llama --help

Si tout est installé correctement, vous devriez voir les commandes et options disponibles de llama.cpp.

Configuration d'un répertoire de cache Hugging Face

Définissez le cache Hugging Face à un emplacement avec suffisamment d'espace de stockage libre. Cela est particulièrement utile sur les machines cloud où le répertoire personnel par défaut a un espace disque limité.

export HF_HOME="/workspace/huggingface"
mkdir -p "$HF_HOME"

Pour le conserver à travers les nouvelles sessions de terminal, ajoutez-le à votre configuration de shell :

echo 'export HF_HOME="/workspace/huggingface"' >> ~/.bashrc
source ~/.bashrc

Démarrage du modèle Qwythos MTP

Exécutez le modèle Q6_K MTP GGUF avec toutes les couches GPU disponibles :

llama serve -hf "empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF:MTP-Q6_K" \
--alias "qwythos-9b-mtp" \
--host 0.0.0.0 \
--n-gpu-layers all \
--ctx-size 100000 \
--batch-size 1024 \
--ubatch-size 512 \
--flash-attn on \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--spec-type draft-mtp \
--spec-draft-n-max 6 \
--threads-batch 24 \
--repeat-penalty 1.05

La première fois que vous exécutez cette commande, llama.cpp téléchargera les fichiers du modèle depuis Hugging Face. Après cela, il chargera le modèle dans la mémoire GPU et démarrera un serveur local.

Une fois le modèle en cours d'exécution, ouvrez l'interface locale dans votre navigateur :

http://localhost:8910

Cela vous donne également un point de terminaison API local compatible avec OpenAI à :

http://localhost:8910/v1

La variante Q6_K offre une meilleure qualité de sortie, mais utilise également plus de mémoire. Si vous rencontrez des problèmes de VRAM ou de RAM, réduisez d'abord --ctx-size. Si cela ne suffit pas, essayez la variante Q4_K_M à la place.

Voici les options les plus importantes dans la commande :

  • --n-gpu-layers all : Décharge toutes les couches supportées sur le GPU.
  • --ctx-size 100000 : Alloue une fenêtre de contexte de 100 000 tokens. Réduisez cela si vous manquez de VRAM ou de RAM.
  • --cache-type-k q8_0 et --cache-type-v q8_0 : Réduit l'utilisation de la mémoire du cache KV tout en maintenant une bonne qualité.
  • --spec-type draft-mtp : Active le décodage spéculatif MTP.
  • --spec-draft-n-max 6 : Permet jusqu'à six tokens spéculatifs par étape.

Sur ma RTX 4070 Ti Super, j'obtenais environ 81,74 tokens par seconde. Dans mon test, le modèle était également capable de raisonner sur la tâche, d'appeler les outils nécessaires et de retourner le dernier prix de l'or lorsqu'il était utilisé dans le flux de travail de l'agent local.

Installation de Pi et intégration avec llama.cpp

Pi peut se connecter au serveur local llama.cpp et utiliser le modèle comme un agent de codage. Le plugin pi-llama est conçu pour connecter Pi à un serveur local llama.cpp en cours d'exécution, sans avoir besoin d'une clé API externe.

curl -fsSL https://pi.dev/install.sh | sh

Installez le plugin llama.cpp pour Pi :

pi install git:github.com/huggingface/pi-llama

Créez un petit projet de test :

mkdir new-project

Par défaut, le plugin recherche llama.cpp sur le port 8080. Dans ce guide, notre serveur local fonctionne sur le port 8910, donc nous devons définir la bonne adresse API locale avant de démarrer Pi :

export LLAMA_BASE_URL="http://127.0.0.1:8910/v1"

Dans Pi, tapez :

pi start

Sélectionnez l'alias du modèle local :

Vous devriez voir le modèle répertorié dans Pi, et une fois sélectionné, vous pouvez commencer à l'utiliser comme un agent de codage local.

Tester le modèle de codage amélioré par Mythos avec Pi

Il est maintenant temps de tester le modèle local sur de réelles tâches de codage à l'intérieur de Pi. J'ai utilisé deux tâches simples mais pratiques : un jeu de navigateur et un petit outil CLI Python.

Création d'un simple jeu de navigateur

Commencez par un prompt demandant à Pi de créer un petit jeu de navigateur appelé "Beat the AI".

  • Créez un simple jeu de navigateur appelé "Beat the AI".
  • Le joueur a 30 secondes pour répondre à de courtes questions de reconnaissance de motifs. Chaque bonne réponse augmente le score de un. Affichez un chronomètre de compte à rebours, un affichage du score, une barre de progression et un écran de résultats final.
  • Utilisez uniquement HTML, CSS et JavaScript pur.
  • Générez au moins trois types de questions, telles que des motifs numériques, des mathématiques rapides et de la logique verbale.
  • Ajoutez un bouton de redémarrage après la fin du jeu.
  • Rendez l'interface ludique et soignée.
  • Gardez tout le code facile à comprendre et évitez les fichiers inutiles.

Testez le jeu dans le navigateur avant de terminer.

Dans mon test, Pi a créé le jeu complet dans un seul fichier HTML avec CSS et JavaScript intégrés, ce qui garde le projet simple et facile à inspecter.

Pi a ensuite résumé ce qu'il a construit, y compris le compte à rebours de 30 secondes, le suivi du score, la barre de progression, les types de questions et le bouton de redémarrage.

Après cela, j'ai ouvert le jeu dans le navigateur pour vérifier qu'il fonctionnait correctement.

Le résultat était un petit jeu soigné avec :

  • Un chronomètre de compte à rebours
  • Plusieurs types de questions
  • Un flux de redémarrage après la fin du jeu

C'est un bon exemple de la façon dont le modèle peut gérer une tâche front-end complète localement sans avoir besoin d'une API externe.

Création d'un outil CLI Python pour convertir CSV en Excel

Pour le deuxième test, demandez à Pi de construire un petit outil CLI Python qui convertit un fichier CSV en un fichier Excel .xlsx.

  • Créez un simple outil CLI Python qui convertit un fichier CSV en un fichier Excel .xlsx, accepte les chemins de fichiers d'entrée et de sortie en tant qu'arguments, préserve les en-têtes de colonne, valide les fichiers manquants et imprime des messages de succès ou d'erreur clairs. Avant de terminer, créez un petit fichier CSV factice avec des données d'exemple, utilisez-le pour tester l'outil CLI, vérifiez que le fichier Excel est créé correctement, puis résumez le résultat du test.

Pi a créé un script Python nommé csv2excel.py, généré un fichier CSV d'exemple, exécuté la commande de test, puis résumé les résultats.

python csv2excel.py sample_data.csv output.xlsx

Dans mon exécution, le résumé montrait que le script :

  • Acceptait les chemins de fichiers d'entrée et de sortie.
  • Préservait les en-têtes de colonne.
  • Convertissait correctement les données d'exemple.
  • Gérait les fichiers manquants avec des messages d'erreur clairs.
  • Gérait correctement les chemins de sortie manquants.

J'ai également ouvert le fichier Excel généré pour confirmer que la sortie était correcte.

La sortie d'exemple préservait correctement les lignes et les en-têtes, ce qui confirmait que l'outil CLI fonctionnait comme prévu.

Réflexions finales

J'apprécie vraiment ce petit modèle de codage local. Il est rapide, suffisamment précis pour les tâches de codage quotidiennes, et ne nécessite pas une énorme quantité de VRAM pour être utile. Vous pouvez l'utiliser avec Pi, Claude Code, OpenCode, ou tout autre environnement de codage qui prend en charge les points de terminaison compatibles avec OpenAI ou Anthropic.

Pour des applications front-end de base, des scripts Python, des outils CLI et des prototypes rapides, il fonctionne étonnamment bien. Vous pouvez créer des projets utiles localement sans dépendre d'APIs externes ou payer pour chaque requête.

Pour obtenir des résultats encore meilleurs, je recommande vivement d'ajouter des compétences de recherche sur le web, Context7, et d'autres intégrations utiles de Pi. Vous pouvez également consulter mon guide complet sur l'optimisation de votre configuration d'agent de codage Pi ici : Comment configurer Kimi K2.7 Code avec Pi : L'environnement de codage IA ultime.

Abid Ali Awan (@1abidaliawan) est un professionnel certifié en science des données qui aime construire des modèles d'apprentissage automatique. Actuellement, il se concentre sur la création de contenu et l'écriture de blogs techniques sur les technologies d'apprentissage automatique et de science des données. Abid détient un Master en gestion technologique et un baccalauréat en ingénierie des télécommunications. Sa vision est de construire un produit IA utilisant un réseau neuronal graphique pour les étudiants souffrant de problèmes de santé mentale.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires