Brief IA

LLM local lent : mémoire, mesures et réglages clés

🔬 Research·Tom Levy·

LLM local lent : mémoire, mesures et réglages clés

LLM local lent : mémoire, mesures et réglages clés
Key Takeaways
1La performance d’un LLM local dépend de la latence avant le premier token et du débit de génération.
2Ollama et llama-server permettent de mesurer séparément prefill et decode pour cibler la cause des lenteurs.
3Un decode lent est souvent lié à la bande passante ou à la mémoire, et la répartition GPU–CPU doit être évitée.
💡Why it mattersIdentifier précisément la source du ralentissement permet d'appliquer les bons réglages ou d'adapter le matériel, évitant des optimisations inutiles.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Toutes les lenteurs ne se valent pas sur un LLM installé en local. Entre l'attente avant le premier token et la cadence de génération, les causes diffèrent et n’appellent pas les mêmes remèdes. Des outils comme Ollama et llama-server aident à séparer prefill et decode, tandis que certaines configurations — notamment un modèle éclaté entre GPU et CPU — posent des limites que les simples réglages ne lèvent pas.

Le débit de génération dépend surtout de la mémoire et a ses limites

Quand la génération de tokens est lente, la cause est le plus souvent liée à la bande passante ou à la mémoire, plutôt qu'au calcul pur. Il est possible d'estimer un plafond de performance à partir de la bande passante mémoire et de la taille du modèle, puis d'en déduire s'il faut basculer vers un modèle plus petit ou vers une mémoire ou un bus plus rapides. Certaines techniques, comme le decoding spéculatif et MTP, cherchent à contourner ces limites, mais elles ne sont utiles que sur des charges bien particulières. Elles peuvent aussi se retourner contre l'objectif en ralentissant ou en consommant davantage de VRAM ou de contexte.

Mesurer séparément prefill et decode avec Ollama ou llama-server

Deux indicateurs sont essentiels pour comprendre la performance : le prefill, qui correspond à l'évaluation de l'invite, et le decode, qui est la génération des tokens. Les sorties détaillées d'Ollama affichent ces métriques, ce qui permet d'identifier la partie en cause. Les temps exposés par llama-server fournissent également ces mesures, facilitant le diagnostic entre latence au premier token et débit de génération.

Éviter la répartition GPU–CPU et appliquer les bons réglages

Un point de contrôle initial consiste à vérifier que le modèle n'est pas réparti entre GPU et CPU, car une telle configuration force des blocages des deux pour chaque token et ne se corrige pas par d'autres réglages. Côté paramètres, comparer cache_n à prompt_n permet de confirmer que la mise en cache est effective. Ajuster les tailles de lot, y compris via -ub et -ubatch, peut améliorer le prefill lorsque c'est adapté. Distinguer dès le départ l'attente avant le premier mot et la vitesse de génération évite de chercher une solution au mauvais endroit.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.