LLM local lent : mémoire, mesures et réglages clés

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Toutes les lenteurs ne se valent pas sur un LLM installé en local. Entre l'attente avant le premier token et la cadence de génération, les causes diffèrent et n’appellent pas les mêmes remèdes. Des outils comme Ollama et llama-server aident à séparer prefill et decode, tandis que certaines configurations — notamment un modèle éclaté entre GPU et CPU — posent des limites que les simples réglages ne lèvent pas.
Le débit de génération dépend surtout de la mémoire et a ses limites
Quand la génération de tokens est lente, la cause est le plus souvent liée à la bande passante ou à la mémoire, plutôt qu'au calcul pur. Il est possible d'estimer un plafond de performance à partir de la bande passante mémoire et de la taille du modèle, puis d'en déduire s'il faut basculer vers un modèle plus petit ou vers une mémoire ou un bus plus rapides. Certaines techniques, comme le decoding spéculatif et MTP, cherchent à contourner ces limites, mais elles ne sont utiles que sur des charges bien particulières. Elles peuvent aussi se retourner contre l'objectif en ralentissant ou en consommant davantage de VRAM ou de contexte.
Mesurer séparément prefill et decode avec Ollama ou llama-server
Deux indicateurs sont essentiels pour comprendre la performance : le prefill, qui correspond à l'évaluation de l'invite, et le decode, qui est la génération des tokens. Les sorties détaillées d'Ollama affichent ces métriques, ce qui permet d'identifier la partie en cause. Les temps exposés par llama-server fournissent également ces mesures, facilitant le diagnostic entre latence au premier token et débit de génération.
Éviter la répartition GPU–CPU et appliquer les bons réglages
Un point de contrôle initial consiste à vérifier que le modèle n'est pas réparti entre GPU et CPU, car une telle configuration force des blocages des deux pour chaque token et ne se corrige pas par d'autres réglages. Côté paramètres, comparer cache_n à prompt_n permet de confirmer que la mise en cache est effective. Ajuster les tailles de lot, y compris via -ub et -ubatch, peut améliorer le prefill lorsque c'est adapté. Distinguer dès le départ l'attente avant le premier mot et la vitesse de génération évite de chercher une solution au mauvais endroit.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.