Ollama local : commandes et pièges à éviter

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Ollama sert des modèles de langue en local via un serveur HTTP et des API compatibles OpenAI. Derrière la simplicité de mise en route, la stabilité dépend de la mémoire disponible, des variables d’environnement système, et du format de sortie choisi. Voici les commandes et réglages à connaître pour éviter les ralentissements et les mauvaises surprises.
Variables système macOS et contexte : les réglages qui bloquent
Sur macOS, l’application de bureau Ollama est lancée par le système et ne prend pas en compte les lignes d’export d’un fichier .zshrc. Ainsi, une configuration qui semble correcte dans un terminal peut ne pas s’appliquer à l’application de bureau. Pour que les variables d’environnement soient prises en compte, il faut les définir via launchd avec la commande « launchctl setenv ». Cette méthode est souvent nécessaire pour que la longueur de contexte ou le répertoire des modèles soient effectivement modifiés. Par ailleurs, la commande « ollama ps » permet de vérifier la longueur de contexte allouée, qui peut différer de la valeur attendue ou demandée.
Surveiller GPU/CPU et mémoire avec « ollama ps »
La commande « ollama ps » affiche les modèles actuellement en mémoire et comporte une colonne PROCESSOR. Si la valeur affichée est inférieure à « 100 % GPU », cela signifie qu’une partie du modèle utilise le CPU, ce qui ralentit nettement la génération. Cette commande indique aussi le contexte effectivement alloué, utile pour vérifier l’adéquation entre les paramètres et les ressources disponibles.
Intégrer en local avec des endpoints compatibles OpenAI
Ollama met en place un serveur HTTP sur le port 11434 et propose les points de terminaison /api/chat et /api/embed. Une couche de compatibilité /v1/ permet à un client OpenAI existant de pointer vers localhost sans modification supplémentaire. Le service offre ainsi un point de terminaison compatible OpenAI accessible depuis la machine locale.
Démarrage en une commande, formats structurés et personnalisation
L’exécution locale d’un modèle avec Ollama ne demande qu’une seule commande, qui télécharge les poids nécessaires. Pour les sorties structurées, fournir un schéma JSON contraint le décodage à cette forme, ce qui garantit un parsing systématique, tandis que le format « json » brut produit un JSON valide sans garantie sur les clés. Les Modelfiles permettent d’enregistrer un modèle de base avec des paramètres par défaut. Des variables d’environnement contrôlent la durée de chargement des modèles et le nombre de modèles pouvant tourner en parallèle. Enfin, des commandes de gestion de disque sont disponibles pour compléter l’utilisation courante.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.