Brief IA : Ollama local : commandes et pièges à éviter

Ollama local : commandes et pièges à éviter

Brief IA
Tom Levy·2 min·0 vues

Pour optimiser l'utilisation d'Ollama en local sur macOS, il est crucial de définir les variables d'environnement via la commande « launchctl setenv », car les réglages dans un fichier .zshrc ne sont pas pris en compte. La commande « ollama ps » permet de surveiller l'utilisation du CPU et du GPU, indiquant si le modèle fonctionne correctement ou s'il y a des ralentissements dus à une utilisation excessive du CPU.

⚡
En bref
1« ollama ps » signale tout débordement vers le CPU et affiche le contexte alloué
2Sur macOS, définir les variables via « launchctl setenv » évite des réglages ignorés
3Endpoints /api/chat, /api/embed et couche /v1/ pour basculer un client OpenAI
💡Pourquoi c'est important — ces réglages et commandes conditionnent les performances, la stabilité des paramètres et l’intégration d’Ollama en local.
⚡Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Ollama sert des modèles de langue en local via un serveur HTTP et des API compatibles OpenAI. Derrière la simplicité de mise en route, la stabilité dépend de la mémoire disponible, des variables d’environnement système, et du format de sortie choisi. Voici les commandes et réglages à connaître pour éviter les ralentissements et les mauvaises surprises.

Variables système macOS et contexte : les réglages qui bloquent

Sur macOS, l’application de bureau Ollama est lancée par le système et ne prend pas en compte les lignes d’export d’un fichier .zshrc. Ainsi, une configuration qui semble correcte dans un terminal peut ne pas s’appliquer à l’application de bureau. Pour que les variables d’environnement soient prises en compte, il faut les définir via launchd avec la commande « launchctl setenv ». Cette méthode est souvent nécessaire pour que la longueur de contexte ou le répertoire des modèles soient effectivement modifiés. Par ailleurs, la commande « ollama ps » permet de vérifier la longueur de contexte allouée, qui peut différer de la valeur attendue ou demandée.

Surveiller GPU/CPU et mémoire avec « ollama ps »

La commande « ollama ps » affiche les modèles actuellement en mémoire et comporte une colonne PROCESSOR. Si la valeur affichée est inférieure à « 100 % GPU », cela signifie qu’une partie du modèle utilise le CPU, ce qui ralentit nettement la génération. Cette commande indique aussi le contexte effectivement alloué, utile pour vérifier l’adéquation entre les paramètres et les ressources disponibles.

Intégrer en local avec des endpoints compatibles OpenAI

Ollama met en place un serveur HTTP sur le port 11434 et propose les points de terminaison /api/chat et /api/embed. Une couche de compatibilité /v1/ permet à un client OpenAI existant de pointer vers localhost sans modification supplémentaire. Le service offre ainsi un point de terminaison compatible OpenAI accessible depuis la machine locale.

Démarrage en une commande, formats structurés et personnalisation

L’exécution locale d’un modèle avec Ollama ne demande qu’une seule commande, qui télécharge les poids nécessaires. Pour les sorties structurées, fournir un schéma JSON contraint le décodage à cette forme, ce qui garantit un parsing systématique, tandis que le format « json » brut produit un JSON valide sans garantie sur les clés. Les Modelfiles permettent d’enregistrer un modèle de base avec des paramètres par défaut. Des variables d’environnement contrôlent la durée de chargement des modèles et le nombre de modèles pouvant tourner en parallèle. Enfin, des commandes de gestion de disque sont disponibles pour compléter l’utilisation courante.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires