La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Avec les bons outils, un Mac mini suffit pour faire tourner des modèles ouverts de raisonnement, de codage ou multimodaux. Ce guide réunit cinq LLM disponibles en local, leurs tailles (de 14 à 43 Go en quantifié selon les cas), leurs fenêtres de contexte jusqu’à 256K, les paliers de mémoire conseillés et les commandes Ollama correspondantes.
Mémoire d’abord : des paliers de 16 à 64 Go selon les modèles
Les exigences varient fortement selon le modèle et sa quantification. Une version quantifiée de Llama 3.3 70B est indiquée à environ 43 Go avec une fenêtre de contexte de 128K. Elle est classée pour des Mac mini de 48 Go à 64 Go, tandis que 16 Go et 24 Go ne sont pas attendus comme confortables. Sur un Mac mini M5 Pro de 64 Go, un 70B quantifié est présenté comme une option locale légitime, exécutable via « ollama run llama3.3:70b ». La sélection se raisonne par paliers de mémoire, qui servent de points de départ plutôt que de limites strictes. La quantification, la longueur de contexte, le cache KV, la surcharge d'exécution et les autres tâches en cours influencent le confort d'usage : un modèle qui tient en mémoire peut rester pénible s'il manque de marge. À l’autre extrémité, avec 16 Go, gpt-oss-20b ou des variantes plus petites de Gemma 4 sont cités comme options viables, quand Llama 3.3 70B cible clairement les configurations 48–64 Go.
Deux voies pour le local : Ollama en CLI, LM Studio en GUI
Deux solutions se détachent pour exécuter des LLM sur Mac mini. Ollama est présentée comme l’option la plus simple pour les développeurs : on installe, on télécharge un modèle et on le lance depuis le terminal, par exemple « ollama run gpt-oss:20b ». La plateforme propose des paquets locaux pour gpt-oss, Gemma 4, Qwen3-Coder et d’autres, et expose une API locale pour brancher ses applications ou agents de codage. LM Studio cible les utilisateurs qui privilégient une interface graphique : il offre la possibilité de rechercher des modèles, de les importer, d’interagir avec eux et de les rendre accessibles via une API locale compatible OpenAI. Sur Apple Silicon, il propose une compatibilité avec llama.cpp et avec les moteurs d’inférence MLX d’Apple. Pour découvrir l’IA locale sur Mac mini, il est présenté comme un point d’entrée simple.
Raisonnement ouvert sur 16 Go : gpt-oss-20b et son API locale
OpenAI a mis à disposition gpt-oss-20b et gpt-oss-120b sous forme de modèles de raisonnement à poids ouverts, pensés pour fonctionner sur une infrastructure maîtrisée par l’utilisateur. gpt-oss-20b requiert environ 16 Go de mémoire et est annoncé comme convenant aux Mac dotés de 16 Go ou plus. Ce modèle est destiné à des usages de raisonnement et d’agents, avec une intensité de raisonnement ajustable, et il est proposé sous licence Apache 2.0, en conformité avec la politique d’utilisation gpt-oss. Ce modèle peut être utilisé via Ollama en lançant « ollama run gpt-oss:20b ». Selon Ollama, il pèse environ 14 Go et propose une fenêtre de contexte de 128K, ce qui en fait une option attractive pour un Mac mini de 16 Go. La recommandation de mémoire associée reste 16 Go ou plus.
Coder en local : Qwen3-Coder et Qwen3.6 pour dépôts et agents
Pour l’ingénierie logicielle, Qwen3-Coder 30B cumule 30 milliards de paramètres au total dont 3,3 milliards activés, avec une fenêtre native de 256K. Il est décrit comme entraîné pour l’ingénierie agentique, la compréhension de grands dépôts et les tâches de codage de longue haleine. Ollama situe ce modèle à environ 19 Go en local, exécutable via « ollama run qwen3-coder:30b », avec une recommandation de 24 Go ou plus de mémoire. Qwen3.6, orienté codage agentique et raisonnement au niveau des dépôts, existe en 35B et 27B : la 35B via Ollama est autour de 23 Go avec 256K de contexte et multimodalité texte-image, également disponible en version MLX pour Apple Silicon ; la 27B est indiquée à environ 18 Go. Les recommandations associées vont de 24 Go ou plus pour la 27B à 32 Go ou plus pour la 35B. La 35B est présentée comme l’option de plus grande capacité. L’exécution se fait via « ollama run qwen3.6:35b ».
Multimodal à taille maîtrisée : Gemma 4 26B A4B en MoE
Gemma 4, dernière génération de modèles ouverts de Google, se décline en plusieurs tailles. La variante 26B A4B exploite une architecture Mixture-of-Experts : environ 25,2 milliards de paramètres au total pour 3,8 milliards activés à l’inférence. Elle traite texte et image et propose une fenêtre de contexte de 256K. Un modèle MoE de 26B ne présente pas les mêmes exigences de calcul qu’un 26B dense, seule une fraction des paramètres étant activée par jeton. Ollama distribue directement des variantes de Gemma 4, dont le 26B, des versions plus petites et un modèle dense de 31B. Le lancement s’effectue via « ollama run gemma4:26b », avec une recommandation de 24 Go ou plus de mémoire sur Mac mini.
Au-delà des fiches techniques : vers un Mac mini boîte d’IA locale
La gamme de modèles disponibles commence avec gpt-oss-20b et les variantes plus compactes de Gemma 4, puis inclut gpt-oss-20b, Gemma 4 26B A4B et Qwen3.6 27B, ensuite Qwen3.6 35B, Qwen3-Coder 30B et Gemma 4 26B, jusqu’à Llama 3.3 70B et, au-delà, des charges locales plus substantielles. Ces axes sont présentés comme des points de départ pratiques, non comme des limites. Le Mac mini est présenté comme une solution d’IA locale désormais performante, en particulier dans sa version M6. Il n’est plus indispensable de posséder une station GPU pour tester des modèles ouverts gourmands : un Mac mini bien équipé est capable de faire tourner des modèles de raisonnement, des agents de codage et des API locales de manière autonome. La réflexion porte désormais sur la dimension et la puissance du LLM que l’on souhaite y exécuter.





