La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Sur un Mac Mini M4 doté de 16 Go, une tentative d'exécuter Qwen3.8‑27B avec AirLLM a échoué. Selon l'auteur, le cheminement logiciel et l'architecture visée ne sont pas compatibles, et les accès disque deviennent le facteur limitant. Le débit mesuré tombe à 16,4 secondes par jeton, environ 219 jetons/heure, avec 53,79 Go relus par jeton.
Débit limité : 53,79 Go relus par jeton, 219 jetons/heure
AirLLM doit relire environ 53,79 Go depuis le disque pour générer chaque jeton. Le temps mesuré atteint 16,4 secondes par jeton, soit environ 219 jetons par heure. Dans ces conditions, les réponses longues nécessitant du raisonnement deviennent très lentes. Selon l'auteur, sur Apple Silicon, la principale limite provient de l'entrée/sortie.
Routage MLX et crash au comptage des couches
Sur macOS, AirLLM redirige systématiquement les modèles vers une implémentation MLX/Llama, sans appeler la classe spécifique à Qwen3.8. La logique de séparation par sous-chaîne relie par erreur des milliers de tenseurs, puis l'exécution échoue lors du comptage des couches à cause de conventions de nommage incompatibles, après environ 55,56 Go téléchargés. Même si le routage était corrigé, la persistance MLX produit des structures que le moteur de streaming torch ne peut pas lire, et l'architecture Gated DeltaNet demanderait un backend spécifique.
Promesses d'AirLLM et échec sur Mac Mini 16 Go
AirLLM annonce la possibilité d'exécuter des modèles de 70 milliards sur un GPU de 4 Go et indique que Qwen3.8‑27B ne demanderait que 3,33 Go. L'auteur a tenté de lancer Qwen3.8‑27B avec AirLLM sur un Mac Mini M4 doté de 16 Go de mémoire unifiée, sans succès. Il recommande finalement d'utiliser un quant GGUF plus petit avec le backend Metal de llama.cpp.






