Brief IA : AirLLM sur Mac M4 : Qwen3.8‑27B échoue par limite d'I/O

AirLLM sur Mac M4 : Qwen3.8‑27B échoue par limite d'I/O

Brief IA
Tom Levy·2 min·1 vues

AirLLM doit relire environ 53,79 Go depuis le disque pour chaque jeton généré. Le débit mesuré atteint 16,4 secondes par jeton, soit environ 219 jetons par heure. La tentative d'exécuter Qwen3.8‑27B avec AirLLM sur un Mac Mini M4 16 Go a échoué pour des raisons techniques et de performances.

En bref
1AirLLM doit relire environ 53,79 Go depuis le disque pour chaque jeton généré.
2Le débit mesuré atteint 16,4 secondes par jeton, soit environ 219 jetons par heure.
3La tentative d'exécuter Qwen3.8‑27B avec AirLLM sur un Mac Mini M4 16 Go a échoué pour des raisons techniques et de performances.
💡Pourquoi c'est importantL'expérience montre que l'entrée/sortie sur Apple Silicon limite fortement l'utilisation de grands modèles avec AirLLM, rendant les réponses longues très lentes.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Sur un Mac Mini M4 doté de 16 Go, une tentative d'exécuter Qwen3.8‑27B avec AirLLM a échoué. Selon l'auteur, le cheminement logiciel et l'architecture visée ne sont pas compatibles, et les accès disque deviennent le facteur limitant. Le débit mesuré tombe à 16,4 secondes par jeton, environ 219 jetons/heure, avec 53,79 Go relus par jeton.

Débit limité : 53,79 Go relus par jeton, 219 jetons/heure

AirLLM doit relire environ 53,79 Go depuis le disque pour générer chaque jeton. Le temps mesuré atteint 16,4 secondes par jeton, soit environ 219 jetons par heure. Dans ces conditions, les réponses longues nécessitant du raisonnement deviennent très lentes. Selon l'auteur, sur Apple Silicon, la principale limite provient de l'entrée/sortie.

Routage MLX et crash au comptage des couches

Sur macOS, AirLLM redirige systématiquement les modèles vers une implémentation MLX/Llama, sans appeler la classe spécifique à Qwen3.8. La logique de séparation par sous-chaîne relie par erreur des milliers de tenseurs, puis l'exécution échoue lors du comptage des couches à cause de conventions de nommage incompatibles, après environ 55,56 Go téléchargés. Même si le routage était corrigé, la persistance MLX produit des structures que le moteur de streaming torch ne peut pas lire, et l'architecture Gated DeltaNet demanderait un backend spécifique.

Promesses d'AirLLM et échec sur Mac Mini 16 Go

AirLLM annonce la possibilité d'exécuter des modèles de 70 milliards sur un GPU de 4 Go et indique que Qwen3.8‑27B ne demanderait que 3,33 Go. L'auteur a tenté de lancer Qwen3.8‑27B avec AirLLM sur un Mac Mini M4 doté de 16 Go de mémoire unifiée, sans succès. Il recommande finalement d'utiliser un quant GGUF plus petit avec le backend Metal de llama.cpp.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires