Brief IA

Décoder les noms de LLM : taille, MoE, quantification, GGUF

🔬 Research·Tom Levy·

Décoder les noms de LLM : taille, MoE, quantification, GGUF

Décoder les noms de LLM : taille, MoE, quantification, GGUF
Key Takeaways
1GGUF désigne le format de fichier qui précise comment un modèle est stocké
2A3B indique le nombre approximatif de paramètres actifs par token dans un modèle MoE
3Q4, Q5, Q6, Q8 correspondent à des niveaux de quantification exprimés en bits
💡Why it mattersComprendre ces segments permet d’anticiper la mémoire nécessaire, la qualité et l’usage avant de choisir un LLM local.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Choisir un LLM local passe souvent par un nom de fichier complexe. Ces étiquettes condensent pourtant des informations précises : taille en paramètres, structure dense ou MoE, part réellement activée à l’inférence, niveau et schéma de quantification, sans oublier le format de fichier. Tour d’horizon des segments qui guident mémoire requise et cas d’usage.

Le format GGUF signale l’emballage et la structure du modèle

GGUF est un format de fichier de modèles qui indique au logiciel comment un LLM est emballé et stocké. Un nom comme Qwen3-30B-A3B-Instruct-2507-q2ks-mixed-AutoRound-gguf rassemble plusieurs informations : Qwen3 désigne le modèle, 30B le nombre de paramètres, A3B le nombre de paramètres actifs par token, Instruct le type d’ajustement, 2507 un identifiant ou une version datée, gguf le format de fichier, q2ks le schéma de quantification, mixed indique que toutes les couches n’utilisent pas la même largeur de bit, et AutoRound l’algorithme de quantification.

Quantification : des Q3 à Q8 pour réduire la mémoire, avec un coût qualité

Afin de réduire la taille d’un modèle en local, il est courant de compresser les poids par le biais de la quantification. Les principaux niveaux utilisés sont Q8 (soit environ 8 bits), Q6 (soit environ 6 bits), Q5 (soit environ 5 bits), Q4 (soit environ 4 bits) et Q3 (soit environ 3 bits) : plus la valeur est faible, plus le modèle gagne en compacité. La taille précise varie selon les méthodes de quantification, qui intègrent des métadonnées et ne respectent pas systématiquement le nombre de bits annoncé par valeur. Une quantification à faible nombre de bits réduit la mémoire nécessaire, généralement au détriment de la qualité. Les étiquettes comme Q4_K_M désignent un schéma spécifique de quantification 4 bits, tandis que des variantes comme q2ks existent. Comparer Q4_K_M à Q6_K revient à comparer des niveaux et des schémas de quantification différents. Les méthodes modernes utilisent divers groupements, échelles et précisions pour équilibrer taille et qualité.

Mémoire brute : FP16, BF16 et l’ampleur des poids

FP16 et BF16 stockent chacun des valeurs sur 16 bits, mais selon des représentations différentes. Par exemple, un modèle de 35 milliards de paramètres en 16 bits nécessite environ 35B × 16 bits, soit près de 70 Go, uniquement pour les poids. Cette taille dépasse les capacités de nombreuses machines grand public, d’où l’intérêt de la quantification.

Le nombre de paramètres et la structure modifient la mémoire requise

Les suffixes 7B, 14B, 35B ou 70B indiquent le nombre total de paramètres, la lettre B signifiant milliard. Les paramètres sont les valeurs apprises qui composent le modèle et, en local, plus ils sont nombreux, plus la mémoire requise augmente. Des modèles propriétaires comme Gemini 3 Pro ou Claude Opus 5 peuvent atteindre des comptes dans les trillions. Les modèles denses utilisent la quasi-totalité de leurs paramètres à l’inférence, tandis que les modèles Mixture-of-Experts (MoE) répartissent un large ensemble de poids entre des experts activés à la demande par un mécanisme de routage. Ainsi, un MoE peut afficher un grand total de paramètres sans les mobiliser simultanément pour chaque token.

A3B : des milliards totaux, mais combien réellement actifs par token

Dans un nom comme Qwen3.5-35B-A3B, 35B indique le nombre total de paramètres et A3B donne une estimation des paramètres actifs par token, ici environ 3B. La lettre A fait référence à l’activation. Ce fonctionnement permet à un MoE de limiter le calcul à l’inférence malgré un volume total élevé. À noter qu’A3B ne signifie pas que le modèle ne possède que 3B de paramètres : il en conserve bien 35B au total.

La version Instruct permet au modèle de suivre des consignes

Une même famille de modèles peut exister en versions Base et Instruct, comme Qwen3.5-35B-A3B-Base et Qwen3.5-35B-A3B-Instruct. La version Base est la pré-entraînée, non ajustée pour suivre des consignes, tandis que la version Instruct a été affinée par un instruction tuning pour mieux répondre aux commandes, aux questions et aux usages conversationnels. Elles peuvent partager architecture, taille et quantification tout en se comportant différemment. Les noms peuvent aussi indiquer la présence de FP16 ou BF16. Lire ces noms de gauche à droite revient à parcourir une fiche technique condensée : savoir si le modèle est Base ou Instruct fait partie des éléments clés à considérer. Comprendre ces segments facilite le choix d’un modèle local.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.