Brief IA : Élagage des LLM : gains mesurés par optimisation d’Ising

Élagage des LLM : gains mesurés par optimisation d’Ising

Brief IA
Tom Levy·4 min·4 vues

À 50 % de compression de Llama-3.3-70B, la méthode d'élagage basée sur l'optimisation d'Ising obtient près de 23 points de mieux sur le benchmark MMLU par rapport à la meilleure méthode concurrente. Cette approche permet de sélectionner efficacement les blocs à supprimer tout en préservant la performance, et s'applique également à des architectures variées comme NVIDIA-Nemotron-3-Nano-30B sans nécessiter de réentraînement.

En bref
1À 50 % de compression de Llama-3.3-70B, la méthode obtient près de 23 points de mieux sur MMLU
2L’énergie d’un système d’Ising sert de proxy pour sélectionner les blocs à supprimer
3L’approche s’étend à des architectures hétérogènes comme NVIDIA-Nemotron-3-Nano-30B sans réentraînement
4Des solveurs classiques ou inspirés quantiques permettent d’explorer rapidement de vastes espaces de configurations
💡Pourquoi c'est importantCette méthode permet d’élaguer efficacement les LLM tout en préservant la performance, et s’adapte à des architectures variées.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Des chercheurs proposent de sélectionner les blocs à supprimer dans les LLM en résolvant une optimisation binaire inspirée des verres d’Ising. L’énergie du système sert de proxy pour la qualité, permettant d’explorer efficacement de nombreuses configurations grâce à des solveurs classiques ou inspirés quantiques. Des gains sont rapportés sur des modèles Llama et sur des benchmarks comme MMLU, AIME25 et GPQA.

Jusqu’à 23 points sur MMLU à 50 % de compression de Llama-3.3-70B

À 50 % de compression de Llama-3.3-70B-Instruct, la méthode rapporte près de 23 points de pourcentage d’avance sur MMLU par rapport à la meilleure méthode concurrente d’élagage de blocs. Les états de faible énergie issus de cette formulation correspondent à des modèles élagués performants, faisant coïncider la minimisation d’énergie et la recherche de meilleurs scores. L’énergie reste cependant un proxy imparfait, ce qui rend utile l’examen non seulement de l’état fondamental mais aussi d’états excités de faible énergie. Une fois l’Hamiltonien établi, générer ce spectre de candidats est peu coûteux, et disposer de plusieurs options proches du minimum répond aux besoins pratiques d’évaluation.

Exploration rapide : force brute, recherche tabou et QUBO

Le calcul de l’énergie d’une configuration étant peu coûteux, il est possible d’évaluer par force brute jusqu’à des dizaines de milliards de combinaisons sur un seul GPU. Le traitement de plusieurs millions de configurations ne prend que quelques secondes ; l’exemple le plus exigeant mentionné concerne la suppression de 8 blocs sur 80 dans Llama-3. Pour Llama-3-70B, ce qui représente près de 29 milliards de configurations, le processus a nécessité environ deux jours. Lorsque ce seuil est dépassé, la contrainte est intégrée sous forme de terme de pénalité afin de constituer une QUBO, qui est ensuite résolue par des méthodes comme le recuit quantique, QAOA, la recherche tabou ou des algorithmes branche-et-borne spécialisés. Un solveur tabou open source atteint régulièrement des états de faible énergie en quelques secondes, y compris sur les cas vérifiés par force brute, ce qui permet d’aborder des modèles où l’énumération est hors de portée. L’objectif n’est pas de viser l’état fondamental exact mais de générer rapidement quelques bons états, ce qui est compatible avec des solveurs légers et des exécutions multiples. Ces solveurs sont utilisés chez Multiverse.

Un exemple contredit l’idée d’un tronçon unique en fin de réseau

Sur Llama-3.1-8B-Instruct avec 16 suppressions sur 32 blocs, la plupart des meilleures configurations proposées coupent des blocs vers la fin du modèle, comme attendu d’après les travaux antérieurs. Le 17e état excité est le premier à suggérer de retirer un bloc près du début ; après un léger réentraînement, cette configuration dépasse l’état fondamental sur plusieurs benchmarks. Ce résultat contredit l’hypothèse courante selon laquelle le meilleur élagage consiste en un bloc consécutif au milieu ou en fin de réseau.

Transfert aux architectures hétérogènes sans réentraînement

La suppression de blocs devient plus complexe lorsque différents types de couches sont entrelacés, mais la formulation d’Ising traite tout couplage de la même manière, sans distinction de type de bloc. Appliquée au NVIDIA-Nemotron-3-Nano-30B-A3B-FP8, qui combine Mamba2, attention et MoE dans un motif non uniforme, la méthode a été testée sans aucun réentraînement. En retirant 2 à 3 couches MoE ou 2 couches d’attention, l’optimisation binaire contrainte trouve des configurations qui surpassent l’heuristique d’influence des blocs sur AIME25 et GPQA. Ces résultats indiquent que la redondance dans de tels modèles hétérogènes est efficacement gérée par cette approche.

Du champ moyen aux interactions : pourquoi modéliser les couplages

De nombreuses approches existantes classent les blocs un par un à l’aide d’heuristiques de magnitude, sensibilité ou influence, souvent en imposant une suppression consécutive. Ces techniques supposent des contributions indépendantes, à la manière du champ moyen, alors que des couplages apparaissent entre décisions, comme entre les blocs 19, 20 et 24. À mesure que les réseaux gagnent en profondeur et en hétérogénéité, ignorer ces interactions dégrade la qualité, notamment lorsque de nombreux blocs sont retirés simultanément. Comme le nombre de combinaisons croît de façon exponentielle, des outils issus de la physique statistique deviennent pertinents.

Formuler l’élagage comme une minimisation d’énergie d’Ising

Chaque bloc reçoit une variable binaire, 0 pour conserver et 1 pour supprimer. Une expansion de Taylor d’ordre deux de la perte par rapport à ces variables fournit une hessienne approximative, dont la diagonale renseigne l’importance individuelle et dont les termes hors diagonale codent les couplages par paires. L’objectif devient de sélectionner exactement M blocs parmi N pour minimiser xᵀH⁰x, soit une optimisation binaire contrainte équivalente à un verre d’Ising avec magnétisation fixée, où la contrainte sur M joue le rôle de spin total fixe. Les états de faible énergie correspondent à des modèles performants sur les benchmarks. Cette approche se combine avec des techniques comme la quantification ou la compression à faible rang, et, en réduisant le nombre de blocs, elle permet des gains de vitesse d’inférence prévisibles en plus d’économies mémoire.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires