Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Artificial Analysis met à jour son Indice d’Intelligence en version 4.2 avec de nouveaux benchmarks, une pondération accrue des données privées et des correctifs de notation. GPT-6 Astra gagne quatre points et atteint la deuxième place, derrière Claude Fable 5.1. L’éditeur indique également qu’une version 5, en développement depuis huit mois, sera mise en place par étapes.
Pondération accrue et nouveaux tests modifient l’indice
L’Indice d’Intelligence comporte désormais deux nouveaux benchmarks : AA-Briefcase, destiné à mesurer le travail de connaissance dans le monde réel, et GDP.pdf de Surge AI, utilisé pour l’évaluation de l’analyse de documents PDF. Le benchmark GPQA-Diamond a été retiré, car il a été résolu par les modèles évalués. Les données de test privées représentent à présent 40 % du score global, ce qui vise à rendre l’évaluation plus exigeante. Artificial Analysis a aussi apporté des corrections aux erreurs de notation sur plusieurs benchmarks et modifié ses méthodes de scoring afin d’accroître la stabilité des résultats.
Classement remanié : Claude Fable 5.1 en tête, Astra suit
Avec la version 4.2, GPT-6 Astra progresse de quatre points par rapport à son prédécesseur. Claude Fable 5.1 d’Anthropic conserve la première place, suivi de GPT-6 Astra à la deuxième position et de Meta à la troisième. Artificial Analysis indique que GPT-6 Astra utilise moins de tokens par tâche que les autres modèles de pointe. Anthropic, OpenAI, Meta et Zhipu AI occupent ensemble la première place en termes de rapport coût-performance.
Écarts d’évaluation et calendrier de la V5
Avant cette mise à jour, d’autres analyses positionnaient déjà GPT-6 Astra en première position. Epoch AI l’avait placé en tête sur 267 modèles avec un score de 169 points sur plus de 50 benchmarks, et ARC-AGI-3 avait observé une amélioration allant d’importante à très importante selon les systèmes. Artificial Analysis avait d’abord donné à Astra un score similaire à celui de la version précédente, ce qui avait entraîné des interrogations. L’éditeur précise avoir différé les mises à jour afin de maintenir la stabilité des scores lors des lancements majeurs, mais a estimé qu’une actualisation intermédiaire était nécessaire en raison de l’évolution rapide des premières places du classement. La version 5, développée depuis huit mois, sera introduite par étapes.






