Brief IA : Évaluations IA : un gouffre financier pour les développeurs

Évaluations IA : un gouffre financier pour les développeurs

Brief IA
Tom Levy·9 min·7 vues

Les évaluations d'IA sont reconnues comme un facteur limitant, avec 70 % des chercheurs signalant des ralentissements dus à des évaluations inefficaces. Par exemple, le Holistic Agent Leaderboard a dépensé environ 40 000 $ pour exécuter 21 730 déploiements d'agents, illustrant l'augmentation des coûts et la nécessité d'optimiser ces évaluations pour accélérer l'innovation.

En bref
1Le Holistic Agent Leaderboard a dépensé 40 000 $ pour 21 730 déploiements, révélant le coût élevé des évaluations d'IA.
2Une seule exécution de GAIA peut atteindre 2 829 $, soulignant l'impact des choix d'infrastructure sur les coûts.
3Les benchmarks statiques ont vu leurs coûts réduits grâce à des techniques de compression, contrairement aux évaluations d'agents.
💡Pourquoi c'est importantLes coûts croissants des évaluations d'IA limitent l'accès aux tests avancés, impactant l'innovation et la compétitivité dans le secteur.
Le brief IA que lisent les pros

La recherche en IA te passionne ?

Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Les évaluations d'IA : un goulet d'étranglement coûteux

L'évaluation des intelligences artificielles a atteint un seuil de coût qui modifie profondément qui peut s'y engager. Le Holistic Agent Leaderboard (HAL) a récemment dépensé environ 40 000 dollars pour exécuter 21 730 déploiements d'agents à travers neuf modèles et neuf benchmarks. Une seule exécution de GAIA sur un modèle de pointe peut coûter jusqu'à 2 829 dollars avant toute optimisation par mise en cache. La recherche menée par Exgentic a révélé une variation des coûts de 33 fois sur des tâches identiques, identifiant le choix de l'infrastructure comme un facteur déterminant des coûts. De plus, le UK-AISI a récemment étendu les étapes agentiques à des millions pour étudier le calcul en temps d'inférence. Dans le cadre de l'apprentissage automatique scientifique, The Well nécessite environ 960 heures H100 pour évaluer une nouvelle architecture et 3 840 heures H100 pour un balayage complet de quatre références. Bien que des techniques de compression aient été proposées pour les benchmarks statiques, les nouveaux benchmarks d'agents sont bruyants, sensibles à l'infrastructure et seulement partiellement compressibles. Les benchmarks d'entraînement en boucle sont coûteux par construction, et lorsque l'on cherche à ajouter de la fiabilité à ces évaluations, les exécutions répétées multiplient encore le coût.

Réduire les coûts des benchmarks LLM statiques

Le problème des coûts a commencé avant l'apparition des agents. Lorsque le CRFM de Stanford a publié HELM en 2022, les coûts par modèle indiqués dans le document variaient de 85 dollars pour le modèle code-cushman-001 d'OpenAI à 10 926 dollars pour le J1-Jumbo (178B) d'AI21, et de 540 à 4 200 heures GPU pour les modèles ouverts, avec BLOOM (176B) et OPT (175B) en haut de l'échelle. Perlitz et al. (2023) ont réaffirmé le schéma de coût plus large de HELM, et la recherche d'IBM a noté que faire passer Granite-13B par HELM "peut consommer jusqu'à 1 000 heures GPU." Sur les 30 modèles et 42 scénarios de HELM, le coût total des coûts signalés et du calcul GPU s'élevait à environ 100 000 dollars.

Une autre observation frappante provient de l'analyse des points de contrôle Pythia d'EleutherAI par Perlitz et al. : les développeurs paient pour l'évaluation de manière répétée pendant le développement du modèle. Pythia a publié 154 points de contrôle pour chacun des 16 modèles couvrant huit tailles, soit 2 464 points de contrôle si chaque point de contrôle de modèle est compté séparément, afin que la communauté puisse étudier la dynamique d'entraînement. L'exécution du LM Evaluation Harness sur tous ces points de contrôle transforme l'évaluation en un multiplicateur sur l'entraînement : Perlitz et al. (2024) ont noté que les coûts d'évaluation "peuvent même dépasser ceux de l'entraînement préalable lors de l'évaluation des points de contrôle." Pour les petits modèles, l'évaluation devient l'élément de coût dominant tout au long du cycle de développement. Lorsque nous augmentons le calcul en temps d'inférence, nous augmentons également les coûts d'évaluation.

Perlitz et al. ont ensuite demandé combien de HELM portaient réellement les classements. Le résultat était frappant : une réduction de 100 à 200 fois du calcul préservait presque le même ordre, avec des réductions plus importantes encore utiles pour un regroupement grossier dans l'analyse par niveaux du document. Flash-HELM a transformé cette découverte en une procédure de grossier à fin : exécuter d'abord des évaluations peu coûteuses, puis dépenser des ressources de calcul haute résolution uniquement sur les meilleurs candidats. Une grande partie du calcul de HELM confirmait des classements que le domaine aurait pu inférer beaucoup plus facilement.

D'autres travaux ont atteint la même conclusion sous des angles différents. tinyBenchmarks a compressé MMLU de 14 000 éléments à 100 éléments d'ancrage avec environ 2 % d'erreur en utilisant la Théorie de la Réponse à l'Élément. Le Open LLM Leaderboard est passé de 29 000 exemples à 180. Anchor Points a montré que aussi peu que 1 à 30 exemples pouvaient classer 87 paires modèle de langage/prompt sur GLUE, et d'autres ont suivi, réduisant les tailles de jeux de données de 90 %. Les benchmarks statiques avaient une faiblesse que l'on pouvait exploiter : les différences entre modèles se concentrent souvent dans un petit sous-ensemble d'éléments, de sorte que le classement peut survivre à un sous-échantillonnage agressif.

Cette astuce a fortement diminué une fois que les benchmarks sont passés des prédictions statiques aux agents.

Complexité accrue des évaluations d'agents

Une comptabilité publique très intéressante de l'évaluation des agents provient du Holistic Agent Leaderboard (Kapoor et al., ICLR 2026). HAL exécute des harnais d'agents standardisés à travers neuf benchmarks couvrant la programmation, la navigation web, les tâches scientifiques et le service client, avec des infrastructures partagées et un suivi des coûts centralisé. Le coût principal : 40 000 dollars pour 21 730 déploiements à travers neuf modèles et neuf benchmarks.

Derrière cet agrégat, le coût d'une seule exécution de benchmark varie de quatre ordres de grandeur à travers les tâches de HAL, et de trois ordres au sein de certains benchmarks individuels.

Derrière ces chiffres se cache un fait de tarification brut. Claude Opus 4.1 facture 15 dollars par million de tokens d'entrée et 75 dollars par million de sortie. Gemini 2.0 Flash facture 0,10 dollar et 0,40 dollar, une variation de deux ordres de grandeur sur l'entrée seule. Les benchmarks d'agents évaluent rarement "le modèle" en isolation. Ils évaluent un produit modèle × infrastructure × budget de tokens, et de petits choix d'infrastructure peuvent multiplier les coûts par 10 fois.

Pire encore, un budget plus élevé n'achète pas toujours de meilleurs résultats. Sur Online Mind2Web, l'utilisation du navigateur avec Claude Sonnet 4 a coûté 1 577 dollars pour 40 % de précision. SeeAct avec GPT-5 Medium a atteint 42 % pour 171 dollars. Le document HAL note "une différence de 9 fois dans le coût malgré seulement une différence de deux points de pourcentage dans la précision." Sur GAIA, un généraliste HAL avec o3 Medium a coûté 2 828 dollars pour 28,5 % de précision, tandis qu'un autre agent a atteint 57,6 % pour 1 686 dollars.

L'outil de l'ère statique aurait dû aider, mais il n'a fait que jusqu'à un certain point. Le filtre de difficulté moyenne de Ndzomga, qui sélectionne des tâches avec des taux de réussite historiques de 30 à 70 %, réalise une réduction de 2 à 3,5 fois tout en préservant la fidélité de rang sous les changements d'infrastructure et temporels. C'est utile, mais cela reste loin des gains de 100 à 200 fois disponibles pour les benchmarks statiques. Lorsque chaque élément est un déploiement multi-tours avec sa propre variance, la trajectoire inévitable longue par question unique devient l'objet coûteux.

Entraînement et évaluation : une relation asymétrique

Certains benchmarks échappent complètement à la problématique des coûts d'API parce que leur protocole d'évaluation entraîne des modèles depuis le début.

The Well donne un exemple très intéressant de cela. Il regroupe 16 ensembles de données d'apprentissage automatique scientifique couvrant des systèmes biologiques, la dynamique des fluides, la magnétohydrodynamique, les explosions de supernova, l'instabilité viscoélastique et la matière active, totalisant 15 To. En utilisant la grille des 16 ensembles de données du document, le protocole laisse peu de place à l'économie : entraîner chaque modèle de référence pendant 12 heures sur un H100, essayer cinq taux d'apprentissage par paire (modèle, ensemble de données), répéter à travers quatre architectures et 16 ensembles de données. Ce balayage de grille consomme 3 840 heures H100, soit environ 9 600 dollars selon les hypothèses de conversion ci-dessous. Une nouvelle architecture coûte encore environ 960 heures H100, soit environ 2 400 dollars.

Former un seul opérateur neuronal peut nécessiter une seule exécution de 12 heures H100, tandis que l'évaluer à travers le benchmark nécessite 80 de ces formations. Cette asymétrie est ce qui rend The Well important. Dans ce coin de l'apprentissage automatique, le calcul d'évaluation dépasse le calcul d'entraînement d'environ deux ordres de grandeur, inversant le modèle mental traditionnel de l'apprentissage profond.

Le même schéma se reproduit à travers SciML. PDEBench couvre 11 familles de PDE et rapporte des tableaux de temps par époque à travers des ensembles de données et des familles de modèles, mais un chiffre dollar propre par architecture dépend du protocole d'entraînement choisi et du matériel. MLE-Bench (OpenAI) se situe entre les régimes d'agents et d'entraînement. Chaque tentative d'agent dans l'une des 75 compétitions Kaggle dure 24 heures sur un seul GPU A10, entraînant de véritables pipelines d'apprentissage automatique. Le document est explicite : "Une seule exécution de notre configuration principale d'expérience de 24 heures par tentative de compétition nécessite 24 heures × 75 compétitions = 1 800 heures GPU de calcul," plus o1-preview consommant 127,5 M de tokens d'entrée et 15 M de tokens de sortie par graine. À 1,50 dollar par heure A10, le coût de base GPU seul est de 2 700 dollars ; l'ajout de l'utilisation de l'API o1-preview amène une exécution d'une graine à environ 5 500 dollars. Trois graines × six modèles atteindraient donc près de 100 000 dollars avant tout coût supplémentaire de notation ou de réessai.

METR's RE-Bench limite chacun des sept environnements d'ingénierie de recherche à 8 heures sur 1 à 6 H100. Un seul passage à travers l'ensemble est donc de 56 à 336 heures H100 avant d'ajouter des tentatives répétées, plusieurs graines ou plusieurs agents ; la référence humaine, avec 71 tentatives d'experts, augmente le budget implicite bien plus loin. Parce que le benchmark donne aux agents et aux humains le même calcul en temps réel, un processus d'entraînement en temps réel fixe le coût de base. Un budget de tokens ne le limite plus par le haut.

ResearchGym (ICLR 2026) fait en sorte que l'agent réalise de véritables recherches en apprentissage automatique. Cinq tâches de test (39 sous-tâches) tirées des articles ACL, ICLR et ICML, y compris les ACL Highlights, ICML Spotlight, ICLR Spotlight et les catégories ICLR Oral, avec les méthodes proposées retenues. Le budget est serré : 10 dollars en API plus 12 à 24 heures sur un seul GPU sous 24 Go par tâche. Un passage complet (5 tâches × 24h × 3 graines) consomme environ 360 heures GPU par agent.

Le tableau des coûts devient brutal dans PaperBench. Vingt articles ICML 2024 Spotlight ou Oral doivent être répliqués depuis le début, notés selon des arbres de rubriques avec 8 316 critères de feuille. Chaque déploiement utilise un GPU A10 pendant 12 heures, et les calculs par article sont simples :

  • 400 dollars en API par déploiement o1 IterativeAgent, multiplié par 20 articles, soit environ 8 000 dollars par évaluation.

La notation coûte 66 dollars par article avec le juge o3-mini, ou 1 320 dollars pour l'ensemble du benchmark. Utiliser o1 comme juge augmenterait la notation à environ 830 dollars par article.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires