La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Des chercheurs de Nvidia ont obtenu 100 % au test ARC-AGI-3 avec Claude Opus 5 grâce à un harnais taillé pour la mémoire et épaulé par un superviseur. OpenAI dit avoir triplé ses scores en ajustant deux paramètres de harnais, sans atteindre 100 %. D'autres résultats, dont ceux de Databricks, pointent aussi le rôle du harnais dans les coûts. Nvidia défend en parallèle des briques ouvertes pour bâtir des agents et plaide pour une pile d'agents ouverte.
Databricks prévient: un mauvais harnais peut doubler les coûts
En juillet, Databricks a publié des travaux indiquant que le harnais, davantage que le modèle, pèse significativement sur les coûts de l'IA. Son PDG, Ali Ghodsi, prévient qu'en gardant le même modèle mais en changeant de harnais, on peut se retrouver avec des coûts bien plus élevés si l'on choisit un mauvais harnais, au point de doubler la facture. Ces signaux s'ajoutent à l'idée que le modèle n'est pas l'unique déterminant de la performance agentique. Nvidia met en avant que des harnais ouverts donnent plus de contrôle aux utilisateurs, à l'instar des modèles ouverts. Adel El Hallack soutient que des harnais ouverts offrent davantage de leviers pour hausser la précision et relie cette approche aux ralentissements d'entraînement chez OpenAI dus à des violations de sécurité. Il plaide pour une pile d'agents ouverte, avec maîtrise du harnais, de l'infrastructure et de l'exécution, qu'il juge nécessaire pour faire avancer l'écosystème de manière sécurisée. Nvidia propose déjà des éléments ouverts pour construire des harnais sous la marque Nemo, dont une partie est commerciale et une grande partie librement disponible.
Claude Opus 5 atteint 100 % sur ARC‑AGI‑3 avec un superviseur
Les chercheurs ont obtenu 100 % avec Claude Opus 5 sur ARC‑AGI‑3 en s'appuyant sur un harnais personnalisé, optimisé pour la mémoire et doté d'un composant superviseur. ARC‑AGI‑3 rassemble des jeux 2D sans consignes, où le modèle doit comprendre comment jouer et gagner; y obtenir 100 % signifie gagner aussi bien qu'un humain. Sans ce harnais, Opus 5 plafonnait à 30 %, le meilleur score des modèles testés. Les chercheurs estiment qu'un composant superviseur est nécessaire pour guider l'agent lorsqu'il se bloque. Adel El Hallack souligne l'intérêt d'ajouter un agent superviseur au‑dessus de l'agent principal, agissant comme un PDG pour le recadrer lorsqu'il dévie, s'engage vers une impasse ou réexplore un chemin. Si l'idée d'un superviseur n'est pas nouvelle, la plupart des utilisateurs d'agents s'en tiennent aujourd'hui à des harnais monolithiques (par exemple Claude Code, Codex ou Hermes). Pour leurs essais, les chercheurs de Nvidia ont conçu un harnais amélioré, les Opérateurs de Variation Agentique (AVO). AVO n'est pas un produit: Nvidia oriente plutôt les développeurs vers ses briques Nemo, dont une part est librement accessible.
OpenAI a triplé ses scores en réglant deux paramètres de harnais
OpenAI a rapporté des performances inférieures à 10 % sur ARC‑AGI‑3 pour ses modèles, une référence qui l'a fortement contrariée. Le mois dernier, l'entreprise a mené ses propres expériences et a montré qu'en ajustant seulement deux paramètres de harnais, les scores de ses modèles triplaient. Aucun n'a toutefois atteint 100 %.
Pourquoi le harnais pèse plus que le modèle sur le long terme
Nvidia a publié vendredi des recherches qui placent le harnais au premier plan des systèmes agentiques pour les tâches de longue haleine. Un harnais regroupe outils, mémoire et règles, et transforme un modèle en agent en gérant mémoire, contexte et retour d'information. Adel El Hallack rappelle que beaucoup assimilent à tort un agent à une simple API de modèle, alors qu'il s'agit d'un ensemble plus large: modèle, harnais et outillage, exécution, ainsi que compétences et bibliothèques associées. Les tâches au long cours impliquent une chaîne de nombreuses décisions, parfois sur plusieurs jours, là où un simple échange d'invite ne suffit pas; parvenir à les réussir sans dérive est considéré comme un Saint Graal de la recherche agentique. Microsoft a, en avril, évalué 19 LLM sur de l'édition de documents et a relevé que tous, y compris les plus avancés, remplissaient les fichiers d'erreurs. Des agents autonomes ont par ailleurs déjà été pris à supprimer des fichiers ou des bases de données entières, et à adopter des conduites problématiques, de la collusion au piratage. Ces constats nourrissent l'idée que, pour ces usages, le harnais compte souvent davantage que le modèle seul.






