Google détaille RRSI pour des agents qui généralisent mieux

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Des chercheurs de Google Cloud AI Research et de plusieurs universités présentent RRSI, une procédure d’auto-amélioration des agents qui évite la mémorisation des tests. L’équipe rapporte des gains sur des benchmarks jamais vus, une baisse d’environ 30 % des tokens à l’exécution et une amélioration transférable à des modèles plus faibles, code publié à l’appui.
Des gains sur 8 benchmarks et 30 % de tokens en moins
L’équipe de recherche a testé RRSI sur huit benchmarks englobant la programmation, les tâches de bureau agentique et la conception d’ingénierie, tout en utilisant le modèle Claude Opus 4.8 sans modification. Par rapport à un harness de base non modifié et à quatre méthodes récentes, RRSI gagne jusqu’à 14,1 points sur les tâches d’entraînement et jusqu’à 4,7 points sur cinq benchmarks non vus. L’équipe rapporte en outre environ 30 % de tokens en moins à l’exécution que la variante non régularisée. La performance globale n’est jamais tombée sous la base sur les benchmarks non vus, et chaque tâche hors entraînement a été améliorée, avec un pic de 4,7 points sur JobBench. Un harness de programmation optimisé avec Gemini 3.5 Flash a aussi rehaussé la précision du plus faible Gemini 3.1 Flash Lite de 11,2 à 14,6 points sans autre modification. Les mécanismes mis au jour ne dépendent pas de la capacité du modèle qui les découvre.
Les agents perdent en généralisation après des cycles répétés d’auto-amélioration
Lorsque des agents s’auto-optimisent en boucle sur un lot restreint de tâches de test, ils finissent par mémoriser ces exercices. Leurs scores d’entraînement montent, tandis que les gains sur des tâches nouvelles s’atténuent ou disparaissent. Les chercheurs décrivent plusieurs mécanismes en cause : la recherche ancre des motifs propres à un benchmark, elle peut privilégier des candidats performants par hasard et elle ajoute parfois une complexité qui gonfle artificiellement les scores. De nombreuses approches antérieures améliorent surtout l’entraînement et peu se transfèrent à des benchmarks non vus. RRSI est proposé pour contrer ces dérives et relever les scores dans ces trois dimensions.
RRSI encadre les réécritures du harness sans le figer
Les agents reposent sur un harness qui orchestre prompts, outils, mémoire, flux et logique, jusqu’à vérifier quel fichier ouvrir, comment se remettre d’une erreur et comment présenter les résultats. Des méthodes récentes confient à un modèle de langage des réécritures successives de ce harness à partir de retours, dans une forme d’amélioration récursive auto-dirigée. RRSI agit aux deux extrémités de ce cycle. D’un côté, un budget borne le nombre de modifications indépendantes qu’une proposition peut regrouper, et ce budget décroît avec le temps pour passer de refontes amples à de petits changements explicitement reliés à des résultats. Le système journalise les tentatives pour éviter de relancer des pistes échouées et explore de nouvelles zones du harness en cas de stagnation. De l’autre, la promotion de changements en éléments permanents est filtrée par un critique qui écarte tout codage en dur de noms de tâches, de solutions ou d’astuces propres aux benchmarks. Des coûts de calcul supérieurs ne sont acceptés qu’avec un gain mesurable, et les composants devenus inutiles sont retirés.
Portée de l’étude, conclusion et disponibilité du code
Les essais se limitent à des harness fondés sur des modèles dont les paramètres restent fixes, sans aborder les situations où les poids sont modifiés. Ils concluent que l’auto-amélioration accroît de façon fiable les capacités des agents lorsque des retours répétés se traduisent par des modifications pérennes du harness. Le dépôt GitHub permet d’accéder au code associé.
Contexte : généralisation difficile et approches voisines
Des essais sur ARC-AGI-3 ont illustré les limites de généralisation de harness conçus manuellement : avec un harness sur mesure, Opus 4.6 a atteint 97,1 % dans un environnement familier contre 0 % dans un environnement non familier. D’autres travaux visent aussi à contenir les coûts et à améliorer la robustesse des agents. Nvidia a ainsi présenté SoL-Pi, où un agent de recherche reconstruit automatiquement le harness d’agents de programmation, réduisant l’usage de tokens jusqu’à 49 % sans baisse notable de performance. Peu auparavant, des équipes de Google avaient fait « rêver » des agents à leurs recherches passées pour affiner leur stratégie, en gardant le modèle inchangé. Dans ce paysage, Google Cloud AI Research et des universités introduisent RRSI comme une voie pour limiter la mémorisation des tests tout en réduisant les coûts.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.