Brief IA

DeepMind : Dream-RSI teste des stratégies en relecture

🛠️ AI Tools·Tom Levy·

DeepMind : Dream-RSI teste des stratégies en relecture

DeepMind : Dream-RSI teste des stratégies en relecture
Key Takeaways
1Dream-RSI de Google DeepMind permet de tester des stratégies en rejouant des historiques de recherche, sans relancer le modèle
2Les essais avec Gemini 3.1 Pro et 3.7 Flash montrent des gains sur des tâches de code, d’optimisation et de GPU avec moins de tentatives
3Des instructions explicites ont parfois limité l’exploration sur une tâche GPU
💡Why it mattersDream-RSI propose une nouvelle façon d’optimiser la recherche des agents IA tout en réduisant le coût computationnel, et éclaire les limites de l’approche par consignes.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Google et DeepMind présentent Dream-RSI, une méthode qui rejoue des historiques de recherche pour évaluer des stratégies sans relancer les calculs. Les essais avec Gemini 3.1 Pro et 3.7 Flash montrent des gains sur des tâches de code, d’optimisation et de GPU avec moins de tentatives. Des instructions trop précises peuvent restreindre l’exploration. Le code est publié sur GitHub.

Des consignes trop précises ont dégradé une tâche GPU

Les chercheurs ont évalué une variante qui condensait des historiques de recherche en instructions destinées à guider l’agent. Lors d’une tâche GPU, cette version a affiché des performances inférieures à celle qui ne comportait pas d’instructions explicites. Selon les chercheurs, des indications excessivement précises risquent de limiter l’espace de recherche et d’entraver l’exploration d’un éventail plus large d’approches par l’agent. Selon Dream-RSI, ce genre d’instructions est lié à une exploration moins étendue dans le cadre de tâches de recherche ouvertes. La stratégie apprise a ajusté l’effort de recherche : elle a d’abord réduit le nombre de tentatives lorsque les performances s’amélioraient, puis l’a augmenté quand les progrès se sont arrêtés, ce qui a coïncidé avec de nouveaux gains. Le PDG d’Anthropic, Dario Amodei, a récemment mis en garde contre le rythme de la recherche en IA, citant notamment les avancées dans l’auto-amélioration.

Des gains mesurés sur code, optimisation et GPU

Dream-RSI a été testé avec Gemini 3.1 Pro et Gemini 3.7 Flash sur huit tâches réparties en trois domaines, face à une référence disposant des mêmes conditions initiales et d’une stratégie fixe. Pour une tâche visant à développer le programme le plus rapide pour un calcul statistique employé en finance et en génomique, le programme généré a dépassé sklearn et glmnet sur l’intégralité des six ensembles de données de test. Avec Gemini 3.1 Pro, la durée moyenne d’exécution a diminué de 3 587 à 2 931 millisecondes, tandis que le nombre de tentatives est passé de 550 à 317. Dream-RSI a aussi surpassé SimpleTES, qui nécessitait 51 200 exécutions alors que Dream-RSI n’en demandait que 317. Pour les tâches d’optimisation mathématique et de conception de noyaux GPU, les résultats étaient similaires ou supérieurs, tout en réduisant nettement le coût computationnel : sur deux tâches GPU, le nombre d’exécutions a été divisé jusqu’à 2,43 fois à niveau de performance identique, et sur deux autres, les performances ont atteint jusqu’à 2,09 fois celles de la référence à budget égal.

Rejouer l’arbre de recherche sans rappeler le modèle

La méthode Dream-RSI réutilise les données d’une recherche terminée pour tester d’autres stratégies dans l’espace déjà exploré. Pendant l’exploration, l’agent enregistre ses tentatives et leurs résultats, ce qui permet ensuite d’exécuter une stratégie alternative contre ces sorties stockées, sans nouvelle exécution en direct. Cette relecture permet de vérifier ce qui se serait produit si d’autres branches avaient été privilégiées ou abandonnées plus tôt, sans inventer de solutions inédites et en restant dans l’arbre déjà construit. Les résultats conservés autorisent l’examen de milliers de politiques alternatives sans rappeler le modèle ni l’évaluateur, tout en modifiant la manière de chercher sans toucher au modèle sous-jacent. Ce positionnement répond aux limites des approches classiques : une stratégie fixe rejoue ses impasses, tandis qu’une adaptation en ligne exige de nombreuses tentatives et la répétition d’exécutions coûteuses pour évaluer de multiples alternatives. Les chercheurs de Google et DeepMind proposent ainsi une méthode qui réutilise les recherches passées pour tester des stratégies sans surcoût de calcul.

Place dans l’écosystème : AlphaEvolve, AutoTTS, WikiSkill, Hyperagents

En 2025, Google DeepMind a dévoilé AlphaEvolve, un système où Gemini Flash produit des suggestions de code, Gemini Pro les évalue et un algorithme évolutif retient les versions les plus performantes. Dream-RSI agit à un stade plus général, en affinant la stratégie de recherche dans son ensemble. AutoTTS fait appel à un agent de programmation pour explorer des algorithmes dans un environnement simulé ; ces approches ont dépassé les méthodes conçues manuellement tout en consommant moins de ressources. Google Research a récemment introduit WikiSkill, qui enregistre les réussites et les échecs dans un wiki et les convertit en instructions réutilisables pour l’agent, tandis que l’analyse de suivi de Dream-RSI relie des instructions explicites à une exploration plus restreinte sur des tâches ouvertes. Meta pousse plus loin avec Hyperagents, qui autorise les agents à modifier eux-mêmes le mécanisme pilotant leur auto-amélioration. L’auto-amélioration récursive suscite un intérêt croissant, et ces méthodes se distinguent par le niveau où elles interviennent et la façon dont elles exploitent l’historique d’exécution.

Ce que cela implique pour les agents auto-améliorants

Les agents auto-améliorants sont envisagés pour découvrir de nouveaux algorithmes, résoudre des problèmes mathématiques ou produire du code plus rapide, en itérant sur la boucle proposer, évaluer, apprendre et réessayer au fil de milliers de tentatives. Cette dynamique confronte toutefois à des espaces de recherche immenses et à des arbitrages d’exploration entre pistes prometteuses, essais parallèles et abandons. Le comportement de ces systèmes dépend de leur capacité à éviter les impasses répétées et à maîtriser le coût d’évaluation de stratégies alternatives. Les chercheurs ont publié le code et des détails supplémentaires sur GitHub, ce qui ouvre la voie à des réutilisations et comparaisons plus systématiques par la communauté.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.