Les agents IA assurent l'exécution, les humains fixent les objectifs

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Des chercheurs ayant construit Atria Dawn Preview, un modèle de 744 milliards de paramètres, ont analysé des centaines de journaux de tâches. Les agents réalisent la majeure partie de l'exécution et permettent des travaux inédits, mais les choix de méthode, d'objectif et de périmètre restent surtout humains. Cette organisation complique la supervision alors que l'industrie explore l'automatisation de sa R&D.
Supervision mise à l'épreuve et automatisation en débat
Quand la suite d'actions réalisée par les agents devient trop complexe pour qu'une personne puisse réellement tout examiner, il devient compliqué d'assurer une supervision efficace. Dans le scénario le plus défavorable, les humains se contentent d'approuver ce qui leur est soumis. De nombreux participants ont utilisé des modes autonomes pour éviter des interruptions d'approbation répétées, une frontière souvent fixée pour des raisons de commodité plutôt qu'après un choix explicite sur l'autorité accordée à l'IA. Parallèlement, des acteurs majeurs expérimentent des approches plus automatisées. Anthropic estime possible plus tôt que prévu qu'une IA conçoive son successeur, et son PDG Dario Amodei appelle à une limite de vitesse pour le secteur. Selon l'entreprise, les humains ne prendraient plus qu'une part à un chiffre des décisions d'orientation de la recherche. OpenAI utilise GPT-5.6 Sol sur l'ensemble de son cycle de développement. Google et DeepMind laissent des agents explorer des stratégies via Dream-RSI, avec un périmètre limité à l'amélioration de la stratégie de recherche et non du modèle. Plus de mille employés de grandes entreprises d'IA ont récemment alerté sur un possible basculement vers l'automatisation de la recherche. Des chercheurs de Princeton et de l'Institut britannique de sécurité de l'IA concluent que les modèles actuels savent mener l'ingénierie de recherche, mais échouent sur les décisions de jugement importantes.
Qui décide : l’IA propose, l’humain tranche dans la plupart des cas
Dans les choix de méthodes et de paramètres, le schéma le plus fréquent est celui où l'IA propose et l'humain sélectionne, observé dans 55,4 % des situations. Globalement, les humains ont pris 85,5 % des décisions de méthodes et paramètres, contre 9,2 % pour l'IA. Pour les objectifs et le périmètre, la décision finale a été humaine dans 93,4 % des cas. La part de propositions émanant de l'IA varie selon le type de décision, de 17 à 55 %, mais sa part dans les décisions finales reste à un chiffre. Malgré des variations dans l'origine des options, les humains conservent la majorité des choix finaux. Même pour les 151 tâches jugées irréalisables sans IA, la définition de l'objectif a été choisie par des humains dans 95,4 % des cas.
Ce que change l’assistance : plus d’exécution agentique, jugement humain central
L'IA a été mobilisée dans 96,5 % des tâches étudiées. Le ratio médian entre actions d'agents et entrées humaines est passé de 11 à 28,5 en quatre semaines. Les auteurs de l'étude préviennent qu'il ne faut pas interpréter ces résultats comme une augmentation de l'autonomie : chaque intervention humaine entraînait principalement une multiplication des étapes réalisées par les agents. Parmi les 455 tâches bénéficiant d'une assistance, 151 ont été considérées comme impossibles à accomplir sans IA, ces cas étant répartis sur 27 des 56 participants, ce qui indique un effet diffus. Dans ces cas, l'IA n'a pas simplement permis d'aller plus vite sur une tâche existante, elle a permis l'exécution de tâches qui n'auraient pas pu être réalisées autrement. Face aux difficultés, l'intervention humaine a permis une progression dans 76 % des 588 cas renseignés, tandis que l'agent a résolu seul 23 %. L'aide humaine a pris la forme d'apports d'information : ajout de contexte et clarification des exigences dans 35,2 %, diagnostic et changement de méthode dans 34,7 %. Les prises en main directes ont été rares, avec 3,2 % de modifications partielles et 0,7 % de prises en charge complètes. Quand une révision était nécessaire, l'IA a réalisé elle-même 75,4 % des corrections après retours, ce qui situe le goulot d'étranglement côté jugement plutôt que dans l'exécution.
Le projet Atria : un modèle MoE et un pipeline vérifié par signaux externes
Un projet conduit par une équipe incluant des chercheurs de l'Université Fudan a servi de base à ces travaux. Plus de 700 journaux de tâches issus de 56 participants, ainsi que des journaux d'agents, ont été analysés. Les travaux ont porté sur Atria Dawn Preview, un modèle de langage agentique basé sur une architecture mélange d'experts totalisant 744 milliards de paramètres, conçu pour des applications en recherche et en ingénierie. Ce modèle a été formé à l'aide d'un pipeline relié à un environnement d'exécution réel, permettant l'utilisation d'outils, la génération de résultats intermédiaires et la validation par des signaux externes, tels que des tests, des métriques ou des preuves sources. Selon l'équipe, le modèle se classe premier sur cinq des seize benchmarks évalués, incluant la recherche web et la cybersécurité, sans toutefois revendiquer de supériorité globale. Les chercheurs décrivent une trajectoire en trois phases du rôle de l'IA, passée de sujet de recherche à outil, puis à partenaire de projet, ce dernier élaborant et ajustant des plans dans des objectifs fixés par des humains. Ils évoquent une quatrième phase hypothétique d'auto-amélioration récursive, où des modèles plus puissants produiraient des successeurs plus forts.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.