Brief IA : Claude Opus 4.8 et GPT-5.6 Sol : articles de recherche rejetés

Claude Opus 4.8 et GPT-5.6 Sol : articles de recherche rejetés

Brief IA
Tom Levy·2 min·3 vues

Des agents équipés de Claude Opus 4.8 et GPT-5.6 Sol ont produit des articles de recherche qui ont été évalués comme « Rejetés » par les auteurs originaux de papiers NeurIPS. Malgré six jours de travail, 3 000 $ de crédits API et des GPU, l'étude menée avec Princeton et l'UK AI Security Institute a révélé des lacunes en jugement et créativité, contredisant les affirmations d'Anthropic et d'OpenAI sur la recherche autonome.

En bref
1Six jours, 3 000 $ de crédits API et des GPU n'ont pas permis de produire des articles acceptés
2Les textes générés ont été évalués « Rejetés » par les auteurs originaux de NeurIPS
3L'étude menée avec Princeton et l'UK AI Security Institute relève des limites en jugement et créativité
💡Pourquoi c'est importantCes résultats contredisent les affirmations d'Anthropic et d'OpenAI sur la proximité de la recherche autonome.
Le brief IA que lisent les pros

Tu codes avec l’IA ?

Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Mis en situation d'autonomie pour rédiger des articles scientifiques, des agents équipés de Claude Opus 4.8 et GPT-5.6 Sol ont produit des textes évalués « Rejetés » par les auteurs originaux de papiers NeurIPS non publiés. Selon l'étude, conduite avec Princeton et l'UK AI Security Institute, les modèles savent dérouler l'ingénierie de recherche mais trébuchent sur le jugement et la résolution créative de problèmes, ainsi que sur l'abandon d'approches inefficaces. Ces constats vont à l'encontre des affirmations d'Anthropic et d'OpenAI qui présentent la recherche autonome comme proche.

L'étude pointe des lacunes de jugement et de créativité

L'étude indique que les modèles de pointe sont capables de mener l'ensemble du processus d'ingénierie de recherche. Cependant, elle relève des échecs en jugement scientifique, en résolution créative de problèmes et dans la capacité à abandonner des pistes infructueuses. Les articles générés ont finalement été évalués comme « Rejetés ».

Six jours, 3 000 $ et des GPU pour des agents Claude et GPT

Les agents d'IA utilisaient Claude Opus 4.8 et GPT-5.6 Sol. Ils ont bénéficié de six jours, de 3 000 dollars de crédits API et d'un accès GPU pour rédiger de façon autonome des articles de recherche en IA. Les textes produits ont été évalués par les auteurs originaux d'articles NeurIPS non publiés.

Avec Princeton et l'UK AISI, des affirmations sont contestées

L'étude a été réalisée en collaboration avec Princeton et l'UK AI Security Institute. Ses conclusions s'opposent aux affirmations d'Anthropic et d'OpenAI qui présentent la recherche autonome en IA comme imminente.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires