Brief IA

Claude Opus 4.8 et GPT-5.6 Sol : articles de recherche rejetés

💻 Code & Dev·Tom Levy·

Claude Opus 4.8 et GPT-5.6 Sol : articles de recherche rejetés

Claude Opus 4.8 et GPT-5.6 Sol : articles de recherche rejetés
Key Takeaways
1Six jours, 3 000 $ de crédits API et des GPU n'ont pas permis de produire des articles acceptés
2Les textes générés ont été évalués « Rejetés » par les auteurs originaux de NeurIPS
3L'étude menée avec Princeton et l'UK AI Security Institute relève des limites en jugement et créativité
💡Why it mattersCes résultats contredisent les affirmations d'Anthropic et d'OpenAI sur la proximité de la recherche autonome.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Mis en situation d'autonomie pour rédiger des articles scientifiques, des agents équipés de Claude Opus 4.8 et GPT-5.6 Sol ont produit des textes évalués « Rejetés » par les auteurs originaux de papiers NeurIPS non publiés. Selon l'étude, conduite avec Princeton et l'UK AI Security Institute, les modèles savent dérouler l'ingénierie de recherche mais trébuchent sur le jugement et la résolution créative de problèmes, ainsi que sur l'abandon d'approches inefficaces. Ces constats vont à l'encontre des affirmations d'Anthropic et d'OpenAI qui présentent la recherche autonome comme proche.

L'étude pointe des lacunes de jugement et de créativité

L'étude indique que les modèles de pointe sont capables de mener l'ensemble du processus d'ingénierie de recherche. Cependant, elle relève des échecs en jugement scientifique, en résolution créative de problèmes et dans la capacité à abandonner des pistes infructueuses. Les articles générés ont finalement été évalués comme « Rejetés ».

Six jours, 3 000 $ et des GPU pour des agents Claude et GPT

Les agents d'IA utilisaient Claude Opus 4.8 et GPT-5.6 Sol. Ils ont bénéficié de six jours, de 3 000 dollars de crédits API et d'un accès GPU pour rédiger de façon autonome des articles de recherche en IA. Les textes produits ont été évalués par les auteurs originaux d'articles NeurIPS non publiés.

Avec Princeton et l'UK AISI, des affirmations sont contestées

L'étude a été réalisée en collaboration avec Princeton et l'UK AI Security Institute. Ses conclusions s'opposent aux affirmations d'Anthropic et d'OpenAI qui présentent la recherche autonome en IA comme imminente.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.