Brief IA : MirrorCode : Claude Opus 4.7 excelle mais bute sur la complexité

MirrorCode : Claude Opus 4.7 excelle mais bute sur la complexité

Brief IA
Tom Levy·4 min·6 vues

Claude Opus 4.7 a obtenu un taux de réussite de 56 % dans le benchmark MirrorCode d'Epoch AI, réussissant à recréer 16 000 lignes de code en 14 heures. Cependant, les modèles d'IA échouent sur les tâches complexes, malgré une exécution continue de 19 jours coûtant 2 600 $. Cette situation souligne les défis persistants dans la capacité des IA à développer des programmes sans accès au code source original.

En bref
1Le benchmark MirrorCode d'Epoch AI évalue la capacité des IA à recréer des programmes sans code source.
2Claude Opus 4.7 a atteint un taux de réussite de 56 %, recréant 16 000 lignes de code en 14 heures.
3Les modèles échouent sur les tâches complexes, malgré une exécution continue de 19 jours coûtant 2 600 $.
💡Pourquoi c'est importantLa capacité des IA à recréer du code sans accès direct pourrait transformer le développement logiciel, mais les défis complexes restent un obstacle majeur.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

MirrorCode : Claude Opus 4.7 excelle mais bute sur la complexité

Un modèle d'IA a été programmé sans interruption pendant 19 jours sur une seule tâche de MirrorCode, coûtant 2 600 $ à exécuter.

Epoch AI et METR ont développé un nouveau benchmark appelé "MirrorCode" qui exige des modèles d'IA qu'ils recréent des programmes complets dans divers domaines de l'informatique à partir de zéro, sans accès au code source original.

Claude Opus 4.7 se distingue dans ce benchmark avec un taux de réussite de 56 % et a réussi à réimplémenter un ensemble d'outils de bioinformatique de 16 000 lignes de code en seulement 14 heures.

Bien que tous les modèles testés puissent gérer de manière fiable des programmes plus petits, aucun d'entre eux n'a encore réussi à résoudre les tâches les plus complexes.

Le nouveau benchmark de codage MirrorCode d'Epoch AI et METR teste si les modèles d'IA peuvent recréer des programmes entiers de manière autonome. Claude Opus 4.7 est en tête avec 56 %, mais chaque modèle échoue encore sur les tâches les plus complexes.

Dans le benchmark MirrorCode, les modèles d'IA doivent réimplémenter des programmes complets à partir de zéro sans accès au code source original. Les 25 programmes cibles couvrent des utilitaires Unix, la sérialisation de données, la bioinformatique, les interprètes, l'analyse statique, la cryptographie et la compression. Chaque solution générée par l'IA doit reproduire exactement la sortie du programme original, y compris les tests de bout en bout cachés que le modèle ne voit jamais pendant le développement.

Une autre différence par rapport à de nombreux autres benchmarks est le budget d'inférence. Les benchmarks d'ingénierie logicielle existants limitent souvent les coûts à 1 à 10 $ par tâche, même lorsqu'un humain aurait besoin de semaines pour terminer le même travail, selon les développeurs.

Selon Epoch AI, l'une des plus grandes tâches dans MirrorCode a coûté 2 600 $ pour une seule exécution. L'IA a travaillé en continu pendant 19 jours sans aucune intervention humaine.

Claude Opus 4.7 reconstruit un ensemble d'outils de bioinformatique en 14 heures

Epoch AI affirme que l'IA peut déjà gérer des tâches de programmation à long terme exigeantes. L'exemple marquant provient de Claude Opus 4.7, qui a réimplémenté gotree, un ensemble d'outils de bioinformatique d'environ 16 000 lignes de code Go et plus de 40 commandes. Un ingénieur humain travaillant sans aide de l'IA aurait besoin de 2 à 17 semaines pour le même travail, selon les chercheurs. Opus 4.7 a terminé en 14 heures pour 251 $.

Claude Opus 4.7 est en tête du benchmark MirrorCode avec un taux de réussite de 56 %, suivi par GPT-5.5 à 44 % et Gemini 3.1 Pro Preview à 32 %. Même lorsque les modèles échouent à réimplémenter complètement un programme, ils réussissent généralement 90 % ou plus des tests.

Les tâches les plus difficiles restent un défi pour chaque modèle

Malgré les progrès, MirrorCode est loin d'être résolu. Les tâches se répartissent en trois catégories : petites, moyennes et grandes. Les petits programmes comme uuid ou parseqsv sont réimplémentés de manière fiable par tous les modèles testés. Les plus grandes tâches surpassent chaque modèle testé.

Les chercheurs observent encore des gains rapides. Les modèles leaders d'il y a un an auraient obtenu seulement environ 30 % et auraient été limités à des programmes plus simples comme un utilitaire de calendrier, selon Epoch AI.

Les tendances de coût ne suivent pas un schéma clair. GPT-5.5 coûte trois fois plus cher que GPT-5 pour les mêmes tâches, tandis que Claude Opus 4.7 fonctionne trois fois moins cher que Claude Opus 4.1.

Epoch AI a open-sourcé l'ossature et 22 des 25 programmes cibles, couvrant 132 instances de tâches dans six langages de programmation. Trois programmes sont gardés privés pour des tests.

Les chercheurs soulignent un point important : puisque MirrorCode utilise des programmes open-source comme cibles, les modèles ont peut-être déjà vu le code original pendant leur formation. Les tests initiaux suggèrent que "les résultats n'étaient pas dominés par la mémorisation, mais nous ne pouvons pas exclure la possibilité que la mémorisation contribue à la performance de l'IA."

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires