Brief IA : Anthropic : Claude booste le code, appelle à une pause IA

Anthropic : Claude booste le code, appelle à une pause IA

Brief IA
Tom Levy·7 min·51 vues

Anthropic a révélé que Claude écrit désormais plus de 80 % de son code de production, permettant aux ingénieurs d'expédier huit fois plus de code par jour qu'en 2024. L'entreprise appelle également à une pause mondiale vérifiable dans le développement de l'IA, soulignant les risques d'une IA autonome capable de s'améliorer elle-même.

En bref
1Anthropic révèle que Claude génère plus de 80 % du code de production, marquant un tournant dans le développement logiciel.
2L'entreprise met en garde contre les risques d'une IA autonome et plaide pour une pause mondiale du développement.
3Claude améliore ses capacités de recherche, se rapprochant d'un jugement de niveau humain dans certains domaines.
💡Pourquoi c'est importantL'appel d'Anthropic à une pause mondiale souligne les préoccupations croissantes sur le contrôle et l'alignement des IA avancées.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Anthropic a récemment publié un rapport détaillé via son Anthropic Institute, révélant que Claude, son modèle d'intelligence artificielle, est désormais responsable de plus de 80 % du code de production de l'entreprise. Ce changement marque une transformation majeure dans la manière dont Anthropic développe son logiciel, avec une accélération notable de la productivité des ingénieurs.

Depuis le lancement de Claude Code en février 2025, la contribution de Claude au code de production est passée de chiffres modestes à plus de 80 %, et même 90 % si l'on inclut les scripts et le code expérimental. Un employé a même confié qu'il n'avait pas écrit de code lui-même depuis cinq mois.

Malgré cette augmentation impressionnante, Anthropic reconnaît que les lignes de code ne sont pas un indicateur parfait de productivité. Une enquête interne menée en mars 2026 auprès de 130 employés a révélé que l'augmentation de la production grâce à Mythos Preview est estimée à environ quatre fois, bien que ce chiffre soit probablement surestimé. Anthropic souligne des recherches récentes de METR montrant que les développeurs ont tendance à surestimer les gains de productivité de l'IA.

En termes de qualité, le code généré par Claude a atteint un niveau comparable à celui des développeurs humains fin 2025 et devrait surpasser ce niveau dans l'année à venir. Claude a également démontré son efficacité en détectant un tiers des bugs avant qu'ils n'atteignent la production et en fournissant plus de 800 corrections en avril 2026, réduisant une classe d'erreurs d'API par un facteur de 1 000. Selon un ingénieur, un humain aurait eu besoin de quatre ans pour accomplir ce travail.

Claude ne se contente pas de produire du code. Ses capacités de recherche se sont également améliorées, avec un taux de réussite croissant sur des tâches complexes. Depuis début 2026, la durée des tâches que Claude peut gérer de manière autonome a doublé tous les quatre mois. En mars 2024, Claude Opus 3 pouvait gérer des tâches de quatre minutes, alors qu'un an plus tard, Claude Sonnet 3.7 gérait une heure et demie. Claude Opus 4.6 s'attaque maintenant à des tâches de 12 heures.

METR a découvert que Claude Mythos Preview pouvait travailler pendant "au moins" 16 heures et était "à l'extrémité supérieure de ce que [METR] peut mesurer sans nouvelles tâches." Si cette tendance se maintient, des tâches d'une journée pourraient être à portée cette année, suivies de tâches d'une semaine en 2027, selon Anthropic.

Au-delà de la simple production de code, Anthropic montre des progrès dans la recherche assistée par IA. Dans un test d'optimisation interne où Claude doit rendre le code d'entraînement aussi rapide que possible, Claude Opus 4 a atteint une vitesse moyenne d'environ 3x en mai 2025. Un an plus tard, Mythos Preview a atteint environ 52x. Un chercheur humain expérimenté aurait besoin de quatre à huit heures pour atteindre 4x.

Dans une analyse de sessions de recherche réelles chez Anthropic, l'entreprise a examiné 129 moments où des développeurs humains ont pris un détour sous-optimal. Claude Mythos Preview a suggéré la meilleure étape suivante dans 64 % de ces cas, contre 51 % pour Claude Opus 4.5 six mois plus tôt. Anthropic appelle cela "un signal précoce que les systèmes d'IA s'améliorent dans la prise de décisions que la recherche en IA dépend."

Le goulot d'étranglement critique, selon Anthropic, est ce que l'entreprise appelle le "goût de la recherche" : la capacité à choisir les bons problèmes et à repérer les impasses tôt. "L'avantage comparatif des humains, pour l'instant, réside encore dans la capacité à voir le tableau d'ensemble et à penser au-delà des limites de la tâche immédiate," a déclaré un employé.

La possibilité que ce saut soit réalisable avec les méthodes actuelles reste une question ouverte. "Il est vraiment incertain si les méthodes d'entraînement et les architectures d'aujourd'hui pourraient débloquer cette capacité," indique le rapport.

Anthropic met cela en perspective : des changements de paradigme comme l'architecture Transformer se produisent avec des années d'intervalle. La plupart des progrès entre ces changements sont des travaux incrémentaux, exactement le type de flux de travail que Claude gère désormais bien. En s'inspirant de la célèbre citation d'Edison sur le génie étant un pour cent d'inspiration et quatre-vingt-dix-neuf pour cent de transpiration, Anthropic écrit : "Nous voyons la transpiration devenir de plus en plus automatisée."

Même si Claude ne développe jamais un bon goût de recherche, une lecture conservatrice des données implique une accélération cumulative : chaque ingénieur contribue beaucoup plus de travail qu'auparavant, car les humains ne gèrent qu'un pourcentage à un chiffre des décisions directionnelles.

Anthropic esquisse trois scénarios futurs. Dans le premier, la tendance stagne. Peut-être que les courbes exponentielles se révèlent être des courbes en S, ou que des goulets d'étranglement en matière d'énergie et de puces ralentissent les choses. Anthropic considère cela comme peu probable, car aucun aplatissement n'est visible jusqu'à présent.

Dans le second, les gains d'efficacité se poursuivent mais les humains conservent le contrôle directionnel. Des entreprises de 100 personnes pourraient réaliser le travail de 10 000 ou 100 000. Anthropic se voit sur ce chemin mais met en garde contre des risques tels que la surveillance autoritaire et des campagnes de manipulation ciblées. La loi d'Amdahl entre également en jeu : chez Anthropic, la révision du code par des humains est déjà devenue le nouveau goulot d'étranglement.

Le troisième scénario décrit une amélioration autonome récursive complète, où le rythme des progrès est limité uniquement par la puissance de calcul. La question de savoir si le problème d'alignement peut être résolu dans ce cas est "quelque chose dont nous sommes le moins certains." Des cas rares de désalignement pourraient s'accumuler, "devenant plus fréquents mais moins compris jusqu'à ce que nous perdions le contrôle."

Le passage le plus marquant du rapport concerne la position d'Anthropic sur le ralentissement du développement de l'IA. "Nous croyons qu'il serait bon pour le monde d'avoir la possibilité de ralentir ou de suspendre temporairement le développement de l'IA de pointe afin de permettre aux structures sociétales et à la recherche sur l'alignement de suivre l'avancée de la technologie," indique le rapport.

Anthropic affirme qu'il ralentirait ou suspendrait lui-même ses activités si d'autres développeurs à la pointe faisaient de même de manière vérifiable. L'Anthropic Institute prévoit de rechercher et de construire des systèmes qui rendraient une pause crédible possible - des mécanismes permettant aux développeurs de pointe de vérifier que d'autres ont réellement cessé ou ralenti.

Cependant, les obstacles sont énormes. Les sessions d'entraînement sont beaucoup plus faciles à cacher que des silos de missiles. Leurs entrées sont polyvalentes, et l'incitation à continuer en secret est massive : "Quiconque continue pendant que les autres font une pause pourrait hériter de l'avance." Une comparaison avec le traité INF sur les armes nucléaires semble évidente, mais ces régimes de vérification ont mis des décennies à se construire. "Nous n'avons pas ce temps," écrit Anthropic.

Une pause unilatérale par un seul laboratoire serait facile à réaliser immédiatement mais aurait beaucoup moins d'impact. Cela ne changerait que le leader sans créer le processus de délibération plus large qui fait défaut. Dans les mois à venir, Anthropic prévoit d'organiser des discussions impliquant des décideurs politiques, des chercheurs, la société civile et d'autres entreprises d'IA.

Le débat autour d'une pause de l'IA a déjà été soulevé il y a des années, mais ces appels n'ont pas pris d'ampleur. Avec le recul, cette poussée semblait prématurée compte tenu de ce que ces systèmes pouvaient réellement faire. Que cela soit du marketing basé sur la peur, comme les critiques l'ont déjà accusé avec Mythos, ne deviendra probablement clair qu'avec le temps.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires