Brief IA

Un ingénieur relie la baisse de lisibilité de Claude à l'entraînement

🤖 Models & LLM·Tom Levy·

Un ingénieur relie la baisse de lisibilité de Claude à l'entraînement

Un ingénieur relie la baisse de lisibilité de Claude à l'entraînement
Key Takeaways
1Un ingénieur d’Anthropic relie la baisse de lisibilité de Claude à l’optimisation pour le code et les mathématiques
2Les modèles ont été entraînés à produire des explications destinées à d’autres IA, d’où un style difficile pour les humains
3Opus 5.5 vise un meilleur équilibre, sans dépasser forcément Opus 4.6
💡Why it mattersLes choix d’entraînement influencent directement la capacité des IA à communiquer efficacement avec les utilisateurs humains.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Un spécialiste de l'ajustement de Claude chez Anthropic relie la dégradation perçue du style à des choix d'entraînement récents. Il évoque un arbitrage en faveur des mathématiques et du code, et des explications calibrées pour des modèles d'IA. Opus 5.5 viserait un meilleur équilibre, sans dépasser à coup sûr les performances rédactionnelles d'Opus 4.6.

Opus 5.5 cherche l’équilibre sans détrôner Opus 4.6

Jackson Kernion affirme qu’avec Opus 5.5, Anthropic a trouvé un meilleur équilibre. Il ajoute n’avoir pas été aussi satisfait de l’écriture d’un modèle depuis Opus 4.6. Il précise toutefois qu’Opus 5.5 ne surpasse pas nécessairement le modèle plus ancien. Auparavant, il présentait Opus 4.6 comme le dernier bon modèle d’écriture d’Anthropic.

Des explications formatées pour des LLM, pas pour des humains

Kernion précise que les modèles ont été entraînés à générer des explications techniques à destination d’autres systèmes d’IA, ce qui conduit à des formulations qualifiées de « Claudeish ». Il explique que le modèle a été ajusté pour correspondre à la façon de penser des LLM et qu’il a appris à rédiger en s’adressant à des IA plutôt qu’à des personnes. Selon lui, les LLM disposent d’une mémoire de travail bien plus importante et saisissent les détails à un niveau plus fin. À l’entraînement, il en résulte un style efficace pour les modèles d’IA, mais perçu par les lecteurs comme des décharges d’informations trop denses. Il compare cette situation à un groupe de personnes qui ne communiqueraient qu’entre elles, développant un style difficile à suivre pour les autres.

L’optimisation pour le code impose de compenser côté langage

Kernion situe le cœur du problème dans la structure de récompense de l’apprentissage par renforcement, où certaines récompenses favorisent la compréhension par les modèles et d’autres par les humains. Plus l’entraînement cible les mathématiques et le code, plus il faut compenser activement en récompensant des explications simples accessibles aux lecteurs humains. Il relie la dégradation du style écrit à cette optimisation vers les tâches techniques. En parallèle, les performances progressent rapidement en mathématiques, en code et en raisonnement, alors que la qualité de l’écriture a stagné ou empiré.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.