Brief IA : Claude Fable 5.1 : bond sur la science et raisonnement modulable

Claude Fable 5.1 : bond sur la science et raisonnement modulable

Brief IA
Tom Levy·4 min·1 vues

Claude Fable 5.1, présenté par Anthropic, atteint un score de 52,6 % sur Terminal-Bench-Science 0.1, surpassant Fable 5, Opus 5 et GPT-5.6 Sol. Il introduit cinq niveaux de raisonnement, sans option de désactivation, et permet de générer des contenus complexes, comme un SVG détaillé d'un « pélican à vélo », illustrant des avancées notables en science et en contrôle de raisonnement.

En bref
1Claude Fable 5.1 atteint 52,6 % sur Terminal-Bench-Science 0.1, loin devant Fable 5, Opus 5 et GPT-5.6 Sol
2Le modèle propose cinq niveaux de raisonnement, sans option de désactivation
3Des tests montrent une montée de l’effort, du coût et du détail des traces, jusqu’à générer un SVG de « pélican à vélo » puis une version animée
💡Pourquoi c'est importantCes résultats illustrent à la fois les progrès mesurés sur la science et la granularité du contrôle de raisonnement offerte par Fable 5.1.
Le brief IA que lisent les pros

Tu veux les meilleurs outils IA avant les autres ?

On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Anthropic présente Claude Fable 5.1 avec un score de 52,6 % sur Terminal-Bench-Science 0.1, nettement supérieur aux versions et modèles comparés. Cinq niveaux de raisonnement sont proposés, sans possibilité de les couper totalement. Des essais montrent des écarts marqués d’effort et de sortie jusqu’à générer un SVG de « pélican à vélo », puis une version animée.

Un « pélican à vélo » animé produit après un rendu détaillé

Une génération effectuée au niveau maximal a abouti à un SVG richement détaillé, intégrant un arrière-plan, les deux jambes du pélican placées de part et d'autre du cadre, les pieds posés sur les pédales, une aile positionnée sur le guidon, un chapeau bleu ainsi qu’un panier contenant un poisson. Suite à une proposition de l’utilisateur swalsh sur Hacker News, cette version a été utilisée comme base pour générer une animation en recourant au niveau de réflexion par défaut « Haut » via la commande indiquée. L'opération a utilisé 6 121 tokens en entrée et 26 201 en sortie, pour un coût de 1,37 $. Lors de l'export en vidéo, les roues semblent tourner dans la mauvaise direction, ce qui est attribué à la conversion en MP4, alors qu'elles apparaissent correctes dans le SVG original.

Fable 5.1 introduit cinq paliers de raisonnement sans désactivation totale

Fable 5.1 propose cinq paliers de raisonnement—bas, moyen, élevé, très élevé et max—sans possibilité de désactiver complètement ce mécanisme. Un correctif a été appliqué à l’outil llm-anthropic pour enregistrer correctement les traces avant les essais. Dans un test avec le prompt « Générer un SVG d’un pélican faisant du vélo », les réglages bas et moyen n’ont pas montré de texte de raisonnement résumé, avec respectivement 1 998 tokens (23,8 s, 10,017 cents) et 1 977 tokens (23 s, 9,912 cents). Le niveau élevé a produit 2 612 tokens en 29,6 s (13,087 cents) avec un bref plan de construction du SVG. Le niveau très élevé a généré 36 767 tokens en 7 min 51 s (1,83 $) avec une trace détaillant proportions et éléments, jusqu’à accepter une « légère épaisseur » jugée charmante. Ces observations montrent une montée graduelle de l’effort et de la verbosité des traces selon le niveau choisi.

Le débat autour du benchmark pelican et l’intérêt des comparaisons internes

Des réserves avaient été exprimées en juillet sur la corrélation du benchmark pelican avec la qualité générale des modèles, jugée moins évidente qu’en 2025. L’intérêt signalé porte surtout sur les comparaisons au sein d’une même famille et entre niveaux d’effort pour un même prompt. Des extraits de trace illustrent cette granularité : ajout des pédales, hésitation sur des accessoires, gestion de l’encombrement visuel, arbitrage entre casque et crête, puis ajustements géométriques comme la réduction d’un casque pour éviter un chevauchement au point (484,84), l’ajout d’une zone de plumes sombres, la vérification des aérations du casque et la correction de la courbe de fourche. À titre de perception, Gemini 3.7 Flash est cité comme ayant plus de « flair », sans que cela soit un objectif du prompt.

Anthropic met l’accent sur la science avec un 52,6 % au nouvel indice

Anthropic annonce Claude Fable 5.1 et Mythos 5.1 et avance que Fable 5.1 établit une nouvelle norme pour la programmation, le travail de connaissance et les tâches longues de résolution de problèmes. La société affiche un score de 52,6 % sur le tout nouveau Terminal-Bench-Science 0.1, présenté pour la première fois le 27 août. Les comparaisons publiées montrent Fable 5 à 24,7 %, Opus 5 à 29,0 % et GPT-5.6 Sol à 22,4 % sur ce même test. D’autres évaluations sont évoquées avec des progressions plus modestes, moins marquantes que la performance observée sur la composante scientifique.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires