Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Anthropic présente Claude Fable 5.1 avec un score de 52,6 % sur Terminal-Bench-Science 0.1, nettement supérieur aux versions et modèles comparés. Cinq niveaux de raisonnement sont proposés, sans possibilité de les couper totalement. Des essais montrent des écarts marqués d’effort et de sortie jusqu’à générer un SVG de « pélican à vélo », puis une version animée.
Un « pélican à vélo » animé produit après un rendu détaillé
Une génération effectuée au niveau maximal a abouti à un SVG richement détaillé, intégrant un arrière-plan, les deux jambes du pélican placées de part et d'autre du cadre, les pieds posés sur les pédales, une aile positionnée sur le guidon, un chapeau bleu ainsi qu’un panier contenant un poisson. Suite à une proposition de l’utilisateur swalsh sur Hacker News, cette version a été utilisée comme base pour générer une animation en recourant au niveau de réflexion par défaut « Haut » via la commande indiquée. L'opération a utilisé 6 121 tokens en entrée et 26 201 en sortie, pour un coût de 1,37 $. Lors de l'export en vidéo, les roues semblent tourner dans la mauvaise direction, ce qui est attribué à la conversion en MP4, alors qu'elles apparaissent correctes dans le SVG original.
Fable 5.1 introduit cinq paliers de raisonnement sans désactivation totale
Fable 5.1 propose cinq paliers de raisonnement—bas, moyen, élevé, très élevé et max—sans possibilité de désactiver complètement ce mécanisme. Un correctif a été appliqué à l’outil llm-anthropic pour enregistrer correctement les traces avant les essais. Dans un test avec le prompt « Générer un SVG d’un pélican faisant du vélo », les réglages bas et moyen n’ont pas montré de texte de raisonnement résumé, avec respectivement 1 998 tokens (23,8 s, 10,017 cents) et 1 977 tokens (23 s, 9,912 cents). Le niveau élevé a produit 2 612 tokens en 29,6 s (13,087 cents) avec un bref plan de construction du SVG. Le niveau très élevé a généré 36 767 tokens en 7 min 51 s (1,83 $) avec une trace détaillant proportions et éléments, jusqu’à accepter une « légère épaisseur » jugée charmante. Ces observations montrent une montée graduelle de l’effort et de la verbosité des traces selon le niveau choisi.
Le débat autour du benchmark pelican et l’intérêt des comparaisons internes
Des réserves avaient été exprimées en juillet sur la corrélation du benchmark pelican avec la qualité générale des modèles, jugée moins évidente qu’en 2025. L’intérêt signalé porte surtout sur les comparaisons au sein d’une même famille et entre niveaux d’effort pour un même prompt. Des extraits de trace illustrent cette granularité : ajout des pédales, hésitation sur des accessoires, gestion de l’encombrement visuel, arbitrage entre casque et crête, puis ajustements géométriques comme la réduction d’un casque pour éviter un chevauchement au point (484,84), l’ajout d’une zone de plumes sombres, la vérification des aérations du casque et la correction de la courbe de fourche. À titre de perception, Gemini 3.7 Flash est cité comme ayant plus de « flair », sans que cela soit un objectif du prompt.
Anthropic met l’accent sur la science avec un 52,6 % au nouvel indice
Anthropic annonce Claude Fable 5.1 et Mythos 5.1 et avance que Fable 5.1 établit une nouvelle norme pour la programmation, le travail de connaissance et les tâches longues de résolution de problèmes. La société affiche un score de 52,6 % sur le tout nouveau Terminal-Bench-Science 0.1, présenté pour la première fois le 27 août. Les comparaisons publiées montrent Fable 5 à 24,7 %, Opus 5 à 29,0 % et GPT-5.6 Sol à 22,4 % sur ce même test. D’autres évaluations sont évoquées avec des progressions plus modestes, moins marquantes que la performance observée sur la composante scientifique.




