Brief IA : Claude Fable 5 : Anthropic double les coûts pour 5,7 % de gain

Claude Fable 5 : Anthropic double les coûts pour 5,7 % de gain

Brief IA
Tom Levy·3 min·44 vues

Claude Fable 5 obtient 64,9 points dans l'Artificial Analysis Intelligence Index, établissant des records dans cinq des dix benchmarks. Cependant, son augmentation de performance de seulement 5,7 % par rapport à Opus 4.8 s'accompagne d'un doublement du prix par token, rendant l'option moins attractive. De plus, les filtres de sécurité avec routage de secours augmentent encore les coûts.

En bref
1Le modèle Claude Fable 5 d'Anthropic domine l'Artificial Analysis Intelligence Index avec 64,9 points, surpassant GPT-5.5.
2Le coût d'exécution de Claude Fable 5 atteint près de 10 000 $, soit le double de son prédécesseur Opus 4.8, pour une amélioration de performance de 5,7 %.
3Sur le benchmark AA-Omniscience, Claude Fable 5 obtient 40 points, battant le précédent leader Gemini 3.1 Pro Preview de sept points.
💡Pourquoi c'est importantLes entreprises doivent peser le coût élevé de Claude Fable 5 contre ses modestes gains de performance pour des applications spécifiques.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Le dernier modèle d'intelligence artificielle d'Anthropic, Claude Fable 5, a récemment pris la tête de l'Artificial Analysis Intelligence Index, devançant des concurrents comme GPT-5.5. Avec un score de 64,9 points, il surpasse le meilleur modèle non-Anthropic d'environ cinq points. Cependant, cette avancée technologique a un coût significatif.

Le modèle affiche une amélioration de performance de 5,7 % par rapport à son prédécesseur Opus 4.8, mais cela s'accompagne d'une augmentation substantielle des coûts. Les prix des tokens ont doublé, atteignant 10 $ et 50 $ par million de tokens d'entrée et de sortie respectivement, contre 5 $ et 25 $ pour Opus 4.8. Ainsi, une exécution complète de l'index coûte désormais près de 10 000 $, soit le double du prix précédent.

Malgré ces coûts élevés, Claude Fable 5 établit des records dans plusieurs benchmarks. Sur AA-Omniscience, il atteint 40 points, surpassant le précédent leader, Gemini 3.1 Pro Preview, de sept points grâce à une précision accrue. Toutefois, son taux d'hallucination reste moyen, avec un score de 55 %.

Dans les tâches agentiques, Fable 5 continue de renforcer la position d'Anthropic. Sur GDPval-AA, il obtient un Elo de 1 932, une augmentation de 2,2 % par rapport à Opus 4.8. Il domine également Terminal-Bench Hard pour le codage agentique et Tau2-bench Telecom pour l'utilisation d'outils. Sur Humanity's Last Exam, le modèle obtient 53 %, soit plus de sept points devant Opus 4.8. Une seule exécution HLE avec fallback coûte environ 2 200 $, le plus cher de tous les modèles testés par Artificial Analysis.

Fable 5 utilise le même modèle de base que Claude Mythos 5, selon Anthropic, avec des protections supplémentaires pour les requêtes touchant à la cybersécurité, la biologie, la chimie et la distillation de modèles. Lorsqu'un filtre se déclenche, un mécanisme de fallback redirige la demande vers Opus 4.8. Ces demandes redirigées comptent toujours pour la facturation, augmentant ainsi les coûts totaux.

Fable 5 conserve la même fenêtre de contexte d'un million de tokens qu'Opus 4.8. Les abonnés Pro, Max, Team et Enterprise peuvent l'utiliser jusqu'au 22 juin, avec une utilisation comptant au double du tarif d'Opus. Après cette date, il passera à une facturation basée sur les crédits, ce qui le rendra encore plus coûteux que les tarifs des tokens ne le suggèrent. Anthropic a déclaré qu'il rétablira l'accès par abonnement une fois la capacité le permettra.

Mon collègue Max a récemment analysé les forces et les faiblesses de Fable 5 et a constaté que les filtres de sécurité bloquent un grand nombre de demandes inoffensives, allant des questions de physique médicale aux examens de sécurité de base. La carte système d'Anthropic a également révélé un throttling invisible qui dégrade les performances de Fable lorsque les utilisateurs essaient de construire des modèles de pointe concurrents, bien qu'Anthropic ait depuis atténué cela.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires