Brief IA : Blind test : Astra séduit, Opus 5.5 domine certaines tâches

Blind test : Astra séduit, Opus 5.5 domine certaines tâches

Brief IA
Tom Levy·3 min·6 vues

Claire Vo a évalué à l'aveugle GPT-6 Astra, GPT-6 Sol et Claude Opus 5.5 sur diverses tâches, favorisant Astra pour son approche personnelle. Cependant, Opus 5.5 s'est distingué sur les agents de longue durée et le frontend B2B, tandis qu'un juge LLM a contesté ses classements, soulignant des limites dans les capacités visuelles des modèles, notamment sur la 3D.

En bref
1Claire Vo a évalué à l’aveugle GPT-6 Astra, GPT-6 Sol et Claude Opus 5.5 sur des tâches variées
2Son appréciation personnelle favorise Astra, mais Opus 5.5 s’est distingué sur les agents de longue durée et le frontend B2B
3Un juge LLM a contesté ses classements et Barbie Bench a mis en évidence les limites actuelles, notamment sur la 3D
💡Pourquoi c'est importantCe test illustre la diversité des critères d’évaluation des modèles d’IA et les écarts entre jugement humain et automatisé.
Le brief IA que lisent les pros

Tu veux les meilleurs outils IA avant les autres ?

On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Claire Vo a confronté en direct plusieurs modèles, dont GPT-6 Astra, GPT-6 Sol et Claude Opus 5.5, sur un panel de tâches allant du mail au montage vidéo. Son classement personnel diverge de celui d’un juge LLM et met en avant des forces différentes selon les cas d’usage, avec des limites nettes sur la 3D et la créativité.

Un juge LLM conteste le verdict humain et la 3D révèle ses limites

Un juge automatisé n’a pas validé les classements établis par Claire Vo, valorisant des critères qu’elle dit ne pas avoir repérés. Elle a réutilisé Barbie Bench, un jeu de mode 3D, pour tester les capacités visuelles et la cohérence spatiale des modèles : les mains générées restent problématiques. Pour Claire Vo, ces résultats confirment que l’AGI n’est pas encore atteinte. Le programme détaille aussi les raisons du désaccord entre l’évaluation humaine et celle du juge LLM.

Astra préféré, Opus 5.5 solide sur agents et frontend B2B, Sol clair et abordable

Claire Vo indique avoir eu un faible pour GPT-6 Astra, tout en considérant qu’Opus 5.5 a dominé sa semaine de tests. Elle reste partagée sur GPT-6 Sol. Selon elle, Opus 5.5 pourrait être le plus performant globalement, notamment sur les agents de longue durée et le frontend B2B. Elle met en avant la clarté d’écriture de Sol, la lisibilité de ses PRDs et son prix. Les essais d’illustration SVG ont inversé sa prédiction initiale concernant Anthropic. Pour le montage vidéo, elle s’est dite déçue, attribuant en partie ce résultat aux compétences requises. Les résultats finaux ont été détaillés pour Astra, Sol et Opus 5.5, avec des remarques sur la clarté d’écriture et des surprises créatives, ainsi qu’une répartition des domaines où chaque modèle excelle selon elle.

Un protocole à l’aveugle, multi-tâches, réalisé en direct

Le test How I AI bench de Claire Vo s’est déroulé à l’aveugle : chaque sortie était notée sans révéler son auteur. Elle l’a mené en direct, le matin même où Anthropic et OpenAI lançaient de nouveaux modèles. Le protocole couvrait des tâches variées : emails, PRDs, prototypes frontend, backend, agents de longue durée, SVGs et montage vidéo. Des aspects comme les barrières, la personnalité et la vitesse des modèles ont été abordés. Des résultats ont été tirés pour la productivité personnelle, les prototypes frontend, les tâches backend et les agents sur la durée. Un test d’illustration SVG a été ajouté, et des prédictions ont été formulées avant la révélation des modèles derrière chaque production. GPT-6 Luna a été mentionné parmi les nouveautés discutées.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires