Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Claire Vo a confronté en direct plusieurs modèles, dont GPT-6 Astra, GPT-6 Sol et Claude Opus 5.5, sur un panel de tâches allant du mail au montage vidéo. Son classement personnel diverge de celui d’un juge LLM et met en avant des forces différentes selon les cas d’usage, avec des limites nettes sur la 3D et la créativité.
Un juge LLM conteste le verdict humain et la 3D révèle ses limites
Un juge automatisé n’a pas validé les classements établis par Claire Vo, valorisant des critères qu’elle dit ne pas avoir repérés. Elle a réutilisé Barbie Bench, un jeu de mode 3D, pour tester les capacités visuelles et la cohérence spatiale des modèles : les mains générées restent problématiques. Pour Claire Vo, ces résultats confirment que l’AGI n’est pas encore atteinte. Le programme détaille aussi les raisons du désaccord entre l’évaluation humaine et celle du juge LLM.
Astra préféré, Opus 5.5 solide sur agents et frontend B2B, Sol clair et abordable
Claire Vo indique avoir eu un faible pour GPT-6 Astra, tout en considérant qu’Opus 5.5 a dominé sa semaine de tests. Elle reste partagée sur GPT-6 Sol. Selon elle, Opus 5.5 pourrait être le plus performant globalement, notamment sur les agents de longue durée et le frontend B2B. Elle met en avant la clarté d’écriture de Sol, la lisibilité de ses PRDs et son prix. Les essais d’illustration SVG ont inversé sa prédiction initiale concernant Anthropic. Pour le montage vidéo, elle s’est dite déçue, attribuant en partie ce résultat aux compétences requises. Les résultats finaux ont été détaillés pour Astra, Sol et Opus 5.5, avec des remarques sur la clarté d’écriture et des surprises créatives, ainsi qu’une répartition des domaines où chaque modèle excelle selon elle.
Un protocole à l’aveugle, multi-tâches, réalisé en direct
Le test How I AI bench de Claire Vo s’est déroulé à l’aveugle : chaque sortie était notée sans révéler son auteur. Elle l’a mené en direct, le matin même où Anthropic et OpenAI lançaient de nouveaux modèles. Le protocole couvrait des tâches variées : emails, PRDs, prototypes frontend, backend, agents de longue durée, SVGs et montage vidéo. Des aspects comme les barrières, la personnalité et la vitesse des modèles ont été abordés. Des résultats ont été tirés pour la productivité personnelle, les prototypes frontend, les tâches backend et les agents sur la durée. Un test d’illustration SVG a été ajouté, et des prédictions ont été formulées avant la révélation des modèles derrière chaque production. GPT-6 Luna a été mentionné parmi les nouveautés discutées.






