Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI GPT-5.6 Sol freiné par des restrictions américaines
La nouvelle génération de modèles GPT-5.6 d'OpenAI comprend le modèle phare Sol ainsi que deux niveaux moins chers, Terra et Luna.
Sol égalise ou surpasse le Claude Mythos 5 d'Anthropic dans plusieurs benchmarks, avec un avantage clair en codage agentique et une meilleure efficacité des tokens en cybersécurité. Actuellement, l'accès est restreint à quelques partenaires sélectionnés, ce que OpenAI considère comme nuisible pour les développeurs et les entreprises.
OpenAI a dévoilé GPT-5.6 Sol, une nouvelle génération de modèles conçue pour rivaliser avec la classe Mythos de Claude. L'aperçu limité est uniquement accessible à des partenaires choisis via l'API et Codex, sous la direction explicite du gouvernement américain. Ce dernier avait auparavant retiré le modèle Fable 5 de la classe Mythos d'Anthropic du marché.
OpenAI exprime clairement sa frustration : "Nous ne croyons pas que ce type de processus d'accès gouvernemental devrait devenir la norme à long terme. Cela prive les utilisateurs, développeurs, entreprises, défenseurs cybernétiques et partenaires mondiaux des meilleurs outils dont ils ont besoin."
GPT-5.6 introduit également un nouveau schéma de nommage en couches qui ressemble beaucoup à celui de Claude. Le numéro (x.6) indique la génération, tandis que Sol, Terra et Luna sont des niveaux de performance permanents qui peuvent évoluer indépendamment. Sol est le modèle phare. Terra égalise le GPT-5.5 à moitié prix. Luna est l'option économique. De plus, il existe un mode "max" pour un raisonnement plus approfondi et un mode "ultra" qui répartit les tâches complexes entre des sous-agents fonctionnant en parallèle.
Sol devance Claude Mythos en codage agentique
Les chiffres de benchmark d'OpenAI placent Sol en tête du Claude Mythos 5 d'Anthropic en matière de codage agentique. Sur le Terminal-Bench 2.1, Sol obtient un score de 88,8 %. Sol Ultra atteint 91,9 %, tandis que Claude Mythos 5 se situe à 88 % et Fable 5 à 84,3 %.
GPT-5.6 Sol Ultra domine le benchmark de codage Terminal-Bench 2.1 avec 91,9 %. Claude Mythos 5 obtient 88,0 %. Le Google Gemini 3.1 Pro Preview est en queue de peloton avec 70,7 %.
Sol montre également des progrès en biologie. Sur GeneBench v1, un benchmark pour la génomique et la biologie quantitative, il surpasse le GPT-5.5 (30 % contre 22 % dans le meilleur des cas) tout en utilisant moins de tokens.
Sur ExploitBench, qui teste la capacité des agents IA à trouver et exploiter de réelles failles de sécurité dans le moteur JavaScript V8 de Google jusqu'à l'exécution complète du code, Sol égalise la performance de Mythos Preview tout en utilisant environ un tiers des tokens de sortie, selon OpenAI.
Sur ExploitGym, un benchmark développé par des chercheurs de l'UC Berkeley avec OpenAI et d'autres laboratoires, les trois modèles GPT-5.6 s'améliorent à mesure que l'effort de raisonnement augmente, ce qui indique un potentiel d'évolutivité avec plus de puissance de calcul. Les chiffres de Claude pour ce benchmark ne sont pas encore disponibles.
OpenAI qualifie Sol de son modèle de cybersécurité le plus performant à ce jour, mais le présente comme un défenseur, et non un attaquant. Le modèle est meilleur pour repérer et corriger les failles que pour mener des attaques complètes de bout en bout de manière autonome, selon l'entreprise. Mythos a réussi cela dans un autre benchmark.
Dans des tests avec Chromium et Firefox, Sol a trouvé des bugs et des primitives d'exploitation, mais n'a jamais produit d'exploitation autonome complète. OpenAI indique que GPT-5.6 Sol est toujours en dessous du seuil "Cyber Critical" dans son cadre de préparation.
Tarification, disponibilité et lancement de Cerebras en juillet
Pour un million de tokens, OpenAI facture 5 $ pour l'entrée et 30 $ pour la sortie de Sol, 2,50 $ et 15 $ pour Terra, et 1 $ et 6 $ pour Luna. L'entreprise a également révisé son système de mise en cache des prompts avec des points de rupture de cache explicites et une durée de vie minimale garantie de 30 minutes. Les écritures dans le cache coûtent 1,25 fois le prix d'entrée normal. Les lectures dans le cache bénéficient toujours d'une remise de 90 %.
Étant donné que Sol utilise moins de tokens pour égaler ou surpasser ses concurrents dans plusieurs benchmarks, le coût effectif par tâche pourrait se révéler inférieur à celui des générations précédentes. Cela contrecarrerait la tendance à la hausse des prix des modèles d'IA à chaque nouvelle version, une critique fréquente ces derniers temps, et constituerait un point faible concurrentiel face aux modèles chinois moins chers.
En juillet, Sol devrait être opérationnel sur Cerebras à une vitesse allant jusqu'à 750 tokens par seconde.






