Tu codes avec l’IA ?
Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un lancement ambitieux pour OpenAI
Le 23 avril, OpenAI a dévoilé GPT-5.5, un modèle d'intelligence artificielle (IA) qui se distingue par sa capacité à exécuter des tâches de manière autonome. Ce modèle est présenté comme une nouvelle génération d'IA agentique, capable de planifier, d'utiliser des outils, de vérifier ses résultats et de mener à bien des tâches sans intervention humaine. Cette avancée marque un tournant dans la manière dont OpenAI envisage l'utilisation de l'IA pour des applications pratiques.
GPT-5.5 est le premier modèle à être réentraîné depuis la version GPT-4.5, en collaboration avec les systèmes rack-scale GB200 et GB300 NVL72 de NVIDIA. Cette coopération a permis de créer un modèle qui réduit la nécessité d'interventions humaines pour corriger le cours des tâches. Disponible pour les utilisateurs Plus, Pro, Business et Enterprise via ChatGPT et Codex, GPT-5.5 a également été intégré à l'API dès le 24 avril.
Des performances impressionnantes sur les benchmarks
OpenAI met en avant les performances de GPT-5.5 grâce à Terminal-Bench 2.0, un benchmark qui évalue la capacité des modèles à gérer des flux de travail en ligne de commande. GPT-5.5 a obtenu un score de 82,7%, surpassant GPT-5.4 qui avait atteint 75,1%, et Claude Opus 4.7 avec 69,4%.
En ce qui concerne SWE-Bench Pro, qui évalue la résolution de problèmes sur GitHub, GPT-5.5 a réalisé un score de 58,6%, démontrant sa capacité à résoudre plus de problèmes en une seule tentative par rapport aux versions antérieures. OpenAI a également introduit Expert-SWE, un benchmark interne où les tâches sont estimées à un temps de complétion humain médian de 20 heures. GPT-5.5 y a obtenu 73,1%, en hausse par rapport aux 68,5% de GPT-5.4.
Dans le domaine du raisonnement à long contexte, le benchmark MRCR v2, qui teste la capacité d'un modèle à retrouver des informations spécifiques dans un document volumineux, a vu GPT-5.5 obtenir 74,0%, contre 36,6% pour GPT-5.4.
Cependant, sur le benchmark MCP Atlas de Scale AI, qui évalue l'utilisation des protocoles de contexte, Claude Opus 4.7 reste en tête avec 79,1%. GPT-5.5 n'a pas encore de score enregistré sur ce test, ce qui n'empêche pas OpenAI de maintenir sa confiance dans les performances globales de son modèle.
Coût et efficacité des tokens
L'accès à l'API de GPT-5.5 est facturé à 5 USD par million de tokens d'entrée et 30 USD par million de tokens de sortie, soit le double des tarifs de GPT-5.4. OpenAI justifie ce coût par l'efficacité accrue de GPT-5.5, qui accomplit les mêmes tâches avec moins de tokens, rendant les coûts effectifs environ 20% plus élevés, une affirmation corroborée par le laboratoire indépendant Artificial Analysis.
La version Pro de GPT-5.5, destinée aux utilisateurs Pro, Business et Enterprise, est tarifée à 30 USD par million de tokens d'entrée et 180 USD par million de tokens de sortie. Ce modèle se distingue par sa capacité à effectuer des calculs supplémentaires en parallèle sur des problèmes complexes, se classant en tête sur BrowseComp, le benchmark de navigation web agentique d'OpenAI, avec un score de 90,1%.
Avant de s'engager dans un changement de modèle, il est conseillé de tester l'efficacité des tokens par rapport aux charges de travail réelles. À un volume de 10 millions de tokens de sortie par mois, GPT-5.5 coûte 300 USD contre 250 USD pour Claude Opus 4.7, une différence de 20% qui ne se justifie que si la performance agentique supérieure du modèle permet de réduire les itérations et les réessais.
Adoption et perspectives futures
OpenAI rapporte que plus de 85% de ses employés utilisent désormais Codex chaque semaine, notamment dans les départements d'ingénierie et de marketing. Par exemple, l'équipe de communication a exploité GPT-5.5 pour analyser six mois de données de demandes de prise de parole, permettant au modèle de créer un cadre d'évaluation et de risque pour automatiser les approbations à faible risque.
Greg Brockman, cofondateur d'OpenAI, a décrit cette avancée comme un « véritable pas en avant » vers le calcul du futur, tandis que Jakub Pachocki, scientifique en chef, a souligné que les progrès des modèles au cours des deux dernières années avaient semblé « étonnamment lents ».
OpenAI affirme que GPT-5.5 maintient la même latence par token que GPT-5.4 en production, tout en offrant un niveau d'intelligence supérieur. Les modèles plus grands et plus performants sont souvent plus lents, mais ce compromis a été évité ici.
La question de savoir si les scores de benchmark se traduisent par des gains en production pour les équipes utilisant de véritables pipelines agentiques reste ouverte et nécessitera quelques semaines d'observation. Le score élevé de Terminal-Bench est prometteur pour l'automatisation DevOps et les agents de terminal non surveillés, tandis que l'écart sur MCP Atlas doit être surveillé par ceux qui s'appuient fortement sur l'orchestration d'utilisation des outils.
