Brief IA

GPT-5.6 : la révolution de l'IA alliant puissance et rentabilité

🤖 Models & LLM·Tom Levy·

GPT-5.6 : la révolution de l'IA alliant puissance et rentabilité

GPT-5.6 : la révolution de l'IA alliant puissance et rentabilité
Key Takeaways
1GPT-5.6 Sol surpasse Claude Fable 5 en intelligence à un coût réduit de moitié, grâce à des optimisations architecturales.
2L'inférence de GPT-5.6 Sol améliore la distribution des requêtes et réduit les coûts de service de 20 %.
3Le harnais agentique de GPT-5.6 rationalise les tâches répétitives, optimisant l'utilisation des ressources.
💡Why it mattersGPT-5.6 redéfinit l'équilibre entre performance et coût, rendant l'IA avancée plus accessible et efficace pour les entreprises.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

L'évolution de GPT-5.6 : une avancée technologique majeure

La série de modèles GPT-5.6 a été conçue pour offrir un équilibre optimal entre la capacité de traitement et le coût d'exploitation, répondant ainsi aux divers besoins des utilisateurs. Le modèle phare, GPT-5.6 Sol, se distingue par sa capacité de raisonnement supérieure, surpassant Claude Fable 5 sur l'Artificial Analysis Coding Agent Index, tout en étant deux fois moins coûteux. En parallèle, le modèle Terra rivalise avec GPT-5.5 en termes de performances sur les benchmarks d'intelligence, mais à un prix réduit de moitié. Luna, quant à elle, est le modèle le plus rapide et le plus économique, coûtant 80 % de moins que Sol. Ces résultats sont le fruit d'optimisations significatives réalisées par nos équipes de recherche et développement à chaque niveau de notre architecture. Ces améliorations concernent non seulement les modèles eux-mêmes, mais aussi l'inférence, c'est-à-dire la manière dont nous exécutons les modèles pour générer des résultats, ainsi que notre harnais agentique, utilisé par Codex et ChatGPT Work.

Au cours des quatre dernières années, nous avons élargi notre base d'utilisateurs à un milliard d'utilisateurs actifs et plus de deux millions d'entreprises. Dans ce contexte, l'efficacité est devenue un enjeu central pour partager les bénéfices de l'intelligence artificielle avec le plus grand nombre. Notre mission est de garantir que l'intelligence artificielle générale profite à l'ensemble de l'humanité. Pour ce faire, nous avons continuellement travaillé à débloquer de nouvelles optimisations dans notre architecture, afin de proposer les modèles les plus performants à chaque point de la courbe coût-intelligence. Grâce à GPT-5.6, nous avons atteint notre plus grande efficacité en termes d'intelligence par jeton, en entraînant le modèle à réaliser plus de travail par jeton. Lors de l'entraînement, nous optimisons à la fois le succès des tâches et l'efficacité, façonnant le modèle pour qu'il emprunte un chemin plus direct à travers une tâche.

Cet article se penche au-delà de nos modèles pour expliquer comment nous avons conçu l'efficacité à travers des avancées dans deux autres parties majeures de l'architecture : l'inférence, en optimisant des processus tels que l'équilibrage de charge, le décodage spéculatif, le caching et l'optimisation des noyaux, afin d'obtenir plus de résultats à partir du même matériel, et notre harnais agentique, incluant une meilleure gestion de l'expansion du contexte, de l'utilisation des outils et du travail répété. Nous partagerons également le rôle de GPT-5.6 Sol dans l'atteinte de plusieurs de ces gains de manière autonome. Bien qu'une amélioration isolée puisse sembler limitée, ces gains s'accumulent pour nous permettre de livrer à la fois en intelligence et en efficacité.

Optimisation de l'inférence avec GPT-5.6 Sol

Dans un contexte où la capacité de calcul est limitée et où la demande pour des modèles plus performants croît rapidement, l'efficacité devient une priorité dans chaque conception de système. Cela est particulièrement vrai pour notre architecture d'inférence, qui exécute des modèles entraînés pour générer des réponses. Notre objectif principal est de traiter un plus grand nombre de jetons avec le même matériel, tout en préservant l'intelligence, la latence, la disponibilité et la fiabilité attendues par les utilisateurs.

Pour atteindre cet objectif, il est nécessaire d'optimiser l'ensemble du système. Un modèle peut être très efficace isolément, mais rester coûteux à servir si les requêtes sont mal distribuées, si le matériel reste inactif ou si le mouvement des données ralentit le calcul. Les améliorations à chaque couche s'accumulent, avec des gains provenant d'optimisations dans le routage (où les requêtes sont envoyées), la planification (quand les requêtes sont envoyées), les noyaux (logiciels qui s'exécutent sur des GPU), le caching (travail sauvegardé et réutilisé) et l'implémentation du modèle (l'ordre du code GPU). GPT-5.6 Sol dans Codex a joué un rôle instrumental dans toutes ces optimisations.

Un exemple clé est l'équilibrage de charge. À l'échelle mondiale, nous routons les requêtes en fonction de facteurs tels que la géographie, la capacité disponible et le type d'accélérateur (le type de GPU ou de puce spécialisée exécutant le modèle). Au sein d'un cluster, nous distribuons le travail entre les instances de modèle en fonction de la charge, de la longueur du contexte, de la disponibilité du cache et d'autres propriétés des requêtes. Au sein de chaque instance, le travail doit ensuite être partitionné efficacement entre les accélérateurs, les sous-réseaux du modèle et les cœurs de calcul. GPT-5.6 Sol dans Codex nous aide à analyser le trafic de production, à identifier des sources d'imprévu d'équilibre, à tester de nouvelles stratégies de routage et à ajuster constamment ces heuristiques. Ces améliorations d'équilibrage de charge à elles seules ont considérablement réduit le coût de service de nos modèles.

Nous avons également utilisé GPT-5.6 Sol pour optimiser le passage avant du modèle : le calcul qui transforme les entrées en prédictions du prochain jeton. Même lorsque les opérations individuelles sont rapides, un mouvement excessif de mémoire, la synchronisation et des dispositions de données inefficaces peuvent laisser les GPU inactifs. Pour éviter cela, GPT-5.6 Sol a trouvé du travail qui pouvait être pré-calculé, évité ou parallélisé. Avec Codex, GPT-5.6 Sol a réécrit et optimisé de manière autonome nos noyaux de production, le code central qui exécute les opérations mathématiques qui composent le modèle. Cela a fonctionné en partie parce que nous avons entraîné GPT-5.6 à être efficace pour écrire et améliorer des noyaux dans Triton et Gluon, deux langages de programmation GPU open-source maintenus par OpenAI. Ces efforts, combinés à des avancées plus larges des noyaux de GPT-5.6 Sol, ont réduit les coûts de service de bout en bout de 20 %. Nous avons également beaucoup investi dans des outils de vérification, tels que l'outil open-source FpSan (Floating-Point Sanitizer), pour aider à valider la correction des noyaux écrits par GPT-5.6 Sol.

Le décodage spéculatif est un autre levier pour améliorer la vitesse et l'efficacité. Cette technique consiste à exécuter un modèle de brouillon plus petit (ou "spéculateur") aux côtés du modèle principal, proposant plusieurs jetons pour que le modèle principal les vérifie en parallèle. Lorsque ces propositions sont acceptées, le système peut produire plusieurs jetons de sortie à partir d'un seul passage du modèle principal, réduisant ainsi la quantité de calcul séquentiel coûteux. GPT-5.6 Sol a amélioré son propre modèle de brouillon en concevant et en exécutant des centaines d'expériences sur son architecture, testant des changements de taille, de structure et de fonctionnalités. De plus, GPT-5.6 Sol a lancé et surveillé le processus d'entraînement du spéculateur, intervenant de manière autonome lorsque des problèmes sont survenus, y compris des pannes matérielles et des instabilités d'entraînement. Les améliorations résultantes ont augmenté l'efficacité de génération de jetons de plus de 15 %.

Lors du traitement de jetons d'entrée non mis en cache, le modèle construit le cache de clés-valeurs (KV) en un passage intensif en calcul ; lors de la génération de sortie, il lit et étend ce cache à plusieurs reprises. La configuration optimale pour le service, telle que le batching, le sharding et la gestion des KV, dépend fortement de la charge de travail — longueur de l'invite et de la sortie, taille du lot, taux de réussite du cache, caractéristiques de la requête, et plus encore. Cependant, l'espace de configuration était auparavant trop vaste pour être ajusté systématiquement, obligeant les ingénieurs à s'appuyer sur de larges heuristiques. Avec GPT-5.6 Sol dans Codex, nous avons pu analyser les charges de travail de production, générer et évaluer des configurations candidates, et hyper-optimiser la manière dont le moteur et le modèle sont configurés pour chaque scénario. Cela rend une nouvelle niveau d'optimisation spécifique à la charge de travail pratique, extrayant plus d'inférence utile du même matériel.

L'optimisation de l'inférence est une boucle de rétroaction continue. Nous mesurons le comportement de production, identifions les plus grands écarts, mettons en œuvre des changements et vérifions qu'ils améliorent l'ensemble du système plutôt qu'un benchmark isolé. GPT-5.6 Sol et Codex accélèrent chaque partie de cette boucle. Cela signifie que notre équipe peut explorer plus d'idées, répondre plus rapidement aux charges de travail changeantes et créer une architecture d'inférence avec une latence plus faible, plus de capacité et des coûts réduits pour les utilisateurs.

Rationalisation du travail avec le harnais agentique

ChatGPT Work et Codex accomplissent des tâches complexes à travers une série de requêtes de modèle et d'appels d'outils. En un seul tour — de la demande de l'utilisateur à la réponse finale — Codex peut inspecter le code source, rechercher l'historique de déploiement, lire des rapports d'incidents, éditer un fichier et exécuter des tests. Chaque étape peut nécessiter une requête.

Préparer le contexte, transmettre des données, exécuter l'inférence, appeler des outils et démarrer des processus prennent tous du temps et des ressources de calcul. Si une tâche nécessite 30 requêtes de modèle, une seconde supplémentaire par requête s'accumule. Améliorer la performance globale signifie réduire le travail répété dans tout le système, pas seulement rendre le modèle plus rapide.

Un tour utilisateur peut contenir de nombreuses itérations de modèle et d'outil. Tout coût à l'intérieur de la région répétée peut être payé plusieurs fois.

Ces multiplicateurs ont informé la conception de notre harnais agentique, qui est une couche d'orchestration en Rust connectant nos modèles, outils et l'environnement de l'utilisateur. Nous allons maintenant couvrir comment éviter l'expansion du contexte, charger des outils et réutiliser le travail rendent chaque requête plus efficace.

Maîtriser l'expansion du contexte

À mesure que les agents se voient accorder l'accès à plus d'outils, de compétences, de plugins et d'historique de conversation, les fenêtres de contexte peuvent facilement s'élargir. Cela augmente le coût, distrait le modèle et entraîne un raisonnement inutile. Le harnais peut réduire cette surcharge grâce à la découverte différée, qui rend les intégrations, les outils MCP personnalisés, les compétences et les plugins uniquement accessibles lorsque nécessaire. Le harnais empêche également les outils individuels et les intégrations MCP de consommer de manière inattendue la fenêtre de contexte. La sortie des outils est limitée à 10 000 jetons par défaut, sauf si le modèle demande une autre limite.

Optimisation du caching des invites

Comme mentionné précédemment, une boucle d'agent peut envoyer les mêmes instructions, l'historique de conversation, les définitions d'outils et les résultats antérieurs aux GPU plusieurs fois au cours d'un seul tour. Le traitement de ces entrées répétées est coûteux, donc le caching des invites réutilise le calcul associé à un préfixe d'invite précédemment traité. Pour préserver ce préfixe, le harnais traite tout l'historique visible par le modèle comme étant en ajout : de nouveaux messages, résultats d'outils et mises à jour d'environnement sont ajoutés à la fin plutôt qu'insérés dans le contexte antérieur. Les outils sont également présentés dans un ordre déterministe, tandis que les paramètres d'exécution, tels que les politiques d'approbation, sont appliqués pendant l'exécution plutôt que d'être intégrés dans les définitions d'outils. Ce choix de conception contribue aux taux élevés de réussite du cache des invites de Codex et de ChatGPT Work.

Transport incrémental

Le transport incrémental change ce qui traverse le réseau ; le caching des invites change ce que le modèle peut éviter de recalculer. Les largeurs sont conceptuelles, et la couche de compression supplémentaire n'est pas montrée.

Efficacité à travers la courbe d'intelligence

Les gains d'efficacité que nous avons réalisés avec GPT-5.6 sont le résultat d'années d'améliorations cumulées à travers l'architecture, couvrant...

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.