Brief IA : GPT‑5.6 : agents plus performants, coûts réduits

GPT‑5.6 : agents plus performants, coûts réduits

Brief IA
Tom Levy·5 min·5 vues

GPT-5.6 Sol a amélioré son score sur ARC-AGI-3 de 13,3 % à 38,3 % tout en utilisant environ six fois moins de tokens de sortie grâce à des mécanismes de raisonnement conservé et de compaction. De plus, Luna atteint 98 % de la précision d'extraction de GPT-5.5 pour un coût d'un dix-huitième, et le cache des prompts a été prolongé à 30 minutes, permettant des gains significatifs en performance et en coût.

En bref
1Sur ARC‑AGI‑3, GPT‑5.6 Sol passe de 13,3 % à 38,3 % avec raisonnement conservé et compaction, en utilisant ~6× moins de tokens de sortie
2Luna revendique 98 % de la précision d’extraction de GPT‑5.5 pour un coût d’un dix‑huitième ; 78 % de réussite pour ~14 $ sur 106 tâches
3Le cache de prompts passe à 30 minutes minimum ; Ploy réduit l’entrée non mise en cache de 28 % sur un prompt de 29 000 tokens
💡Pourquoi c'est importantDes usages auparavant réservés à des modèles phares deviennent praticables à moindre coût via de nouveaux contrôles d’API et des modèles plus petits, selon OpenAI.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

OpenAI met en avant des gains chiffrés pour ses nouveaux modèles GPT‑5.6 et l’API associée, avec un cache prolongé, des mécanismes de raisonnement conservé et une orchestration multi‑agents native. Des retours clients citent des hausses de score, des baisses de latence et de tokens, tandis que Luna et Terra sont présentés comme des alternatives moins coûteuses aux précédents modèles phares.

ARC‑AGI‑3 et cache à 30 minutes affichent des gains

OpenAI indique qu’avec l’architecture standard, GPT‑5.6 Sol atteignait 13,3 % sur ARC‑AGI‑3, et qu’en activant le raisonnement conservé et la compaction, le score est monté à 38,3 %, avec environ six fois moins de tokens de sortie, sans modifier le modèle. En parallèle, la durée de vie du cache des prompts est portée à au moins 30 minutes et des points de rupture déterministes peuvent être placés dans la fenêtre de contexte, ce qui, selon l’éditeur, a relevé le taux de réussite du cache chez des startups. Chez Ploy, Lorenzo Gentile rapporte avoir ajouté des points de rupture et des clés spécifiques à l’espace de travail à un prompt partagé de 29 000 tokens, réduisant l’entrée non mise en cache de 28 %. La fenêtre de 30 minutes a permis de réutiliser le même contexte entre exécutions. OpenAI précise qu’une clé de cache appropriée augmente la probabilité de réutiliser le même moteur d’inférence pour un préfixe donné, ce qui réduit la latence.

GPT‑5.6 intègre raisonnement conservé, orchestration et outils

OpenAI affirme avoir entraîné GPT‑5.6 de bout en bout avec trois briques complémentaires : conserver le raisonnement d’un tour à l’autre et compacter nativement les longues conversations pour maintenir la cohérence ; orchestrer nativement plusieurs agents en parallèle ; et déplacer le travail déterministe dans du code via l’appel programmatique d’outils. Ce dernier sert à filtrer, agréger et orchestrer des sorties hors de la fenêtre de contexte, réservant les tokens au jugement et abaissant coût, latence et dégradation du contexte. L’éditeur distingue les tâches de jugement des opérations de mouvement, filtrage et combinaison de données ; par exemple, lors de la récupération de 100 dossiers, le modèle n’a pas à raisonner sur chaque intermédiaire si des outils peuvent être orchestrés en JavaScript, y compris avec des appels parallèles et un traitement hors contexte. Chez Rogo, Alex Wang rapporte que GPT‑5.6 avec cet appel programmatique a égalé la qualité de leur grille tout en consommant 21 % de tokens d’entrée en moins.

Luna et Terra approchent GPT‑5.5 pour bien moins cher

OpenAI explique que la stratégie historique consistant à privilégier le modèle phare au maximum de raisonnement tenait à sa maîtrise des contextes longs et de l’appel d’outils ; avec la famille 5.6, Luna et Terra, dopés en calcul au temps de test, sont présentés comme souvent proches de GPT‑5.4 et 5.5 tout en restant nettement moins chers. Chez Hypha, Serhii Shchoholiev évoque une conservation de 98 % de la précision d’extraction de GPT‑5.5 pour un coût d’un dix‑huitième, rendant l’analyse documentaire de qualité praticable dans de nombreux cas. Browser Use dit avoir soumis Luna à 106 tâches de navigation difficiles : 78 % de réussite pour environ 14 $, quand un modèle SOTA atteignait 80 % pour environ 235 $. PlayerZero a fait de Luna son modèle par défaut sur des charges de récupération de code et de modélisation de décisions ; sur une tâche clé d’exploration de code en système multi‑agents, l’équipe rapporte une baisse de 64 % des coûts d’inférence, un temps de réponse réduit de 90 % et un F1 en hausse de cinq points.

L’API active le multi‑agent ; ChatGPT exploite « ultra »

OpenAI décrit un schéma dans lequel un agent principal orchestre des sous‑agents qui travaillent en parallèle, puis agrège leurs résultats pour une synthèse finale. Cette orchestration multi‑agents peut être activée directement dans l’API de réponses et alimente aussi le paramètre de capacité « ultra » de ChatGPT. E Chi, fondateur de Quadrillion, indique que Qualia pilote des équipes d’agents sur des sujets de recherche ouverts et relève une amélioration marquée de GPT‑5.6 Sol face à GPT‑5.5, avec des achèvements plus rapides que presque tous les autres modèles testés ; GPT‑5.6 Sol est devenu leur modèle OpenAI de référence. Chez Obvious, Jon Bell rapporte avoir lancé six spécifications simultanées et qualifie GPT‑5.6 de meilleur orchestrateur vu chez OpenAI, sans dégradation de qualité constatée.

Des startups signalent des coûts en baisse avec moins d’effort

OpenAI situe GPT‑5.6 dans une continuité entamée avec GPT‑5 : traiter des tâches longues avec moins de tokens, pour des agents plus performants à moindre coût et sans bouleverser l’architecture. L’éditeur soutient que la précision progresse en réduisant l’effort de raisonnement, citant un examen final d’agents où GPT‑5.6 Sol, à effort faible, a dépassé GPT‑5.5 à effort élevé à architecture constante. Des équipes en production disent avoir abaissé leurs coûts en jouant ce paramètre ; chez Hex, Izzy Miller explique que cette configuration évite les fausses pistes, détecte l’absence de données et converge avec moins de tokens. OpenAI met en avant que des startups combinent désormais une sélection de modèles plus fine avec de nouveaux contrôles — continuité de raisonnement, multi‑agents natifs et appel d’outils programmatique — pour bâtir des agents plus rapides et plus capables à une fraction du coût. L’éditeur en déduit que l’économie de la construction d’agents a changé : des cas qui réclamaient jadis un modèle de pointe à chaque étape pourraient obtenir des résultats comparables, voire meilleurs, en s’appuyant sur des modèles plus petits, un réglage de l’effort de raisonnement et des choix architecturaux efficaces.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires