OpenAI : Jalapeño plus rapide et économe pour l'inférence

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
OpenAI publie des résultats de tests pour Jalapeño, sa puce d’inférence maison. L’entreprise affirme des gains d’efficacité par watt et de latence sur plusieurs modèles open-weight et annonce un déploiement interne d’ici la fin de l’année, tout en maintenant l’usage d’accélérateurs tiers et en préparant déjà les générations suivantes.
Déploiement annoncé et feuille de route multi-générations
OpenAI envisage de lancer le déploiement de Jalapeño sur son infrastructure de calcul avant la fin de l’année. L’entreprise présente Jalapeño comme l’étape initiale d’une feuille de route couvrant plusieurs générations, la génération 2 étant déjà en phase avancée de développement et la génération 3 en cours de définition. Pour préparer ce lancement, OpenAI poursuit la validation pour la production, l’amélioration du logiciel, la mise en place pour une exploitation à grande échelle et l’évaluation des performances sur un plus grand nombre de modèles. OpenAI estime que répondre à la demande croissante en IA exigera plus de puissance de calcul de toutes les sources et prévoit de continuer à déployer largement des accélérateurs NVIDIA et d’autres partenaires pour l’entraînement et l’inférence.
Mesures rapportées : efficacité par watt et latence améliorées
OpenAI a évalué Jalapeño avec InferenceX, un benchmark public de SemiAnalysis qui couvre le traitement complet d’une requête d’IA, en le comparant à des systèmes commerciaux sur des régimes allant du haut débit à l’interactif à faible latence. L’entreprise met en avant une mesure centrée sur la quantité de travail utile réalisée par unité d’énergie, tout en respectant une contrainte de latence, ce qui s’avère particulièrement important pour les agents. Sur trois modèles publics testés, OpenAI indique que Jalapeño délivre entre 1,5 et 1,9 fois plus de travail par watt au débit maximal et affiche entre 1,7 et 3,6 fois moins de latence de bout en bout que les systèmes comparés, avec des performances de 2,1 à 4,1 fois supérieures dans les scénarios très interactifs. OpenAI fait également état d’un nombre accru de tokens par utilisateur et d’un débit supérieur par kilowatt, ce qui place Jalapeño sur la frontière de Pareto de la gamme testée. Les comparaisons ont été normalisées par la puissance nominale des accélérateurs ; Jalapeño est donné pour 700 watts, avec une puissance soutenue mesurée à 550 watts ou moins sur les charges testées. Sur Kimi K2.5 1T, OpenAI rapporte environ 1,5 fois plus de performance de pointe par watt et environ 3,4 fois moins de latence que le système de comparaison. OpenAI indique que ses tests internes sur ses propres modèles de pointe élargissent encore cet avantage et que l’architecture gagnerait en valeur avec des charges plus grandes et plus exigeantes.
Architecture orientée agents : données locales et réseau intégré
Jalapeño a été pensé pour répondre aux besoins des modèles de langage actuels et à venir, notamment pour les agents interactifs. OpenAI met en avant une co‑conception à l’échelle du rack qui englobe la puce, la mémoire, le réseau, le logiciel et le système, basée sur des charges de travail réelles. La phase de pré‑remplissage est qualifiée de très consommatrice en calcul, le décodage est limité par la bande passante mémoire, et la communication entre cœurs et puces est identifiée comme une source possible de latence. Jalapeño vise à réduire les mouvements de données et les délais de communication, en permettant de placer et conserver localement l’état du modèle, dont le cache KV, et en activant la combinaison adaptée de calcul, mémoire et réseau selon la phase d’inférence. Le réseau est intégré et dimensionné pour contenir la charge au sein d’un système connecté. OpenAI présente l’accélérateur comme équilibré et interchangeable, capable de soutenir des architectures de modèles changeantes, de bien performer en pré‑remplissage et en décodage, et de s’adapter à l’évolution de l’équilibre entre ces étapes.
Conception et programmation accélérées par l’IA
OpenAI attribue à ses modèles un rôle direct dans le développement de Jalapeño : des générations antérieures auraient aidé à la conception et à la mise en place, tandis que des modèles récents optimiseraient l’utilisation et la programmation. L’entreprise rapporte un passage de la conception initiale à la fabrication en neuf mois, en s’appuyant sur l’IA pour explorer des implémentations, raccourcir les boucles de conception, de mesure et de vérification, et optimiser des circuits arithmétiques. Jalapeño est présenté comme une cible de programmation claire et prévisible, avec description du travail via des tenseurs locaux, une communication explicite et une synchronisation prévisible, laissant à l’IA l’optimisation du mapping, du placement, de l’ordonnancement et de la coordination. OpenAI note toutefois que chaque nouvelle famille de modèles requiert des noyaux et optimisations dédiés. En utilisant Codex avec GPT‑Astra, l’équipe dit avoir porté trois modèles à poids ouverts, non prévus au plan initial, à un haut niveau de performance en deux mois, ce qui est donné comme une preuve de flexibilité et de vitesse de programmation. Sur certains blocs d’attention et de mélange d’experts de GPT‑OSS, OpenAI rapporte des implémentations générées par IA 1,5 à 1,8 fois plus rapides que celles écrites par des experts humains, en précisant que ces gains concernent des blocs sélectionnés et non le modèle entier.
Conséquences attendues pour coût et disponibilité
OpenAI affirme que générer davantage de travail utile avec une puissance et un matériel constants peut contribuer à satisfaire la demande et à diminuer le coût de production d’un résultat. L’entreprise considère que cela peut accroître l’effet de levier opérationnel en augmentant plus rapidement le travail utile et les revenus que le coût de service, tout en facilitant des cycles d’itération plus courts et l’émergence de nouveaux usages. OpenAI présente Jalapeño comme étendant les régimes d’inférence : un mode ultra‑rapide avec des efficacités auparavant limitées au mode rapide, un mode rapide avec des efficacités auparavant propres au mode par lots, et une efficacité accrue en mode par lots. OpenAI projette pour les clients des réponses plus rapides et des agents plus réactifs, ainsi qu’un accès plus fiable quand la demande augmente. L’entreprise décrit un avantage à plusieurs niveaux et qualifie Jalapeño de silicium de première partie avec des résultats mesurés, tout en visant des produits plus rapides, plus performants et plus efficaces, en lien avec sa mission déclarée autour de l’IA générale.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.