Brief IA : OpenAI : Jalapeño promet une latence réduite et un déploiement progressif

OpenAI : Jalapeño promet une latence réduite et un déploiement progressif

Brief IA
Tom Levy·2 min·0 vues

OpenAI prévoit Jalapeño en petites quantités d’ici la fin de l’année, avec une montée en 2027 Sur InferenceX, OpenAI revendique 1,5 à 1,9× par watt et 1,7 à 3,6× en latence Jalapeño est un ASIC d’inférence développé avec Broadcom, sans remplacement total du parc prévu.

En bref
1OpenAI prévoit Jalapeño en petites quantités d’ici la fin de l’année, avec une montée en 2027
2Sur InferenceX, OpenAI revendique 1,5 à 1,9× par watt et 1,7 à 3,6× en latence
3Jalapeño est un ASIC d’inférence développé avec Broadcom, sans remplacement total du parc prévu
💡Pourquoi c'est importantOpenAI annonce des gains d’efficacité et de latence sur des benchmarks, tout en préparant un déploiement limité et en conservant ses partenariats de calcul.
Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

OpenAI affirme que Jalapeño, sa puce d’inférence conçue avec Broadcom, surpasse des systèmes Nvidia en efficacité énergétique et en latence sur des tests InferenceX. La société prépare un lancement en petites quantités d’ici la fin de l’année, un volume accru en 2027, et dit ne pas vouloir remplacer tout son parc ni se passer de ses partenaires.

OpenAI prévoit un petit déploiement fin d’année, volume en 2027

OpenAI prévoit de mettre Jalapeño en service en petites quantités d’ici la fin de cette année, puis d’augmenter le volume en 2027, selon Richard Ho. La société n’indique pas combien de puces elle compte déployer l’an prochain. Malgré les gains annoncés, OpenAI ne s’attend pas à remplacer l’ensemble de sa gamme par Jalapeño et maintient une stratégie de calcul faisant appel à des partenaires, dont Nvidia. Richard Ho ajoute qu’OpenAI poursuivra le développement des deuxième et troisième générations de cette puce.

Tests InferenceX : 1,5 à 1,9× par watt, 1,7 à 3,6× en latence

Pour évaluer la puce, OpenAI a utilisé la plateforme InferenceX, comparant Jalapeño aux meilleurs résultats enregistrés à l’époque par des superchips Nvidia GB200 ou GB300. Selon OpenAI, Jalapeño a délivré 1,5 à 1,9 fois plus de travail d’IA par watt que ces systèmes sur GPT-OSS 120B, DeepSeek R1 et Kimi K2.5 1T, et une latence de bout en bout 1,7 à 3,6 fois plus faible. Richard Ho affirme que ces mesures se traduisent par des réponses plus rapides, des agents plus réactifs et un accès plus fiable. Il soutient que Jalapeño combine une faible latence et un haut débit, alors que, d’ordinaire, il faut arbitrer entre ces deux critères.

Jalapeño est un ASIC d’inférence conçu avec Broadcom

Introduite en juin, Jalapeño est un circuit intégré spécifique à une application conçu pour l’inférence. La puce a été développée en partenariat avec Broadcom. OpenAI déclare qu’elle exécute les tâches plus efficacement et répond plus vite que d’autres systèmes d’IA. L’entreprise a publié mardi un article de blog à ce sujet, et Richard Ho a détaillé ces éléments lors d’un briefing avec des journalistes.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires