L’IA qui transforme le business ?
Stratégies, mouvements et levées IA décryptés, chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Nvidia annonce la production de Groq 3 LPX et un record de 3 400 tokens par seconde sur Gemma 4 31B. Des spécialistes pointent toutefois des biais de comparaison avec Cerebras, liés au nombre de puces et au scénario de test. La puce s’insère dans la plateforme Vera Rubin, avec un lancement prévu plus tard cette année.
Le nombre de puces et le cas d’usage conditionnent la comparaison
Plusieurs éléments relativisent l’écart revendiqué avec Cerebras. The Register souligne que la comparaison omet le nombre de puces mises en œuvre, Cerebras ne mobilisant qu’une ou deux unités quand Nvidia en requiert au moins 64. The Register ajoute que la nouvelle génération CS-4 de Cerebras n’est pas prise en compte. D’après la même source, le test réalisé avec Gemma 4 31B représente un cas favorable, puisque le modèle dense peut être contenu dans un rack unique, et la façon dont l’architecture s’adapterait à des modèles mixture-of-experts de taille supérieure demeure inconnue. Par exemple, DeepSeek V3 demanderait 1 342 accélérateurs, ce qui correspond à un peu plus de cinq racks. The Register évoque également une architecture reposant sur des LPU dotés chacun de 500 Mo de mémoire, soit une capacité 576 fois inférieure à celle d’un GPU Rubin à 288 Go, avec une organisation par partitionnement Ethernet et une spécialisation des tâches : le pré-remplissage est effectué sur GPU et le décodage sur LPU. Groq repose sur un flux de données riche en SRAM. Des experts mettent en garde contre un biais de comparaison en faveur de Nvidia, lié notamment à la taille de l’installation mobilisée.
Des mesures élevées sur Gemma 4 31B et une revendication de x4
Artificial Analysis a observé une vitesse de 3 400 tokens par seconde sur un rack LPX utilisant le modèle open source Gemma 4 31B avec une fenêtre de contexte de 100 000 tokens, en traitant 50 requêtes consécutives. Les performances sont demeurées constantes pour des entrées comprises entre 10 000 et 100 000 tokens et ce résultat est présenté comme le meilleur obtenu pour ce modèle. Selon Nvidia, cela place Groq 3 LPX à un niveau quatre fois supérieur à la puce Cerebras, annoncée à 882 tokens par seconde. Ces chiffres s’inscrivent dans un faisceau de résultats indépendants jugés élevés pour la génération de tokens.
Produit, intégration à Rubin et calendrier de mise sur le marché
À Hot Chips 2026, Nvidia a indiqué que Groq 3 LPX est en production complète, après avoir officiellement démarré sa production à grande échelle. L’accélérateur, présenté comme dédié à l’inférence IA interactive, s’intègre à la plateforme Vera Rubin et vise la génération de tokens très rapide pour des systèmes agentiques. Nvidia prévoit un lancement plus tard cette année.
Contexte : rachat de licence, usages agentiques et premiers déploiements
Fin décembre, Nvidia a engagé environ 20 milliards de dollars pour acquérir la licence Groq et a intégré Jonathan Ross et Sunny Madra. Groq conçoit des processeurs axés sur l’inférence plutôt que sur l’entraînement. Dans les usages agentiques, la rapidité de génération de tokens compte car les agents traitent de très grands volumes au fil de centaines à des milliers d’étapes : une accélération permet davantage de raisonnements et d’appels d’outils dans un même délai perçu acceptable, avec des itérations, des vérifications de fichiers et des cycles écriture-test possibles plus nombreux. Selon Nvidia, ces avancées permettent d’exécuter certaines tâches de codage en « minutes au lieu d’heures ». Pour ce qui est de la disponibilité, Nebius annonce vouloir être le premier fournisseur de cloud à offrir la puce via sa Token Factory, alors que Groq fait déjà partie des premiers utilisateurs.



