Brief IA : Groq 3 LPX de Nvidia : 3 400 t/s, comparaison avec Cerebras discutée

Groq 3 LPX de Nvidia : 3 400 t/s, comparaison avec Cerebras discutée

Brief IA
Tom Levy·3 min·3 vues

Nvidia a annoncé que son Groq 3 LPX atteint un débit de 3 400 tokens par seconde sur le modèle Gemma 4 31B, avec une production prévue cette année. Cependant, des experts soulignent que la comparaison avec Cerebras est biaisée, car Nvidia nécessite au moins 64 puces contre 1 à 2 pour Cerebras, ce qui influence les résultats des tests.

En bref
13 400 tokens/s mesurés sur un rack Groq 3 LPX avec Gemma 4 31B
2The Register relève qu’il faut au moins 64 puces côté Nvidia, contre 1 à 2 chez Cerebras
3Production annoncée et lancement prévu cette année, Nebius vise une offre cloud
💡Pourquoi c'est importantl’accélérateur arrive en production avec un débit de tokens élevé pour des usages agentiques, mais la comparaison de performances dépend du dimensionnement et du périmètre des tests.
Le brief IA que lisent les pros

L’IA qui transforme le business ?

Stratégies, mouvements et levées IA décryptés, chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Nvidia annonce la production de Groq 3 LPX et un record de 3 400 tokens par seconde sur Gemma 4 31B. Des spécialistes pointent toutefois des biais de comparaison avec Cerebras, liés au nombre de puces et au scénario de test. La puce s’insère dans la plateforme Vera Rubin, avec un lancement prévu plus tard cette année.

Le nombre de puces et le cas d’usage conditionnent la comparaison

Plusieurs éléments relativisent l’écart revendiqué avec Cerebras. The Register souligne que la comparaison omet le nombre de puces mises en œuvre, Cerebras ne mobilisant qu’une ou deux unités quand Nvidia en requiert au moins 64. The Register ajoute que la nouvelle génération CS-4 de Cerebras n’est pas prise en compte. D’après la même source, le test réalisé avec Gemma 4 31B représente un cas favorable, puisque le modèle dense peut être contenu dans un rack unique, et la façon dont l’architecture s’adapterait à des modèles mixture-of-experts de taille supérieure demeure inconnue. Par exemple, DeepSeek V3 demanderait 1 342 accélérateurs, ce qui correspond à un peu plus de cinq racks. The Register évoque également une architecture reposant sur des LPU dotés chacun de 500 Mo de mémoire, soit une capacité 576 fois inférieure à celle d’un GPU Rubin à 288 Go, avec une organisation par partitionnement Ethernet et une spécialisation des tâches : le pré-remplissage est effectué sur GPU et le décodage sur LPU. Groq repose sur un flux de données riche en SRAM. Des experts mettent en garde contre un biais de comparaison en faveur de Nvidia, lié notamment à la taille de l’installation mobilisée.

Des mesures élevées sur Gemma 4 31B et une revendication de x4

Artificial Analysis a observé une vitesse de 3 400 tokens par seconde sur un rack LPX utilisant le modèle open source Gemma 4 31B avec une fenêtre de contexte de 100 000 tokens, en traitant 50 requêtes consécutives. Les performances sont demeurées constantes pour des entrées comprises entre 10 000 et 100 000 tokens et ce résultat est présenté comme le meilleur obtenu pour ce modèle. Selon Nvidia, cela place Groq 3 LPX à un niveau quatre fois supérieur à la puce Cerebras, annoncée à 882 tokens par seconde. Ces chiffres s’inscrivent dans un faisceau de résultats indépendants jugés élevés pour la génération de tokens.

Produit, intégration à Rubin et calendrier de mise sur le marché

À Hot Chips 2026, Nvidia a indiqué que Groq 3 LPX est en production complète, après avoir officiellement démarré sa production à grande échelle. L’accélérateur, présenté comme dédié à l’inférence IA interactive, s’intègre à la plateforme Vera Rubin et vise la génération de tokens très rapide pour des systèmes agentiques. Nvidia prévoit un lancement plus tard cette année.

Contexte : rachat de licence, usages agentiques et premiers déploiements

Fin décembre, Nvidia a engagé environ 20 milliards de dollars pour acquérir la licence Groq et a intégré Jonathan Ross et Sunny Madra. Groq conçoit des processeurs axés sur l’inférence plutôt que sur l’entraînement. Dans les usages agentiques, la rapidité de génération de tokens compte car les agents traitent de très grands volumes au fil de centaines à des milliers d’étapes : une accélération permet davantage de raisonnements et d’appels d’outils dans un même délai perçu acceptable, avec des itérations, des vérifications de fichiers et des cycles écriture-test possibles plus nombreux. Selon Nvidia, ces avancées permettent d’exécuter certaines tâches de codage en « minutes au lieu d’heures ». Pour ce qui est de la disponibilité, Nebius annonce vouloir être le premier fournisseur de cloud à offrir la puce via sa Token Factory, alors que Groq fait déjà partie des premiers utilisateurs.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires