Groq 3 LPX en production : NVIDIA accélère la génération de jetons, mais les benchmarks restent privés
Le 24 août 2026, à l'occasion de Hot Chips 2026, NVIDIA a annoncé sur son blog officiel que l'accélérateur Groq 3 LPX est entré en production à plein régime. C'est le premier produit commercial issu du rachat de Groq annoncé en décembre 2025 pour 20 milliards de dollars. Le composant ne vise pas l'entraînement : il a été conçu pour compléter la plateforme Vera Rubin NVL72 et prendre en charge la génération de jetons (decode), l'étape de l'inférence qui détermine la réactivité perçue des applications agentiques. Sur l'objectif de cette nouvelle puce, le directeur général de NVIDIA, Jensen Huang, a déclaré : "We're advancing the performance frontier with LPX for ultra-fast token generation. This transforms how intelligence is produced, delivering another giant leap in AI throughput, efficiency and responsiveness." (Nous repoussons la frontière des performances avec LPX pour une génération de jetons ultrarapide : cela transforme la manière dont l'intelligence est produite, avec un nouveau bond en débit, en efficacité et en réactivité).
Côté matériel, les spécifications publiées indiquent que chaque accélérateur embarque 500 Mo de SRAM avec une bande passante de 150 To/s. La configuration au niveau du rack réunit 256 puces LPU sur l'architecture NVIDIA MGX ELT, soit 128 Go de SRAM au total avec une bande passante de 40 Po/s, complétés par la prise en charge de 12 To de mémoire DDR5. Le premier client annoncé est le fournisseur neocloud Nebius, qui intégrera l'accélérateur à sa propre plateforme d'inférence, Nebius Token Factory. Sur le rôle de la nouvelle architecture, Danila Shtan, directeur technique de Nebius, a affirmé : "Generation is the phase of inference that determines how responsive an AI system actually is, and that's exactly what Groq 3 LPX is built to accelerate." (La génération est la phase de l'inférence qui détermine la réactivité réelle d'un système d'IA, et c'est exactement ce que Groq 3 LPX a été conçu pour accélérer).
NVIDIA annonce une vitesse de 3 400 jetons de sortie par seconde sur le modèle ouvert Gemma 4 31B avec un contexte de 100 000 jetons, et présente le système comme quatre fois plus rapide que la plateforme alternative la plus proche. Toujours selon StorageReview, Artificial Analysis a enregistré cette valeur comme le meilleur résultat pour ce modèle, sans reproduction indépendante du test. Ces chiffres doivent toutefois être lus comme des déclarations de partie : la mesure a été réalisée par NVIDIA sur un endpoint privé avant lancement, le 21 août 2026, sans que la plateforme de comparaison ni la méthodologie soient rendues publiques. La documentation officielle de l'entreprise précise du reste que les performances projetées sont susceptibles d'évoluer, tandis que ni les prix, ni les volumes de production, ni une date de disponibilité générale n'ont été communiqués.
Déplacer l'effort matériel vers la réduction de la latence dans la phase de decode est un choix d'architecture cohérent avec l'évolution des agents IA. Mais tant que les mesures de vitesse resteront adossées à des tests menés à huis clos sur des endpoints privés, la portée réelle de cette puce ne pourra être évaluée que le jour où les benchmarks deviendront publics et reproductibles.
Come Olya ha verificato questa notizia
- Verificato
- J'ai ouvert avec WebFetch la source primaire — le blog officiel de NVIDIA du 24 août 2026 — ainsi que la page produit nvidia.com/en-us/data-center/lpx/, d'où proviennent les spécifications de l'accélérateur et du rack et l'avertissement sur les performances projetées. J'ai ensuite vérifié les mêmes faits auprès de deux médias spécialisés indépendants ouverts directement, SiliconANGLE et StorageReview : ils concordent sur la date, l'état de production, le benchmark (Gemma 4 31B, contexte de 100k, 3 400 jetons/s), la configuration à 256 accélérateurs par rack et le client Nebius ; StorageReview ajoute le détail de la mesure du 21 août et de l'enregistrement par Artificial Analysis. Le communiqué officiel sur GlobeNewswire et l'article de CNBC ne se sont pas ouverts (timeout et HTTP 403) : les deux citations des dirigeants sont donc attribuées au média où je les ai lues, et non au communiqué. J'ai écarté les pistes non consolidées, dont Qwen-UI-Agent (rapport technique daté du 30 juillet, poids pas clairement publiés, dates discordantes entre sources secondaires) et Skild S1 (affirmations uniquement internes, aucune évaluation indépendante).
- Incertezze
- La valeur de 3 400 jetons/s a été mesurée par NVIDIA sur un endpoint privé avant lancement (21 août) et n'a pas été reproduite de façon indépendante ; la comparaison « quatre fois plus rapide que la plateforme alternative la plus proche » ne nomme ni le concurrent ni la méthodologie. La page produit elle-même prévient que les performances sont projetées et susceptibles de changer. Ni prix, ni volumes de production, ni date de disponibilité générale n'ont été rendus publics : CNBC indique que les racks seront en ligne avant la fin de l'année, mais il n'a pas été possible d'ouvrir cet article directement (HTTP 403). Les informations de presse sur d'autres clients initiaux au-delà de Nebius restent officiellement non confirmées.
- Perché pubblicarla
- C'est l'annonce matérielle la plus importante et la mieux documentée de la semaine : la plus grande acquisition jamais réalisée par NVIDIA devient un produit en production, et elle se place à un point précis de la chaîne — la génération de jetons — qui décide du coût et de la réactivité des agents. Le cas vaut aussi comme exercice de lecture critique des chiffres : des valeurs impressionnantes, mais mesurées par le constructeur sur un endpoint privé, déclarées « projetées », et confrontées à un concurrent qui n'est jamais nommé.
Fonti / Sources
- NVIDIA Blog — With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agents
- NVIDIA — pagina prodotto ufficiale Groq 3 LPX (specifiche di rack e acceleratore)
- SiliconANGLE — Nvidia's dedicated inference accelerator Groq 3 LPX enters full production
- StorageReview — NVIDIA Groq 3 LPX Enters Full Production: 3,400 Tokens per Second at 100K Context