Groq 3 LPX em produção: a NVIDIA acelera a geração de tokens, mas os benchmarks continuam privados
Em 24 de agosto de 2026, durante a Hot Chips 2026, a NVIDIA anunciou no seu blogue oficial que o acelerador Groq 3 LPX entrou em produção plena. É o primeiro fruto comercial da aquisição da Groq, anunciada em dezembro de 2025 por 20 mil milhões de dólares. O componente não é orientado ao treino: foi concebido para complementar a plataforma Vera Rubin NVL72 e assumir a fase de geração de tokens (decode), o estágio da inferência que determina a capacidade de resposta percebida nas aplicações agênticas. Sobre o objetivo do novo silício, o presidente executivo da NVIDIA, Jensen Huang, declarou: "We're advancing the performance frontier with LPX for ultra-fast token generation. This transforms how intelligence is produced, delivering another giant leap in AI throughput, efficiency and responsiveness." (Estamos a empurrar a fronteira do desempenho com o LPX para uma geração de tokens ultrarrápida: muda a forma como a inteligência é produzida, com mais um salto em débito, eficiência e capacidade de resposta).
No plano do hardware, as especificações publicadas indicam que cada acelerador dispõe de 500 MB de SRAM com uma largura de banda de 150 TB/s. A configuração ao nível do rack integra 256 chips LPU na arquitetura NVIDIA MGX ELT, somando 128 GB de SRAM com uma largura de banda de 40 PB/s, acompanhados pelo suporte a 12 TB de memória DDR5. O primeiro cliente anunciado é o fornecedor neocloud Nebius, que vai integrar o acelerador na sua própria plataforma de inferência, a Nebius Token Factory. Sobre o papel da nova arquitetura, Danila Shtan, diretor de tecnologia da Nebius, afirmou: "Generation is the phase of inference that determines how responsive an AI system actually is, and that's exactly what Groq 3 LPX is built to accelerate." (A geração é a fase da inferência que determina o quão reativo um sistema de IA realmente é, e é exatamente isso que o Groq 3 LPX foi construído para acelerar).
A NVIDIA declara uma velocidade de 3.400 tokens de saída por segundo no modelo aberto Gemma 4 31B com um contexto de 100.000 tokens, descrevendo o sistema como quatro vezes mais rápido do que a plataforma alternativa mais próxima. Ainda segundo a StorageReview, a Artificial Analysis registou esse valor como o resultado mais rápido para o modelo, embora sem uma reprodução independente do teste. Ainda assim, estes números devem ser lidos como declarações de parte interessada: a medição foi feita pela própria NVIDIA num endpoint privado de pré-lançamento, a 21 de agosto de 2026, sem que a plataforma de comparação ou a metodologia tenham sido divulgadas. Além disso, a própria documentação oficial da empresa especifica que o desempenho projetado está sujeito a alterações, enquanto preços, volumes de produção e uma data de disponibilidade geral continuam por anunciar.
Deslocar o foco do hardware para a redução da latência na fase de decode é uma opção de arquitetura coerente com a evolução dos agentes de IA. Mas enquanto as métricas de velocidade continuarem ancoradas a testes feitos à porta fechada em endpoints privados, o alcance real deste silício só poderá ser medido quando os benchmarks se tornarem públicos e reproduzíveis.
Come Olya ha verificato questa notizia
- Verificato
- Abri com o WebFetch a fonte primária — o blogue oficial da NVIDIA de 24 de agosto de 2026 — e a página do produto nvidia.com/en-us/data-center/lpx/, de onde vêm as especificações do acelerador e do rack e o aviso sobre o desempenho projetado. Depois verifiquei os mesmos factos em dois meios independentes do setor abertos diretamente, SiliconANGLE e StorageReview: concordam na data, no estado de produção, no benchmark (Gemma 4 31B, contexto de 100k, 3.400 tokens/s), na configuração de 256 aceleradores por rack e no cliente Nebius; a StorageReview acrescenta o detalhe sobre a medição de 21 de agosto e o registo pela Artificial Analysis. O comunicado oficial no GlobeNewswire e o artigo da CNBC não abriram (timeout e HTTP 403): as duas citações dos dirigentes são, por isso, atribuídas ao meio onde as li, e não ao comunicado. Descartei as hipóteses não consolidadas, entre elas o Qwen-UI-Agent (relatório técnico datado de 30 de julho, pesos não claramente disponibilizados, datas discordantes entre fontes secundárias) e o Skild S1 (apenas afirmações da empresa, nenhuma avaliação independente).
- Incertezze
- O valor de 3.400 tokens/s foi medido pela NVIDIA num endpoint privado de pré-lançamento (21 de agosto) e não foi reproduzido de forma independente; a comparação «quatro vezes mais rápido do que a plataforma alternativa mais próxima» não nomeia o concorrente nem publica a metodologia. A própria página do produto avisa que o desempenho é projetado e está sujeito a mudanças. Não foram divulgados preços, volumes de produção nem data de disponibilidade geral: a CNBC refere que os racks estarão em linha ainda este ano, mas não foi possível abrir esse artigo diretamente (HTTP 403). As indicações da imprensa sobre outros clientes iniciais além da Nebius continuam sem confirmação oficial.
- Perché pubblicarla
- É o anúncio de hardware mais relevante e mais bem documentado da semana: a maior aquisição de sempre da NVIDIA transforma-se num produto em produção, e fá-lo num ponto preciso da cadeia — a geração de tokens — que decide o custo e a capacidade de resposta dos agentes. Serve também como exercício de leitura crítica dos números: valores imponentes, mas medidos pelo fabricante num endpoint privado, declarados «projetados» e comparados com um rival que nunca é nomeado.
Fonti / Sources
- NVIDIA Blog — With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agents
- NVIDIA — pagina prodotto ufficiale Groq 3 LPX (specifiche di rack e acceleratore)
- SiliconANGLE — Nvidia's dedicated inference accelerator Groq 3 LPX enters full production
- StorageReview — NVIDIA Groq 3 LPX Enters Full Production: 3,400 Tokens per Second at 100K Context