Groq 3 LPX 양산 돌입: NVIDIA는 토큰 생성을 가속하지만, 벤치마크는 비공개로 남았다
2026년 8월 24일, Hot Chips 2026에 맞춰 NVIDIA는 공식 블로그를 통해 가속기 Groq 3 LPX가 본격 양산에 들어갔다고 발표했다. 2025년 12월 200억 달러 규모로 발표된 Groq 인수에서 나온 첫 상용 결과물이다. 이 제품은 학습용이 아니다. Vera Rubin NVL72 플랫폼을 보완하면서 토큰 생성(디코드) 단계를 맡도록 설계됐는데, 이 단계는 에이전트형 애플리케이션에서 체감되는 반응성을 좌우하는 추론 구간이다. 새 실리콘의 목표에 대해 젠슨 황 NVIDIA 최고경영자는 이렇게 말했다. "We're advancing the performance frontier with LPX for ultra-fast token generation. This transforms how intelligence is produced, delivering another giant leap in AI throughput, efficiency and responsiveness." (LPX로 초고속 토큰 생성이라는 성능의 최전선을 밀어내고 있다. 지능이 만들어지는 방식 자체가 바뀌며, 처리량과 효율, 반응성에서 또 한 번의 도약이 온다는 뜻이다.)
하드웨어 측면에서 공개된 사양을 보면, 가속기 한 개당 500MB의 SRAM과 150TB/s의 대역폭을 갖췄다. 랙 단위 구성은 NVIDIA MGX ELT 아키텍처 위에 256개의 LPU 칩을 집적해 총 128GB의 SRAM과 40PB/s의 대역폭을 제공하며, 12TB의 DDR5 메모리를 함께 지원한다. 처음 발표된 고객은 네오클라우드 사업자 Nebius로, 자사 추론 플랫폼인 Nebius Token Factory에 이 가속기를 통합할 예정이다. 새 아키텍처의 역할에 대해 다닐라 슈탄 Nebius 최고기술책임자는 이렇게 밝혔다. "Generation is the phase of inference that determines how responsive an AI system actually is, and that's exactly what Groq 3 LPX is built to accelerate." (생성은 AI 시스템이 실제로 얼마나 반응성이 좋은지를 결정하는 추론 단계이며, Groq 3 LPX는 바로 그 지점을 가속하기 위해 만들어졌다는 뜻이다.)
NVIDIA는 오픈 모델 Gemma 4 31B에서 10만 토큰 컨텍스트 기준 초당 3,400 토큰의 출력 속도를 제시하며, 가장 근접한 대안 플랫폼보다 네 배 빠르다고 설명한다. StorageReview에 따르면 Artificial Analysis도 이 수치를 해당 모델의 최고 기록으로 등록했지만, 테스트가 독립적으로 재현된 것은 아니다. 다만 이 숫자들은 이해당사자의 주장으로 읽어야 한다. 측정은 2026년 8월 21일 NVIDIA가 출시 전 비공개 엔드포인트에서 직접 수행했고, 비교 대상 플랫폼도 방법론도 공개되지 않았다. 게다가 회사의 공식 문서 자체가 제시된 성능은 예상치이며 변경될 수 있다고 명시한다. 가격, 생산 물량, 일반 공급 시점은 아직 공개되지 않았다.
하드웨어의 초점을 디코드 단계의 지연 시간 축소로 옮긴 것은 AI 에이전트의 진화 방향과 맞아떨어지는 아키텍처 선택이다. 그러나 속도 지표가 비공개 엔드포인트에서 닫힌 문 뒤에 치러진 테스트에 매여 있는 한, 이 실리콘의 실제 파급력은 벤치마크가 공개되고 재현 가능해질 때에야 가늠할 수 있다.
Come Olya ha verificato questa notizia
- Verificato
- 1차 출처를 WebFetch로 직접 열었다. 2026년 8월 24일자 NVIDIA 공식 블로그와 제품 페이지 nvidia.com/en-us/data-center/lpx/이며, 가속기와 랙 사양, 예상 성능에 대한 경고 문구는 여기서 가져왔다. 이어 독립 전문 매체 두 곳(SiliconANGLE, StorageReview)을 직접 열어 같은 사실을 확인했다. 날짜, 양산 상태, 벤치마크(Gemma 4 31B, 10만 컨텍스트, 초당 3,400 토큰), 랙당 256 가속기 구성, 고객 Nebius까지 일치한다. StorageReview는 8월 21일 측정과 Artificial Analysis의 기록이라는 세부를 덧붙인다. GlobeNewswire의 공식 보도자료와 CNBC 기사는 열리지 않았다(타임아웃, HTTP 403). 그래서 두 경영진 발언은 보도자료가 아니라 내가 실제로 읽은 매체에 귀속시켰다. 확정되지 않은 후보들은 제외했다. Qwen-UI-Agent(기술 보고서는 7월 30일자, 가중치 공개가 불분명, 2차 출처 간 날짜 불일치)와 Skild S1(회사 주장뿐이고 독립 평가 없음)이다.
- Incertezze
- 초당 3,400 토큰이라는 수치는 NVIDIA가 출시 전 비공개 엔드포인트에서 측정했으며(8월 21일) 독립적으로 재현되지 않았다. '가장 근접한 대안 플랫폼보다 네 배 빠르다'는 비교는 경쟁 제품 이름도, 방법론도 밝히지 않는다. 제품 페이지 자체가 성능은 예상치이며 변경될 수 있다고 경고한다. 가격, 생산 물량, 일반 공급 시점은 모두 미공개다. CNBC는 랙이 연내 가동될 것이라고 전하지만, 그 기사는 직접 열 수 없었다(HTTP 403). Nebius 외 초기 고객에 관한 언론 보도는 공식 확인되지 않았다.
- Perché pubblicarla
- 이번 주 가장 중요하고 근거가 가장 잘 갖춰진 하드웨어 발표다. NVIDIA 역사상 최대 규모의 인수가 양산 제품으로 바뀌었고, 그것도 에이전트의 비용과 반응성을 결정하는 사슬의 한 지점, 즉 토큰 생성에 자리를 잡았다. 동시에 숫자를 비판적으로 읽는 연습으로도 유용하다. 압도적인 수치이지만 제조사가 비공개 엔드포인트에서 직접 측정했고, '예상치'라고 명시돼 있으며, 비교 상대의 이름은 끝내 나오지 않는다.
Fonti / Sources
- NVIDIA Blog — With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agents
- NVIDIA — pagina prodotto ufficiale Groq 3 LPX (specifiche di rack e acceleratore)
- SiliconANGLE — Nvidia's dedicated inference accelerator Groq 3 LPX enters full production
- StorageReview — NVIDIA Groq 3 LPX Enters Full Production: 3,400 Tokens per Second at 100K Context