Nemotron 3.5 Lightning, 에이전트 효율을 겨냥한 '중간 계층'의 논리
2026년 8월 11일, NVIDIA는 자사 기술 블로그를 통해 Nemotron 3.5 Lightning의 공개를 알렸다. 전체 파라미터 300억, 토큰당 활성 파라미터 30억의 mixture-of-experts 모델이다. 공식 모델 카드는 Mamba-2와 MoE, 어텐션을 결합한 하이브리드 구조를 설명하며, 학습 데이터와 레시피와 함께 OpenMDW 1.1 라이선스로 배포된다고 밝힌다. 문서에 따르면 이 모델은 커스터마이징과 포스트 트레이닝을 우선 대상으로 하며, 프로덕션 배포에는 NVFP4 체크포인트를 권장한다. 이 대목에서 눈에 띄는 것은, NVIDIA가 BF16 기준으로 제시한 수치(MMLU Pro 81.94, SWE-bench Verified 51.56)가 독립 매체가 NVFP4 기준으로 전한 수치(81.62와 52.80)와 일치하지 않는다는 점이다. 프로덕션에서 권장하는 정밀도가 점수에 얼마나 영향을 주는지는 아직 알 수 없다.
성능과 관련해 회사는 비슷한 규모의 모델보다 최대 4배 빠른 생성 속도와 에이전트 벤치마크 PinchBench에서 약 86%의 정확도를 내세우며, Qwen3.6-35B와 대략 같은 정확도로 10,000개의 작업을 30% 더 빨리 끝냈다고 밝혔다. 다만 이 측정치가 모델이 돌아가는 하드웨어를 만드는 당사자에게서 곧바로 나왔다는 점, PinchBench 비교 대상이 NVIDIA가 고른 경쟁 모델 단 하나라는 점은 짚어야 한다. 현재까지 독립적인 검증은 확인되지 않으며, 블로그는 하드웨어 구성도 비교 조건도 밝히지 않아 실제 환경에서의 수치에는 불확실성이 남는다.
민감한 지점은 메모리다. 구조상으로는 최대 100만 토큰의 컨텍스트 길이를 지원하지만, 물리적 한계 탓에 H100 GPU 한 장에서는 사용 가능한 길이가 256K 토큰으로 줄어든다. 단일 카드 배포에는 80GB의 비디오 메모리가 필요하다. NVIDIA는 같은 시점에 NeMo Switchyard도 공개했다. 에이전트 워크플로의 각 단계를 가장 적합한 모델로 보내는 라우팅 라이브러리로, 복잡한 추론은 더 큰 모델에 맡기고 반복되는 수많은 단계는 Nemotron 같은 작고 빠른 모델로 넘기는 전략을 그대로 구현한 것이다.
NVIDIA의 이번 행보는 프런티어 모델에 대한 정면 도전이라기보다, 인프라 효율 자체를 파는 시도에 가까워 보인다. 기존 하드웨어에서 잘 도는 관대한 라이선스의 모델을 내놓는 것 — OpenMDW 1.1은 사용료 없이 상업적 이용을 허용하지만, Apache 2.0에 비하면 최근에 나왔고 검증이 덜 된 라이선스다. 동등하다고 여기기 전에 읽어봐야 한다 — 은 개발자를 그 회사가 파는 하드웨어에 묶어두는 영리한 방법이다. 속도 수치가 GPU를 파는 쪽의 측정에 머무는 한, 선언된 우위는 상업적 약속이지 검증된 결과가 아니다.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Hugging Face의 공식 모델 카드(nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16)를 열어 Mamba-2 + MoE + 어텐션 하이브리드 구조, 총 30B / 활성 3B, 최대 1M 컨텍스트와 H100 한 장에서의 실질 한계 256K, OpenMDW 1.1 라이선스, 2026년 8월 11일 공개일, 검증된 하드웨어, 지원 언어와 용도를 확인했다. NVIDIA 공식 기술 블로그에서는 8월 11일 공개, NVFP4와 BF16 체크포인트, 관대한 라이선스, 배포 채널(Hugging Face, ModelScope, build.nvidia.com), 최대 4배 속도 주장, PinchBench 86% 및 Qwen3.6-35B보다 30% 빠른 10,000개 작업 수치, NeMo Switchyard의 역할을 확인했다. 독립적인 교차 확인으로 MarkTechPost(8월 11일)가 같은 수치를 전하며 출처를 명시적으로 NVIDIA에 돌린 점, NIM API 레퍼런스 페이지가 모델 제공을 확인해 준 점을 확인했다. 배제한 것: Apple과 Alibaba 관련 보도(익명 소식통에 근거하고 두 회사 모두 공개 확인이 없음), MAI-Thinking-1 퍼블릭 프리뷰(모델은 이미 6월에 발표됐고 8월 발표는 제공 개시에 관한 것뿐), FLI 안전성 지수와 DeepMind의 조작 연구(각각 7월과 2026년 3~4월에 나온 것을 애그리게이터가 날짜를 바꿔 실은 것).
- Incertezze
- 속도와 정확도 수치는 모두 모델이 돌아가는 GPU를 파는 회사의 측정치다. PinchBench 결과나 4배라는 배수에 대한 독립 검증은 확인되지 않으며, 블로그는 '비슷한 규모의 모델'과 비교할 때의 측정 조건(배치, 정밀도, GPU)을 밝히지 않는다. PinchBench 비교는 NVIDIA가 고른 경쟁 모델 하나만을 대상으로 한다. 100만 토큰 창은 구조 차원의 선언이며 H100 한 장에서는 256K로 내려가므로, 광고된 값을 쓰려면 GPU가 여러 장 필요하다. OpenMDW 1.1 라이선스는 Apache 2.0에 비해 최근에 나왔고 검증이 덜 됐으니 동등하다고 가정하기 전에 읽어야 한다. 두 정밀도가 같은 수치를 내놓지 않는 만큼, 프로덕션에서 NVFP4를 쓰라는 공식 권고가 점수에 얼마나 영향을 주는지도 남은 질문이다.
- Perché pubblicarla
- 이번 주 가장 구체적인 오픈 공개이며, 에이전트를 실제로 쓰는 쪽에 중요한 지점으로 논의를 옮긴다. 지능의 정점이 아니라 반복 단계의 비용과 지연이다. 가중치와 데이터, 레시피를 상업용 라이선스로 내려받을 수 있고 GPU 한 장에 들어가는 하드웨어 요건을 갖췄다. 공개한 주체가 GPU 제조사 자신이고, 자체 벤치마크와 모델 선택을 조율하는 라우터가 함께 나왔다는 사실은 수치를 되풀이하기보다 꼼꼼히 읽어야 할 이유 그 자체다.