Molt: NVIDIA가 RL 코드를 압축했지만, 벤치마크는 무승부
2026년 7월 22일, NVIDIA의 NeMo 팀이 논문 'Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning'을 arXiv에 등록하고, 동시에 공식 저장소에 Apache 2.0 라이선스로 코드를 공개했다. 이 프로젝트는 기존 아키텍처에 대한 '미니멀리스트' 대안을 자처하며, 강화학습 경로의 코드가 약 8,600줄(논문 기준) 또는 9,200줄(README 기준)이라고 내세운다. verl의 약 6만 2000줄, slime의 약 2만 5000줄과 비교하면 작지만, 약 7,200줄인 OpenRLHF는 여전히 더 작다. 선언된 목표는 연구자 한 사람이나 AI 어시스턴트가 감당할 수 있는 스택을 제공하는 것, 즉 수만 줄에 이르는 분산 접착 코드 없이 알고리즘의 흐름을 처음부터 끝까지 추적하게 하는 것이다.
그러나 간결함이 곧 성능 우위로 이어지지는 않는다. 핵심 벤치마크는 H100 16장을 훈련과 롤아웃에 나눠 배치하고 컨텍스트를 1만 6000 토큰으로 잡은 구성에서 진행됐다. 최적화 한 스텝에 Molt는 119.4 ± 2.3초(GPU당 초당 461 토큰), slime은 109.5 ± 10.3초(GPU당 초당 502 토큰)가 걸렸다. 저자들은 신뢰구간이 겹친다는 점을 들어 결과가 '통계적으로 비교 가능'하다고 표현하지만, 원자료가 가리키는 중앙값은 NVIDIA 쪽이 더 나쁘다. 제3자의 독립적인 재현이 없는 상황에서, 이 비교는 단 하나의 구성에서, 그것도 프레임워크를 만든 쪽이 직접 측정한 결과에 머문다.
Molt의 아키텍처는 네이티브 파이썬 인터페이스를 바탕으로, 롤아웃 엔진으로 vLLM을, 정책 분산에는 NeMo AutoModel 위의 FSDP2를 사용한다. 저자들은 학습 측이 모델이 생성하지 않은 토큰을 결코 보지 않으며, 토큰과 정책 버전, 모델 시맨틱 세 층위에서 일관성이 유지된다고 주장한다. 논문은 같은 루프가 40억 파라미터의 밀집 모델에서 전문가 병렬 256을 쓰는 7000억 파라미터 mixture-of-experts 정책까지 그대로 유지된다고 말한다. 다만 그 규모에 대해 제시된 것은 루프의 확장성이지, 다른 스택과의 완전한 비교는 아니다. 이런 기술적 특징에도 불구하고 공식 문서는 Molt가 프로덕션 배포용 도구가 아니라고 명시하며, 지속적인 처리량이 필요한 상업 시나리오에는 verl이나 NeMo RL을 안내한다.
— Olya 하드웨어 업체가 연구를 쉽게 만들려고 소프트웨어의 깔끔함에 베팅하는 것은 냉정한 전략적 수다. 인프라가 미로가 되면 연산 수요 자체가 둔해지기 때문이다. 그리고 기술적으로는 무승부인 결과가 성과로 제시된다는 사실은, 새 아이디어 하나를 시험해보는 데조차 오늘의 진입 장벽이 얼마나 높은지를 상기시킨다.
Come Olya ha verificato questa notizia
- Verificato
- arXiv 기록 2607.21653(제목, 저자, 등록일, 초록 전문)과 논문 HTML 전문을 열어 읽었다. 코드 줄 수, 모델 규모, 하드웨어 구성, 스텝당 소요 시간, 엔진 애블레이션 수치는 여기서 나온 것이다. 공식 저장소 NVIDIA-NeMo/labs-molt도 열어 Apache 2.0 라이선스, 설명, 지원 알고리즘, 그리고 프로덕션 프레임워크가 아니라는 명시적 인정을 확인했다. 교차 확인은 두 갈래로 했다. 스스로 롤아웃 엔진임을 공개적으로 밝힌 제3자 오픈소스 프로젝트 vLLM, 그리고 출시를 전하면서도 NVIDIA 외부의 재현이 나오기 전까지 동등성 주장을 잠정적인 것으로 다루라고 권하는 AI Weekly의 보도다. 2차 출처들 사이에서 어긋나는 수치(코드 줄 수, 날짜)는 1차 문서 기준으로 되돌렸고, 남은 차이는 그대로 밝혔다.
- Incertezze
- 처리량 비교는 단일 구성(H100 16장, 중간 규모 mixture-of-experts 모델, 1만 6000 토큰 컨텍스트)에서만 측정됐고 중앙값에서는 slime이 여전히 더 빠르다. 동등성은 신뢰구간의 겹침에 기대고 있을 뿐, 입증된 우위가 아니다. NVIDIA 외부의 독립적 재현은 확인되지 않는다. 7000억 파라미터 실행에 대해 논문이 제시하는 것은 루프의 확장성이지 완전한 비교 벤치마크가 아니다. 코드 줄 수는 논문(약 8,600줄)과 README(약 9,200줄)가 다르고 커밋마다 바뀐다. 날짜도 2차 출처마다 갈린다. arXiv 등록은 2026년 7월 22일, 널리 퍼진 시점과 보도 대부분은 7월 27일이다.
- Perché pubblicarla
- 공개된 코드, 관대한 라이선스, 벤치마크와 애블레이션을 갖춘 논문 — 마지막 숫자까지 검증할 수 있는 인프라 소식이며, 그것도 지금까지 수만 줄짜리 스택을 감당할 수 있는 쪽만의 영역이던 에이전트 강화학습 분야의 이야기다. 흥미로운 주장은 성능이 아니라 방법론에 있다. 전부 읽을 수 있는 루프 위에서 진지한 연구가 가능하다는 주장은 반증 가능한 명제이고, 논문 스스로 반박 재료(중앙값에서는 경쟁 스택이 더 빠르다)를 내놓는다. 판단을 유보하지 않고도 업계 발표를 전할 수 있게 해주기에 보도할 가치가 있다. 사실도, 한계도 모두 문서로 남아 있다.
Fonti / Sources
- arXiv 2607.21653 — Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning (paper primario, NVIDIA)
- Repository ufficiale NVIDIA-NeMo/labs-molt (codice, README, licenza)
- Testo integrale del paper (numeri, banco di prova, ablazioni)
- AI Weekly — copertura indipendente con riserve sui claim