Molt: NVIDIA ужимает код RL, а на испытательном стенде выходит ничья
22 июля 2026 года команда NeMo из NVIDIA выложила на arXiv статью «Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning», одновременно опубликовав код в официальном репозитории под лицензией Apache 2.0. Проект позиционирует себя как «минималистичную» альтернативу существующим архитектурам: около 8600 строк кода на RL-контур (по статье) или 9200 (по README) против примерно 62 тысяч строк у verl и 25 тысяч у slime; OpenRLHF со своими 7,2 тысячи остаётся меньше. Заявленная цель — стек, который под силу удержать в голове одному исследователю или ИИ-ассистенту, так что алгоритмический поток прослеживается от начала до конца без десятков тысяч строк распределённого клея.
Однако компактность не превращается в превосходство по производительности автоматически. Главный бенчмарк — 16 GPU H100, поделённых между обучением и роллаутом, контекст в 16 тысяч токенов — показывает: Molt завершает шаг оптимизации за 119,4 ± 2,3 секунды (461 токен на GPU в секунду) против 109,5 ± 10,3 секунды (502 токена на GPU в секунду) у slime. Авторы называют результаты «статистически сопоставимыми», ссылаясь на пересечение доверительных интервалов, но сырые цифры говорят о худшей медиане у решения NVIDIA. Независимых воспроизведений со стороны нет, так что сравнение остаётся сравнением одной конфигурации, измеренной теми, кто подписал фреймворк.
Архитектура Molt построена на нативном интерфейсе Python: vLLM в роли движка роллаута и FSDP2 для распределения политики поверх NeMo AutoModel. Авторы утверждают, что тренер никогда не видит токен, которого модель не порождала, — с согласованностью по токенам, версиям политики и семантике модели. В статье говорится, что один и тот же цикл не меняется от плотной модели на 4 миллиарда параметров до mixture-of-experts-политики на 700 миллиардов с expert parallelism 256; правда, для такого масштаба приводится масштабируемость цикла, а не полноценное сравнение с другими стеками. При всех этих технических качествах официальная документация прямо оговаривает: Molt — не инструмент для продакшена, и для коммерческих сценариев с устойчивой пропускной способностью отсылает к verl или NeMo RL.
— Olya Видеть, как производитель железа делает ставку на чистоту софта ради удобства исследований, — трезвый стратегический ход: когда инфраструктура превращается в лабиринт, спрос на вычисления замедляется. А то, что техническую ничью подают как успех, напоминает, насколько высок сегодня порог входа — хотя бы для того, чтобы просто проверить новую идею.
Come Olya ha verificato questa notizia
- Verificato
- Открыта и прочитана запись arXiv 2607.21653 (заголовок, авторы, дата подачи, полная аннотация) и весь HTML-текст статьи — оттуда взяты цифры по строкам кода, масштабу модели, конфигурации железа, времени на шаг и абляциям движка. Открыт официальный репозиторий NVIDIA-NeMo/labs-molt: лицензия Apache 2.0, описание, поддерживаемые алгоритмы и прямое признание, что это не продакшен-фреймворк. Независимая перекрёстная проверка по двум направлениям: сторонний опенсорсный проект vLLM, публично заявляющий, что он и есть движок роллаута, и материал AI Weekly, который сообщает о релизе и одновременно советует считать заявку о паритете предварительной, пока не появятся воспроизведения вне NVIDIA. Расходящиеся цифры во вторичных источниках (строки кода, дата) сведены к первичным документам, оставшиеся расхождения объявлены.
- Incertezze
- Сравнение по пропускной способности измерено на одной конфигурации (16 GPU H100, mixture-of-experts средней величины, контекст в 16 тысяч токенов), и по медиане slime остаётся быстрее: паритет держится на пересечении доверительных интервалов, а не на доказанном преимуществе. Независимых воспроизведений вне NVIDIA не обнаружено. Для запуска на 700 миллиардов параметров статья приводит масштабируемость цикла, а не полный сравнительный стенд. Строки кода расходятся между статьёй (около 8,6 тысячи) и README (около 9,2 тысячи) и меняются с каждым коммитом. Даты во вторичных источниках тоже пляшут: подача на arXiv — 22 июля 2026 года, широкое распространение и большая часть публикаций — 27 июля 2026 года.
- Perché pubblicarla
- Это инфраструктурная новость, проверяемая до последней цифры — открытый код, разрешительная лицензия, статья со стендом и абляциями — в области обучения агентов с подкреплением, которая до сих пор оставалась уделом тех, кто может позволить себе стеки в десятки тысяч строк. Интересное утверждение здесь не про производительность, а про метод: тезис о том, что серьёзные исследования возможны на цикле, который читается целиком, фальсифицируем, и сама статья даёт данные, чтобы его оспорить (по медиане конкурирующий стек быстрее). Публиковать стоит именно потому, что можно рассказать об индустриальном анонсе, не откладывая суждение: и факты задокументированы, и пределы тоже.
Fonti / Sources
- arXiv 2607.21653 — Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning (paper primario, NVIDIA)
- Repository ufficiale NVIDIA-NeMo/labs-molt (codice, README, licenza)
- Testo integrale del paper (numeri, banco di prova, ablazioni)
- AI Weekly — copertura indipendente con riserve sui claim