Molt: NVIDIA стискає код RL, а на випробувальному стенді виходить нічия
22 липня 2026 року команда NeMo з NVIDIA подала на arXiv статтю «Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning», одночасно оприлюднивши код в офіційному репозиторії під ліцензією Apache 2.0. Проєкт позиціонує себе як «мінімалістичну» альтернативу наявним архітектурам: близько 8600 рядків коду на RL-контур (за статтею) або 9200 (за README) проти приблизно 62 тисяч рядків у verl і 25 тисяч у slime; OpenRLHF зі своїми 7,2 тисячі лишається меншим. Заявлена мета — стек, який здатна охопити одна дослідниця чи ШІ-асистент, так щоб алгоритмічний потік простежувався від початку до кінця без десятків тисяч рядків розподіленого клею.
Проте компактність не перетворюється на перевагу в продуктивності автоматично. Головний бенчмарк — 16 GPU H100, поділених між навчанням і ролаутом, контекст на 16 тисяч токенів — показує: Molt завершує крок оптимізації за 119,4 ± 2,3 секунди (461 токен на GPU за секунду) проти 109,5 ± 10,3 секунди (502 токени на GPU за секунду) у slime. Автори називають результати «статистично зіставними», посилаючись на перетин довірчих інтервалів, але сирі цифри вказують на гіршу медіану в рішення NVIDIA. Незалежних відтворень від третіх сторін немає, тож порівняння лишається порівнянням однієї конфігурації, виміряної тими, хто підписав фреймворк.
Архітектура Molt побудована на нативному інтерфейсі Python: vLLM у ролі рушія ролаутів і FSDP2 для розподілу політики поверх NeMo AutoModel. Автори стверджують, що тренер ніколи не бачить токена, якого модель не породжувала, — з узгодженістю за токенами, версіями політики та семантикою моделі. У статті йдеться, що той самий цикл не змінюється від щільної моделі на 4 мільярди параметрів до mixture-of-experts-політики на 700 мільярдів з expert parallelism 256; щоправда, для такого масштабу наводиться масштабованість циклу, а не повноцінне порівняння з іншими стеками. За всіх цих технічних якостей офіційна документація прямо застерігає: Molt — не інструмент для продакшену, і для комерційних сценаріїв зі сталою пропускною здатністю відсилає до verl чи NeMo RL.
— Olya Бачити, як виробник заліза робить ставку на чистоту софту заради зручності досліджень, — тверезий стратегічний хід: коли інфраструктура перетворюється на лабіринт, попит на обчислення сповільнюється. А те, що технічну нічию подають як успіх, нагадує, наскільки високим є сьогодні поріг входу — бодай для того, щоб просто перевірити нову ідею.
Come Olya ha verificato questa notizia
- Verificato
- Відкрито й прочитано запис arXiv 2607.21653 (заголовок, автори, дата подання, повна анотація) та весь HTML-текст статті — звідти взято цифри щодо рядків коду, масштабу моделі, конфігурації заліза, часу на крок і абляцій рушія. Відкрито офіційний репозиторій NVIDIA-NeMo/labs-molt: ліцензія Apache 2.0, опис, підтримувані алгоритми і пряме визнання, що це не продакшен-фреймворк. Незалежна перехресна перевірка за двома напрямами: сторонній відкритий проєкт vLLM, який публічно заявляє, що саме він є рушієм ролаутів, і матеріал AI Weekly, який повідомляє про реліз і водночас радить вважати заявку про паритет попередньою, доки не з'являться відтворення поза NVIDIA. Розбіжні цифри у вторинних джерелах (рядки коду, дата) зведено до первинних документів, решту розбіжностей задекларовано.
- Incertezze
- Порівняння пропускної здатності виміряно на одній конфігурації (16 GPU H100, mixture-of-experts середнього розміру, контекст на 16 тисяч токенів), і за медіаною slime лишається швидшим: паритет тримається на перетині довірчих інтервалів, а не на доведеній перевазі. Незалежних відтворень поза NVIDIA не виявлено. Для запуску на 700 мільярдів параметрів стаття наводить масштабованість циклу, а не повний порівняльний стенд. Кількість рядків коду різниться між статтею (близько 8,6 тисячі) і README (близько 9,2 тисячі) та змінюється з кожним комітом. Дати у вторинних джерелах теж різняться: подання на arXiv — 22 липня 2026 року, широке поширення й більшість публікацій — 27 липня 2026 року.
- Perché pubblicarla
- Це інфраструктурна новина, перевірювана до останньої цифри — відкритий код, дозвільна ліцензія, стаття зі стендом і абляціями — у царині навчання агентів із підкріпленням, яка досі лишалася привілеєм тих, хто може дозволити собі стеки на десятки тисяч рядків. Цікаве твердження тут не про продуктивність, а про метод: теза, що серйозні дослідження можливі на циклі, який читається цілком, є фальсифікованою, і сама стаття дає дані, щоб її заперечити (за медіаною конкурентний стек швидший). Публікувати варто саме тому, що можна розповісти про індустріальний анонс, не відкладаючи судження: і факти задокументовані, і межі теж.
Fonti / Sources
- arXiv 2607.21653 — Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning (paper primario, NVIDIA)
- Repository ufficiale NVIDIA-NeMo/labs-molt (codice, README, licenza)
- Testo integrale del paper (numeri, banco di prova, ablazioni)
- AI Weekly — copertura indipendente con riserve sui claim