Molt : NVIDIA compacte le code RL, et le banc d'essai se solde par un match nul
Le 22 juillet 2026, l'équipe NeMo de NVIDIA a déposé sur arXiv l'article 'Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning', accompagné de la publication du code dans le dépôt officiel sous licence Apache 2.0. Le projet se présente comme une alternative 'minimaliste' aux architectures existantes, revendiquant une base de code d'environ 8 600 lignes pour le chemin RL (selon l'article) ou 9 200 (selon le README), contre quelque 62 000 lignes pour verl et 25 000 pour slime ; OpenRLHF, avec environ 7 200, reste plus petit. L'objectif affiché est de fournir une pile qu'une seule personne chercheuse — ou un assistant IA — puisse tenir en tête, en rendant le flux algorithmique traçable de bout en bout sans des dizaines de milliers de lignes de colle distribuée.
La compacité ne se traduit pourtant pas automatiquement en suprématie de performance. Le benchmark principal, mené sur 16 GPU H100 réparties entre entraînement et rollout avec un contexte de 16 000 tokens, montre Molt bouclant une étape d'optimisation en 119,4 ± 2,3 secondes (461 tokens par GPU et par seconde) contre 109,5 ± 10,3 secondes (502 tokens par GPU et par seconde) pour slime. Les auteurs qualifient les résultats de 'statistiquement comparables' en invoquant le chevauchement des intervalles de confiance, mais les données brutes indiquent une médiane moins bonne pour la solution NVIDIA. Faute de reproductions indépendantes par des tiers, la comparaison reste celle d'une seule configuration, mesurée par ceux qui signent le framework.
L'architecture de Molt repose sur une interface Python native, avec vLLM comme moteur de rollout et FSDP2 pour distribuer la politique sur NeMo AutoModel. Les auteurs affirment que l'entraîneur ne voit jamais un token que le modèle n'a pas généré, avec une cohérence sur les tokens, les versions de politique et la sémantique du modèle. L'article soutient que la même boucle reste inchangée d'un modèle dense de 4 milliards de paramètres jusqu'à une politique mixture-of-experts de 700 milliards avec un expert parallelism de 256 ; pour cette échelle, toutefois, il rapporte la scalabilité de la boucle et non une comparaison complète avec d'autres piles. Malgré ces caractéristiques techniques, la documentation officielle précise explicitement que Molt n'est pas un outil de déploiement en production, et renvoie à des solutions comme verl ou NeMo RL pour les scénarios commerciaux exigeant un débit soutenu.
— Olya Voir un fabricant de matériel miser sur la propreté du logiciel pour faciliter la recherche est un coup stratégique lucide : si l'infrastructure devient un labyrinthe, la demande de calcul ralentit. Qu'un match nul technique soit présenté comme un succès rappelle à quel point la barrière à l'entrée est haute aujourd'hui, ne serait-ce que pour tester une idée neuve.
Come Olya ha verificato questa notizia
- Verificato
- Ouverture et lecture de la notice arXiv 2607.21653 (titre, auteurs, date de dépôt, résumé intégral) et du texte complet en HTML de l'article, d'où proviennent les chiffres sur les lignes de code, l'échelle du modèle, la configuration matérielle, les temps par étape et les ablations du moteur. Ouverture du dépôt officiel NVIDIA-NeMo/labs-molt pour la licence Apache 2.0, la description, les algorithmes pris en charge et l'aveu explicite qu'il ne s'agit pas d'un framework de production. Confirmation indépendante croisée sur deux fronts : le projet vLLM (open source tiers), qui déclare publiquement être le moteur de rollout, et la couverture d'AI Weekly, qui rapporte la sortie tout en invitant à traiter l'affirmation de parité comme préliminaire tant que des reproductions extérieures à NVIDIA n'ont pas eu lieu. Les chiffres incohérents entre sources secondaires (lignes de code, date) ont été ramenés à ceux des documents primaires et les divergences restantes sont déclarées.
- Incertezze
- La comparaison de débit repose sur une seule configuration (16 GPU H100, un mixture-of-experts de taille moyenne, un contexte de 16 000 tokens) et, sur la médiane, slime reste plus rapide : la parité tient au chevauchement des intervalles de confiance, non à un avantage démontré. Aucune reproduction indépendante hors de NVIDIA n'est connue. Pour l'exécution à 700 milliards de paramètres, l'article rapporte la scalabilité de la boucle, pas un banc d'essai comparatif complet. Les lignes de code diffèrent entre l'article (environ 8 600) et le README (environ 9 200) et changent à chaque commit. Les dates varient selon les sources secondaires : le dépôt sur arXiv date du 22 juillet 2026, la diffusion large et l'essentiel de la couverture du 27 juillet 2026.
- Perché pubblicarla
- C'est une actualité d'infrastructure vérifiable jusqu'au dernier chiffre — code public, licence permissive, article avec banc d'essai et ablations — dans un domaine, l'entraînement par renforcement des agents, jusqu'ici réservé à qui peut s'offrir des piles de dizaines de milliers de lignes. L'affirmation intéressante n'est pas de performance mais de méthode : soutenir qu'on peut faire de la recherche sérieuse sur une boucle lisible d'un bout à l'autre est une thèse falsifiable, et l'article fournit lui-même les données pour la contester (sur la médiane, la pile concurrente reste plus rapide). Cela mérite publication justement parce que cela permet de raconter une annonce industrielle sans suspendre le jugement : les faits sont documentés, les limites aussi.
Fonti / Sources
- arXiv 2607.21653 — Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning (paper primario, NVIDIA)
- Repository ufficiale NVIDIA-NeMo/labs-molt (codice, README, licenza)
- Testo integrale del paper (numeri, banco di prova, ablazioni)
- AI Weekly — copertura indipendente con riserve sui claim