Nemotron 3.5 Lightning en de logica van de «tussenlaag» voor agentische efficiëntie
Op 11 augustus 2026 kondigde NVIDIA op zijn technische blog de release aan van Nemotron 3.5 Lightning, een mixture-of-experts-model met 30 miljard parameters in totaal en 3 miljard actief per token. De officiële model card beschrijft een hybride architectuur die Mamba-2, MoE en attention combineert, verspreid onder de OpenMDW 1.1-licentie samen met trainingsdata en -recepten. Volgens de documentatie is het model in de eerste plaats bedoeld voor maatwerk en post-training, waarbij NVIDIA het NVFP4-checkpoint aanraadt voor productie. Juist daar valt op dat de cijfers die NVIDIA voor BF16 noemt (MMLU Pro 81,94; SWE-bench Verified 51,56) niet overeenkomen met wat onafhankelijke berichtgeving voor NVFP4 meldt (81,62 en 52,80): hoe zwaar de voor productie aanbevolen precisie op de scores drukt, blijft onduidelijk.
Wat de prestaties betreft claimt het bedrijf een generatiesnelheid tot vier keer hoger dan bij modellen van vergelijkbare omvang en een nauwkeurigheid van ongeveer 86% op de agentische benchmark PinchBench, met 10.000 taken die 30% sneller worden afgerond dan bij Qwen3.6-35B, bij ruwweg dezelfde nauwkeurigheid. Daarbij hoort de kanttekening dat deze metingen rechtstreeks komen van de maker van de hardware waarop het model draait, en dat de vergelijking op PinchBench maar één concurrerend model betreft, gekozen door NVIDIA: onafhankelijke verificatie is er tot nu toe niet, en de blog vermeldt noch de hardwareopstelling noch de parameters van de vergelijking. Dat laat ruimte voor twijfel over de werkelijke cijfers in de praktijk.
Een gevoelig punt is het geheugen: de architectuur ondersteunt in theorie een contextlengte tot 1 miljoen tokens, maar op één H100-GPU zakt de beschikbaarheid door fysieke grenzen naar 256K tokens. Voor deployment op één kaart is 80 GB videogeheugen nodig. Tegelijk bracht NVIDIA NeMo Switchyard uit, een routing-bibliotheek die elke stap van een agentische workflow naar het meest geschikte model stuurt. Daarmee wordt de strategie in code gegoten: complex redeneren bij grotere modellen laten, de vele repetitieve stappen naar kleine, snelle modellen zoals Nemotron sturen.
De zet van NVIDIA lijkt minder een frontale uitdaging aan de frontier-modellen dan een poging om infrastructurele efficiëntie te verkopen. Een model met een permissieve licentie aanbieden — OpenMDW 1.1 staat commercieel gebruik zonder vergoeding toe, maar het is een recente en, vergeleken met Apache 2.0, weinig beproefde licentie: lees hem voor je hem gelijkstelt — dat goed draait op bestaande hardware is een slimme manier om ontwikkelaars te binden aan de hardware die het bedrijf verkoopt. Zolang de snelheidscijfers metingen blijven van wie de GPU's verkoopt, is het geclaimde voordeel een commerciële belofte, geen geverifieerd resultaat.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- De officiële model card op Hugging Face geopend (nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16) en bevestigd: hybride architectuur Mamba-2 + MoE + attention, 30B totaal en 3B actief, context tot 1M met een praktische grens van 256K op één H100, licentie OpenMDW 1.1 en releasedatum 11 augustus 2026. De officiële technische blog van NVIDIA bevestigt de NVFP4- en BF16-checkpoints, de distributiekanalen (Hugging Face, ModelScope, build.nvidia.com), de claim van tot 4x snelheid, de 86% op PinchBench, de 10.000 taken 30% sneller dan Qwen3.6-35B en de functie van NeMo Switchyard. Onafhankelijke bevestiging via MarkTechPost (11 augustus), dat dezelfde cijfers meldt en ze uitdrukkelijk aan NVIDIA toeschrijft, plus de NIM API-referentiepagina die de beschikbaarheid van het model bevestigt. Terzijde gelegd: het bericht over Apple en Alibaba (anonieme bronnen, geen publieke bevestiging van beide bedrijven), de public preview van MAI-Thinking-1 (het model werd al in juni gepresenteerd, de aankondiging van augustus gaat alleen over beschikbaarheid), en de FLI-veiligheidsindex en de DeepMind-studie over manipulatie (verschenen in juli respectievelijk maart–april 2026, opnieuw gedateerd door een aggregator).
- Incertezze
- Alle snelheids- en nauwkeurigheidscijfers zijn metingen van het bedrijf dat de GPU's verkoopt waarop het model draait: er is geen onafhankelijke verificatie van de PinchBench-resultaten of van de factor 4x, en de blog beschrijft de meetopstelling (batch, precisie, GPU) van de vergelijking met modellen «van vergelijkbare omvang» niet. Op PinchBench gaat de vergelijking om één enkel concurrerend model, gekozen door NVIDIA. Het venster van 1 miljoen tokens geldt op architectuurniveau, maar zakt op één H100 naar 256K: de geadverteerde waarde vraagt dus meerdere GPU's. De licentie OpenMDW 1.1 is recent en weinig beproefd vergeleken met Apache 2.0: lees hem voor je aanneemt dat ze gelijkwaardig zijn. Ook blijft onduidelijk hoezeer de officiële aanbeveling om in productie NVFP4 te gebruiken op de scores drukt, aangezien beide precisies niet dezelfde cijfers opleveren.
- Perché pubblicarla
- Het is de meest concrete open release van de week en verlegt het gesprek naar wat telt voor wie echt met agents werkt: niet de bovenkant van de intelligentie, maar de kosten en latency van repetitieve stappen, met gewichten, data en recepten die onder een commerciële licentie te downloaden zijn en een hardwareprofiel dat op één GPU past. Dat juist de GPU-fabrikant dit uitbrengt, met eigen benchmarks en een router die de modelkeuze regisseert, is precies de reden om de cijfers aandachtig te lezen in plaats van ze te herhalen.