Nemotron 3.5 Lightning i logika «warstwy pośredniej» dla wydajności agentowej
11 sierpnia 2026 roku NVIDIA ogłosiła na swoim blogu technicznym premierę modelu Nemotron 3.5 Lightning — mixture-of-experts o 30 miliardach parametrów łącznie i 3 miliardach aktywnych na token. Oficjalna karta modelu opisuje architekturę hybrydową łączącą Mamba-2, MoE i mechanizm uwagi, rozpowszechnianą na licencji OpenMDW 1.1 wraz z danymi i przepisami treningowymi. Zgodnie z dokumentacją model przeznaczony jest przede wszystkim do personalizacji i post-treningu, a do wdrożeń produkcyjnych NVIDIA zaleca checkpoint NVFP4. I właśnie tutaj rzuca się w oczy, że liczby podane przez NVIDIĘ dla BF16 (MMLU Pro 81,94; SWE-bench Verified 51,56) nie pokrywają się z tymi, które niezależne serwisy podają dla NVFP4 (81,62 i 52,80): nie wiadomo, jak bardzo zalecana w produkcji precyzja wpływa na wyniki.
Jeśli chodzi o wydajność, firma deklaruje prędkość generowania nawet czterokrotnie wyższą niż w modelach porównywalnej wielkości oraz około 86% skuteczności w agentowym benchmarku PinchBench, przy czym 10 000 zadań zostaje ukończonych 30% szybciej niż w przypadku Qwen3.6-35B, przy w przybliżeniu tej samej skuteczności. Trzeba zauważyć, że pomiary pochodzą wprost od producenta sprzętu, na którym model działa, a porównanie w PinchBench obejmuje tylko jeden konkurencyjny model, wybrany przez NVIDIĘ: niezależnych weryfikacji na razie nie ma, a blog nie podaje ani konfiguracji sprzętowej, ani parametrów porównania, co zostawia margines niepewności co do rzeczywistych wyników w realnych zastosowaniach.
Punkt drażliwy dotyczy pamięci: architektura teoretycznie obsługuje kontekst do 1 miliona tokenów, ale na pojedynczym GPU H100 dostępna długość spada z powodów fizycznych do 256K tokenów. Wdrożenie na jednej karcie wymaga 80 GB pamięci wideo. Równocześnie NVIDIA udostępniła NeMo Switchyard, bibliotekę routingu zaprojektowaną tak, by kierować kolejne kroki agentowego przepływu pracy do najodpowiedniejszego modelu — realizuje ona strategię, w której złożone rozumowanie zostawia się większym modelom, a liczne powtarzalne kroki trafiają do małych i szybkich, takich jak Nemotron.
Ruch NVIDII wygląda mniej na bezpośrednie wyzwanie rzucone modelom z pierwszej linii, a bardziej na próbę sprzedania efektywności infrastruktury. Zaoferowanie modelu na liberalnej licencji — OpenMDW 1.1 pozwala na użytek komercyjny bez opłat, ale to licencja świeża i słabo sprawdzona w porównaniu z Apache 2.0: warto ją przeczytać, zanim uzna się je za równoważne — który dobrze działa na istniejącym sprzęcie, to sprytny sposób przywiązania programistów do sprzętu, który firma sprzedaje. Dopóki liczby o prędkości pozostają pomiarami tego, kto sprzedaje GPU, deklarowana przewaga jest obietnicą handlową, a nie zweryfikowanym wynikiem.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Otwarta oficjalna karta modelu na Hugging Face (nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16) i potwierdzone: architektura hybrydowa Mamba-2 + MoE + uwaga, 30B łącznie i 3B aktywnych, kontekst do 1M z praktycznym limitem 256K na pojedynczej H100, licencja OpenMDW 1.1, data premiery 11 sierpnia 2026. Oficjalny blog techniczny NVIDII potwierdza checkpointy NVFP4 i BF16, kanały dystrybucji (Hugging Face, ModelScope, build.nvidia.com), deklarację prędkości do 4x, 86% w PinchBench, 10 000 zadań ukończonych 30% szybciej niż przez Qwen3.6-35B oraz funkcję NeMo Switchyard. Niezależne potwierdzenie w MarkTechPost (11 sierpnia), który podaje te same liczby i wprost przypisuje je NVIDII, a także strona referencyjna API NIM potwierdzająca dostępność modelu. Odrzucone: doniesienie o Apple i Alibabie (anonimowe źródła, żadna z firm nie potwierdziła go publicznie), public preview MAI-Thinking-1 (model przedstawiono już w czerwcu, sierpniowa zapowiedź dotyczy wyłącznie dostępności) oraz indeks bezpieczeństwa FLI i badanie DeepMind o manipulacji (opublikowane odpowiednio w lipcu i między marcem a kwietniem 2026, z datami zmienionymi przez agregator).
- Incertezze
- Wszystkie liczby o prędkości i skuteczności to pomiary firmy, która sprzedaje GPU, na których model działa: nie ma niezależnej weryfikacji wyników w PinchBench ani mnożnika 4x, a blog nie opisuje warunków pomiaru (batch, precyzja, GPU) w porównaniu z modelami «porównywalnej wielkości». W PinchBench porównanie obejmuje tylko jeden konkurencyjny model, wybrany przez NVIDIĘ. Okno miliona tokenów zadeklarowano na poziomie architektury, ale na pojedynczej H100 spada do 256K — reklamowana wartość wymaga więc kilku GPU. Licencja OpenMDW 1.1 jest nowa i słabo przetestowana w zestawieniu z Apache 2.0: trzeba ją przeczytać, zanim uzna się je za równoważne. Nie wiadomo też, jak bardzo oficjalne zalecenie stosowania NVFP4 w produkcji wpływa na wyniki, skoro obie precyzje nie dają tych samych liczb.
- Perché pubblicarla
- To najbardziej konkretna otwarta premiera tygodnia i przesuwa rozmowę tam, gdzie liczy się dla tych, którzy naprawdę używają agentów: nie na szczyt inteligencji, lecz na koszt i opóźnienie powtarzalnych kroków — z wagami, danymi i przepisami do pobrania na licencji komercyjnej i profilem sprzętowym mieszczącym się w jednym GPU. To, że wydaje ją producent GPU, z własnymi benchmarkami i routerem dyrygującym wyborem modeli, jest dokładnie powodem, by liczby czytać uważnie, a nie powtarzać.