Nemotron 3.5 Lightning і логіка «середнього шару» для ефективності агентів
11 серпня 2026 року NVIDIA оголосила у своєму технічному блозі про випуск Nemotron 3.5 Lightning — моделі mixture-of-experts на 30 мільярдів параметрів загалом, із яких 3 мільярди активні на токен. Офіційна картка моделі описує гібридну архітектуру, що поєднує Mamba-2, MoE та увагу; вона поширюється за ліцензією OpenMDW 1.1 разом із даними та рецептами навчання. Згідно з документацією, модель призначена насамперед для кастомізації та донавчання, а для розгортання у продакшені NVIDIA радить чекпойнт NVFP4. Саме тут упадає в око, що цифри, заявлені NVIDIA для BF16 (MMLU Pro 81,94; SWE-bench Verified 51,56), не збігаються з тими, які незалежні видання наводять для NVFP4 (81,62 і 52,80): наскільки рекомендована для продакшену точність впливає на бали, лишається незрозумілим.
Щодо продуктивності компанія заявляє швидкість генерації до чотирьох разів вищу, ніж у моделей порівнянного розміру, і точність близько 86% на агентному бенчмарку PinchBench, а також виконання 10 000 завдань на 30% швидше, ніж у Qwen3.6-35B, за приблизно однакової точності. Варто зауважити, що ці вимірювання надходять безпосередньо від виробника заліза, на якому працює модель, а порівняння в PinchBench проведено лише з однією конкурентною моделлю, обраною самою NVIDIA: незалежних перевірок наразі немає, а блог не вказує ні конфігурації обладнання, ні параметрів порівняння, залишаючи запас невизначеності щодо реальних цифр на практиці.
Вразливий момент — пам'ять: архітектура теоретично підтримує контекст до 1 мільйона токенів, але на одній GPU H100 доступний обсяг падає до 256K токенів через фізичні обмеження. Для розгортання на одній карті потрібно 80 ГБ відеопам'яті. Водночас NVIDIA випустила NeMo Switchyard — бібліотеку маршрутизації, що спрямовує кожен крок агентного робочого процесу до найдоречнішої моделі. Це пряме втілення стратегії, за якої складні міркування лишаються за великими моделями, а численні повторювані кроки йдуть до маленьких і швидких, як-от Nemotron.
Хід NVIDIA виглядає не так прямим викликом фронтирним моделям, як спробою продати ефективність інфраструктури. Запропонувати модель із дозвільною ліцензією — OpenMDW 1.1 дозволяє комерційне використання без відрахувань, але це свіжа й мало обкатана ліцензія порівняно з Apache 2.0: її варто прочитати, перш ніж вважати їх рівноцінними, — яка добре працює на вже наявному залізі, розумний спосіб прив'язати розробників до заліза, що компанія продає. Доки цифри швидкості лишаються вимірюваннями того, хто продає GPU, заявлена перевага — це комерційна обіцянка, а не перевірений результат.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Відкрито офіційну картку моделі на Hugging Face (nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16) і підтверджено гібридну архітектуру Mamba-2 + MoE + увага, 30B загалом і 3B активних, контекст до 1M із практичною межею 256K на одній H100, ліцензію OpenMDW 1.1 та дату випуску 11 серпня 2026 року. Офіційний технічний блог NVIDIA підтверджує чекпойнти NVFP4 і BF16, канали розповсюдження (Hugging Face, ModelScope, build.nvidia.com), заяву про швидкість до 4x, 86% на PinchBench, 10 000 завдань на 30% швидше за Qwen3.6-35B і призначення NeMo Switchyard. Незалежне підтвердження — MarkTechPost (11 серпня), який наводить ті самі цифри і прямо приписує їх NVIDIA, а також довідкова сторінка API NIM, що підтверджує доступність моделі. Відкинуто: повідомлення про Apple та Alibaba (анонімні джерела, жодна з компаній публічно його не підтвердила), публічне прев'ю MAI-Thinking-1 (модель представили ще в червні, серпневий анонс стосується лише доступності), індекс безпеки FLI і дослідження DeepMind про маніпуляцію (вийшли відповідно в липні та в березні–квітні 2026 року, дату переставив агрегатор).
- Incertezze
- Усі цифри швидкості й точності — вимірювання компанії, яка продає GPU, на яких працює модель: незалежних перевірок результатів PinchBench і множника 4x немає, а блог не описує умов вимірювання (батч, точність, GPU) у порівнянні з моделями «порівнянного розміру». У PinchBench порівняння йде лише з однією конкурентною моделлю, обраною NVIDIA. Вікно в 1 мільйон токенів заявлено на рівні архітектури, але на одній H100 падає до 256K, тож рекламована величина потребує кількох GPU. Ліцензія OpenMDW 1.1 нова й мало випробувана порівняно з Apache 2.0: її треба прочитати, перш ніж вважати рівноцінною. Лишається незрозумілим і те, наскільки офіційна порада використовувати в продакшені NVFP4 впливає на бали, адже дві точності дають різні цифри.
- Perché pubblicarla
- Це найпредметніший відкритий реліз тижня, і він переносить розмову туди, де вона важлива для тих, хто справді працює з агентами: не до піку інтелекту, а до вартості та затримки повторюваних кроків — з вагами, даними і рецептами, доступними для завантаження за комерційною ліцензією, і вимогами, що вкладаються в одну GPU. Те, що випускає це сам виробник GPU, зі своїми бенчмарками і маршрутизатором, який диригує вибором моделей, — саме та причина, щоб читати цифри уважно, а не переказувати їх.