Nemotron 3.5 Lightning y la lógica de la «capa intermedia» para la eficiencia agéntica
El 11 de agosto de 2026, NVIDIA anunció en su blog técnico el lanzamiento de Nemotron 3.5 Lightning, un modelo mixture-of-experts de 30.000 millones de parámetros totales con 3.000 millones activos por token. La model card oficial describe una arquitectura híbrida que combina Mamba-2, MoE y atención, distribuida bajo licencia OpenMDW 1.1 junto con los datos y las recetas de entrenamiento. Según la documentación, el modelo está destinado sobre todo a la personalización y al post-entrenamiento, y NVIDIA recomienda el checkpoint NVFP4 para el despliegue en producción. A propósito de esto, las cifras que NVIDIA declara para BF16 (MMLU Pro 81,94; SWE-bench Verified 51,56) no coinciden con las que la cobertura independiente atribuye a NVFP4 (81,62 y 52,80): queda por saber cuánto influye en las puntuaciones la precisión recomendada en producción.
En cuanto al rendimiento, la empresa declara una velocidad de generación hasta cuatro veces superior a la de modelos de tamaño comparable y una precisión de alrededor del 86% en el benchmark agéntico PinchBench, completando 10.000 tareas un 30% más rápido que Qwen3.6-35B con una precisión aproximadamente equivalente. Conviene señalar que estas mediciones proceden directamente del fabricante del hardware sobre el que corre el modelo y que la comparación en PinchBench se hace con un único modelo rival elegido por NVIDIA: por ahora no hay verificaciones independientes, y el blog no especifica ni la configuración de hardware ni los parámetros de la comparación, lo que deja un margen de incertidumbre sobre los datos reales en escenarios de uso.
Un punto delicado es la memoria: aunque la arquitectura admite en teoría una longitud de contexto de hasta 1 millón de tokens, la disponibilidad baja a 256K tokens en una sola GPU H100 por límites físicos. El despliegue en una única tarjeta requiere 80 GB de memoria de vídeo. En paralelo, NVIDIA lanzó NeMo Switchyard, una biblioteca de enrutamiento diseñada para dirigir cada paso de un flujo de trabajo agéntico al modelo más adecuado, aplicando la estrategia de dejar el razonamiento complejo a modelos más grandes y enviar los muchos pasos repetitivos a modelos pequeños y rápidos como Nemotron.
El movimiento de NVIDIA parece menos un desafío directo a los modelos de frontera y más un intento de vender eficiencia de infraestructura. Ofrecer un modelo con licencia permisiva —OpenMDW 1.1 permite el uso comercial sin canon, pero es una licencia reciente y poco rodada frente a Apache 2.0: hay que leerla antes de darla por equivalente— que funciona bien en el hardware existente es una forma inteligente de atar a quienes desarrollan al hardware que la empresa vende. Mientras las cifras de velocidad sigan siendo mediciones de quien vende las GPU, la ventaja declarada es una promesa comercial, no un resultado verificado.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Abierta la model card oficial en Hugging Face (nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16) y confirmadas la arquitectura híbrida Mamba-2 + MoE + atención, 30B totales y 3B activos, contexto de hasta 1M con límite práctico de 256K en una H100, la licencia OpenMDW 1.1 y la fecha de lanzamiento del 11 de agosto de 2026. El blog técnico oficial de NVIDIA confirma los checkpoints NVFP4 y BF16, los canales de distribución (Hugging Face, ModelScope, build.nvidia.com), la declaración de hasta 4x de velocidad, el 86% en PinchBench, las 10.000 tareas completadas un 30% más rápido que Qwen3.6-35B y la función de NeMo Switchyard. Contraste independiente en MarkTechPost (11 de agosto), que reporta las mismas cifras y las atribuye explícitamente a NVIDIA, además de la página de referencia de la API NIM que confirma la disponibilidad del modelo. Descartadas: la noticia sobre Apple y Alibaba (fuentes anónimas, ninguna de las dos empresas la ha confirmado públicamente), la public preview de MAI-Thinking-1 (el modelo ya se presentó en junio y el anuncio de agosto solo afecta a la disponibilidad) y el índice de seguridad de FLI junto con el estudio de DeepMind sobre manipulación (publicados en julio y entre marzo y abril de 2026, refechados por un agregador).
- Incertezze
- Todas las cifras de velocidad y precisión son mediciones de la empresa que vende las GPU sobre las que corre el modelo: no constan verificaciones independientes de los resultados en PinchBench ni del multiplicador 4x, y el blog no detalla la configuración de medición (batch, precisión, GPU) de la comparación con los modelos «de tamaño comparable». En PinchBench la comparación es con un único modelo rival, elegido por NVIDIA. La ventana de 1 millón de tokens se declara a nivel de arquitectura, pero en una sola H100 baja a 256K, así que el valor publicitado exige varias GPU. La licencia OpenMDW 1.1 es reciente y poco probada frente a Apache 2.0: hay que leerla antes de suponerla equivalente. Queda por saber cuánto influye en las puntuaciones la recomendación oficial de usar NVFP4 en producción, dado que ambas precisiones no dan las mismas cifras.
- Perché pubblicarla
- Es el lanzamiento abierto más concreto de la semana y lleva la conversación adonde importa a quien usa agentes de verdad: no el pico máximo de inteligencia, sino el coste y la latencia de los pasos repetitivos, con pesos, datos y recetas descargables bajo licencia comercial y un perfil de hardware de una sola GPU. Que quien lo publique sea el fabricante de las GPU, con benchmarks propios y un router que orquesta la elección de modelos, es justo el motivo para leer las cifras con atención en vez de repetirlas.