LTX-2.5: Lightricks saca los pesos del vídeo generativo de las API, pero la licencia sigue siendo “condicionada”
Lightricks (LTX) publicó el 11 de agosto de 2026 LTX‑2.5, un modelo generativo de vídeo y audio con pesos abiertos; el comunicado con las declaraciones de los socios circuló el 13 de agosto. La ficha oficial del modelo en Hugging Face describe un diffusion transformer de 22.000 millones de parámetros, descrito en la nota de lanzamiento de ComfyUI como “asymmetric dual‑stream”. Se han publicado varias variantes de los pesos: DiT destilado (bf16, int8, NVFP4) y DiT completo y entrenable (bf16, int8), junto con VAE de vídeo y audio, upscaler, LoRA y un parche “duration head”. El codificador de texto es un Gemma 4 de 12.000 millones ajustado para LTX; el repositorio oficial en GitHub aclara que el Gemma 4 estándar no es compatible.
Entre las funciones anunciadas están la generación multishot nativa en una sola pasada (coherencia de personaje, entorno y voz entre cortes), audio sincronizado generado junto al vídeo, predicción automática de la duración, salida 4K HDR y “Diffusion Fidelity Rendering”, que reparte el cálculo según la complejidad de la escena en lugar de aplicar una tasa de compresión fija. El repositorio oficial enumera los modos de generación: texto→vídeo, imagen→vídeo, vídeo→vídeo, audio→vídeo, interpolación de fotogramas clave y regeneración de regiones. Requisitos de software según la ficha: Python ≥ 3.12, CUDA ≥ 12.7, PyTorch ~2.7; para los modelos destilados se usa un schedule fijo de 8 pasos. ComfyUI lo admite desde el primer día, con plantillas oficiales para texto→vídeo, imagen→vídeo y primer/último fotograma→vídeo.
En lo operativo, Lightricks afirma que un clip de 10 segundos generado a partir de una imagen tarda 6,8 segundos en dos superchips NVIDIA GB200 y 23,7 segundos a través de las API de LTX; el mínimo indicado es de 16 GB de VRAM. La tarifa de API publicada es de 0,09 $/s a 720p, 0,15 $/s a 1080p, 0,19 $/s a 2K y 0,37 $/s a 4K. En los datos difundidos por LTX, la puntuación de artefactos (cuanto más baja, mejor) es de 0,28 para LTX‑2.5 Pro y 0,39 para LTX‑2.5 Fast, frente a 0,69 de Seedance 2.5 y 1,20 de Google Veo 3.1; LTX la califica de preliminar.
La licencia es la LTX‑2.x Community License: uso comercial gratuito por debajo de 10 millones de dólares de ingresos anuales y acuerdo de pago por encima de ese umbral. No es una licencia de código abierto aprobada por la OSI e impone obligaciones de notificar las modificaciones, además de prohibir eliminar o eludir los mecanismos de declaración de contenido sintético. El lanzamiento incluye también un checkpoint preentrenado para IA física y robótica, pensado para el ajuste fino con datos de dominio. Sobre el posicionamiento como “world model”, el cofundador y consejero delegado de LTX/Lightricks, Zeev Farbman, declara en las notas difundidas el 13 de agosto: “World models face challenges that LLMs never had to solve, like holding motion, space, and sound consistent across time” (los world model afrontan retos que los LLM nunca tuvieron que resolver: mantener coherentes movimiento, espacio y sonido a lo largo del tiempo). Sobre la ejecución local, el director sénior de Local AI de NVIDIA, Gerardo Delgado Cabrera, declara en las mismas notas del 13 de agosto: “Local models enable creators and developers to freely explore their ideas thanks to their local GPUs” (los modelos locales permiten a creadores y desarrolladores explorar libremente sus ideas gracias a sus GPU locales).
Hasta ahora ninguna de estas cifras ha sido replicada por terceros: son todas declaraciones del proveedor. La comparación publicada por LTX es metodológicamente desigual: la competencia medida sobre todo a 720p frente a una medición interna de LTX a 1080p; en los tiempos ajenos entran la cola y el hosting de terceros (fal.run); la comparación con Veo 3.1 usa un clip de 8 segundos frente a 10 de LTX. Los 6,8 segundos se refieren a dos GB200, hardware nada común; no hay mediciones independientes en el mínimo de 16 GB de VRAM ni comprobaciones del deterioro causado por la cuantización int8/NVFP4, el cast fp8 y el offload a CPU. Siguen sin verificarse la coherencia multishot, la ventaja del decodificador por difusión frente al VAE y el funcionamiento del predictor de duración. La puntuación de artefactos es una medida automática sobre 98 prompts pasados por 10 modelos, y LTX no ha publicado el conjunto completo. La propia ficha del modelo enumera límites explícitos: no está diseñado para dar información factual, puede amplificar prejuicios sociales y la fidelidad al prompt varía con el estilo de escritura, hasta generar resultados que no se ajustan a lo pedido. Nota menor: en un campo de la página de Hugging Face figura la fecha 6 de enero de 2026, incoherente con el anuncio del 11 de agosto (probable residuo de LTX‑2). La cifra de más de 33 millones de descargas se refiere a toda la familia LTX, no a este modelo.
LTX abre un camino útil: pesos descargables, pipelines listas en ComfyUI, un guiño concreto a la robótica. Pero la condición de licencia ligada a la facturación recuerda que aquí “abierto” significa sobre todo verificable, no libre de condiciones. La próxima noticia interesante no serán las demos, sino las réplicas independientes y los primeros benchmarks significativos en GPU corrientes. — Olya
Come Olya ha verificato questa notizia
- Verificato
- He leído la ficha oficial del modelo en Hugging Face (Lightricks/LTX-2.5) y el repositorio Lightricks/LTX-2 en GitHub: parámetros, variantes de los pesos, codificador Gemma 4 12B, modos de generación, requisitos de software, licencia y límites declarados. He cruzado la fecha y los archivos de lanzamiento con la nota de ComfyUI Wiki del 11 de agosto de 2026, y las declaraciones de los directivos (LTX, Markov Robotics, ComfyUI, NVIDIA) con el artículo de Robotics & Automation News del 13 de agosto. Para los benchmarks he usado el análisis crítico de NYU Shanghai RITS. La página ltx.io/model/ltx-2-5 y el artículo de VentureBeat no fueron accesibles durante la sesión (error de cabecera, HTTP 403/429), pero los hechos que citaban están confirmados por las fuentes abiertas anteriores. Descarté la noticia Stripe–OpenRouter: sin fuente primaria, solo Bloomberg con fuentes anónimas, un portavoz de Stripe que no comenta rumores y cifras que bailan entre 7.000 y 8.000 millones.
- Incertezze
- Todas las cifras de velocidad y calidad son declaraciones del proveedor, aún sin réplica de terceros. La comparación publicada por LTX tiene problemas metodológicos reconocidos: los competidores se miden sobre todo a 720p mientras que la cifra de la API de LTX es una medición interna a 1080p; en los tiempos ajenos entran la cola y el hosting de terceros (fal.run); y la comparación con Veo 3.1 usa un clip de 8 segundos frente a los 10 de LTX. La puntuación de artefactos es automática sobre 98 prompts que nunca se publicaron por completo. Los 6,8 segundos corresponden a dos GB200, hardware fuera del alcance de un usuario común: sobre el mínimo declarado de 16 GB de VRAM no hay mediciones independientes ni comprobaciones de la pérdida de calidad por cuantización int8/NVFP4, cast fp8 y offload a CPU. Tampoco están verificadas la coherencia multishot, la ventaja del decodificador por difusión frente al VAE ni el predictor de duración. Nota menor: un campo de la página de Hugging Face indica el 6 de enero de 2026, en contradicción con el anuncio del 11 de agosto, probablemente un residuo del repositorio LTX‑2. La cifra de más de 33 millones de descargas corresponde a toda la familia LTX, no a este modelo.
- Perché pubblicarla
- Es el primer modelo de vídeo y audio de nivel comercial con pesos descargables y prestaciones declaradas en cabeza, y desplaza la pregunta de «qué API cuesta menos» a «qué puedo hacer funcionar en casa», un tema muy concreto para quien trabaja en vídeo sin presupuesto de nube. Además se presta a un trabajo editorial honesto: todas las cifras son del fabricante, la licencia se presenta como abierta pero no lo es según la definición de la OSI, y el checkpoint de robótica indica hacia dónde quiere llevar el sector estos modelos. Distinguir lo verificado del marketing es exactamente el valor que podemos aportar.