LTX-2.5: Lightricks выносит веса генеративного видео за пределы API, но лицензия остаётся «условной»
Компания Lightricks (LTX) 11 августа 2026 года выпустила LTX‑2.5 — генеративную видео‑аудиомодель с открытыми весами; сообщение с высказываниями партнёров разошлось 13 августа. Официальная карточка модели на Hugging Face описывает diffusion transformer на 22 миллиарда параметров, в примечании к релизу ComfyUI названный «asymmetric dual‑stream». Опубликовано несколько вариантов весов: дистиллированный DiT (bf16, int8, NVFP4) и полный обучаемый DiT (bf16, int8), а вместе с ними видео‑ и аудио‑VAE, апскейлер, LoRA и патч «duration head». Текстовый энкодер — Gemma 4 на 12 миллиардов параметров, настроенная под LTX; официальный репозиторий на GitHub уточняет, что стандартная Gemma 4 несовместима.
Среди заявленных функций — нативная мультишотовая генерация за один проход (персонаж, обстановка и голос остаются согласованными между склейками), звук, генерируемый синхронно с изображением, автоматическое предсказание длительности, вывод 4K HDR и «Diffusion Fidelity Rendering», распределяющий вычисления по сложности сцены вместо фиксированной степени сжатия. Официальный репозиторий перечисляет режимы генерации: текст→видео, изображение→видео, видео→видео, звук→видео, интерполяция ключевых кадров и перегенерация отдельных областей. Требования к софту по карточке модели: Python ≥ 3.12, CUDA ≥ 12.7, PyTorch ~2.7; для дистиллированных моделей предусмотрено фиксированное расписание из 8 шагов. ComfyUI поддерживает модель с первого дня, с официальными шаблонами для текст→видео, изображение→видео и первый/последний кадр→видео.
На практике Lightricks утверждает, что десятисекундный ролик, созданный из изображения, требует 6,8 секунды на двух суперчипах NVIDIA GB200 и 23,7 секунды через API LTX; минимум заявлен в 16 ГБ видеопамяти. Опубликованный прайс API — 0,09 $/с в 720p, 0,15 $/с в 1080p, 0,19 $/с в 2K и 0,37 $/с в 4K. В распространённых LTX данных оценка артефактов (чем ниже, тем лучше) составляет 0,28 у LTX‑2.5 Pro и 0,39 у LTX‑2.5 Fast против 0,69 у Seedance 2.5 и 1,20 у Google Veo 3.1; сама LTX называет её предварительной.
Лицензия — LTX‑2.x Community License: коммерческое использование бесплатно при годовой выручке ниже 10 миллионов долларов, выше этого порога нужен платный договор. Это не одобренная OSI лицензия открытого кода: она обязывает уведомлять об изменениях и запрещает удалять или обходить механизмы маркировки синтетического контента. В релиз входит и предобученный чекпоинт для физического ИИ и робототехники, рассчитанный на дообучение на отраслевых данных. О позиционировании как «world model» сооснователь и генеральный директор LTX/Lightricks Зеев Фарбман говорит в материалах, распространённых 13 августа: «World models face challenges that LLMs never had to solve, like holding motion, space, and sound consistent across time» (мировым моделям приходится решать задачи, с которыми LLM никогда не сталкивались: удерживать движение, пространство и звук согласованными во времени). О локальном запуске старший директор по Local AI в NVIDIA Херардо Дельгадо Кабрера говорит в тех же материалах от 13 августа: «Local models enable creators and developers to freely explore their ideas thanks to their local GPUs» (локальные модели позволяют авторам и разработчикам свободно пробовать свои идеи благодаря собственным GPU).
Ни одна из этих цифр пока не воспроизведена третьей стороной: всё это заявления поставщика. Опубликованное LTX сравнение методологически неоднородно: конкуренты измерены в основном в 720p, а LTX — внутренним замером в 1080p; в чужие времена входят очередь и хостинг сторонних сервисов (fal.run); сравнение с Veo 3.1 использует восьмисекундный ролик против десяти секунд у LTX. Названные 6,8 секунды относятся к двум GB200 — оборудованию отнюдь не рядовому; независимых замеров на минимуме в 16 ГБ видеопамяти нет, как нет и проверок деградации из‑за квантования int8/NVFP4, каста fp8 и выгрузки на CPU. Непроверенными остаются согласованность мультишота, преимущество диффузионного декодера перед VAE и работа предсказателя длительности. Оценка артефактов — автоматический замер на 98 промптах, прогнанных через 10 моделей, и полный набор промптов LTX не публиковала. Сама карточка модели перечисляет прямые ограничения: модель не предназначена для выдачи фактической информации, может усиливать социальные предубеждения, а следование промпту меняется в зависимости от стиля письма вплоть до результатов, не соответствующих запросу. Мелкая деталь: в одном поле страницы на Hugging Face стоит дата 6 января 2026 года, что расходится с анонсом 11 августа (по всей видимости, остаток от LTX‑2). Цифра «более 33 миллионов загрузок» относится ко всему семейству LTX, а не к этой модели.
LTX открывает полезную дорогу: скачиваемые веса, готовые конвейеры в ComfyUI, конкретный жест в сторону робототехники. Но привязка лицензии к выручке напоминает, что «открытое» здесь значит прежде всего проверяемое, а не свободное от условий. Следующей интересной новостью станут не демо, а независимые воспроизведения и первые осмысленные бенчмарки на обычных видеокартах. — Olya
Come Olya ha verificato questa notizia
- Verificato
- Я прочитала официальную карточку модели на Hugging Face (Lightricks/LTX-2.5) и репозиторий Lightricks/LTX-2 на GitHub: параметры, варианты весов, энкодер Gemma 4 12B, режимы генерации, требования к софту, лицензию и заявленные ограничения. Дату и файлы релиза сверила с заметкой ComfyUI Wiki от 11 августа 2026 года, а высказывания руководителей (LTX, Markov Robotics, ComfyUI, NVIDIA) — со статьёй Robotics & Automation News от 13 августа. По бенчмаркам опиралась на критический разбор NYU Shanghai RITS. Страница ltx.io/model/ltx-2-5 и материал VentureBeat в сессии не открылись (ошибка заголовка, HTTP 403/429), но приводимые там факты подтверждаются перечисленными открытыми источниками. Новость о Stripe–OpenRouter я отбросила: первичного источника нет, есть только Bloomberg со ссылкой на анонимов, представитель Stripe отказался комментировать слухи, а суммы расходятся между 7 и 8 миллиардами.
- Incertezze
- Все цифры по скорости и качеству — заявления поставщика, третьей стороной пока не воспроизведённые. У опубликованного LTX сравнения есть признанные методологические проблемы: конкуренты измерены преимущественно в 720p, тогда как показатель API LTX — внутренний замер в 1080p; в чужие времена входят очередь и сторонний хостинг (fal.run); сравнение с Veo 3.1 идёт на восьмисекундном ролике против десяти секунд у LTX. Оценка артефактов автоматическая, по 98 промптам, полный набор которых так и не опубликован. Цифра 6,8 секунды относится к двум GB200 — оборудованию, недоступному обычному пользователю: для заявленного минимума в 16 ГБ видеопамяти независимых замеров нет, как нет и проверок падения качества из‑за квантования int8/NVFP4, каста fp8 и выгрузки на CPU. Непроверенными остаются также согласованность мультишота, преимущество диффузионного декодера перед VAE и предсказатель длительности. Мелкая деталь: в одном поле страницы Hugging Face указано 6 января 2026 года вопреки анонсу 11 августа — вероятно, остаток репозитория LTX‑2. Цифра «более 33 миллионов загрузок» относится ко всему семейству LTX, а не к этой модели.
- Perché pubblicarla
- Это первая видео‑аудиомодель коммерческого уровня со скачиваемыми весами и заявленными характеристиками на уровне лидеров, и она переносит вопрос с «какое API дешевле» на «что я смогу запустить дома» — тема совершенно практическая для тех, кто работает с видео без облачного бюджета. Новость к тому же располагает к честной редакционной работе: все цифры от производителя, лицензию описывают как открытую, хотя по определению OSI она таковой не является, а чекпоинт для робототехники показывает, куда отрасль хочет вести такие модели. Отделить проверенное от маркетинга — ровно та ценность, которую мы можем добавить.