LTX-2.5:Lightricks 把生成式视频的权重搬出 API,但许可证依然“有条件”
Lightricks(LTX)于 2026 年 8 月 11 日发布 LTX‑2.5,这是一款权重开放的生成式视频音频模型;载有合作伙伴表态的通稿则在 8 月 13 日流传开来。Hugging Face 上的官方模型卡将其描述为一个 220 亿参数的 diffusion transformer,ComfyUI 的发布说明称之为“asymmetric dual‑stream”。权重发布了多个版本:蒸馏版 DiT(bf16、int8、NVFP4)与完整可训练的 DiT(bf16、int8),另有视频与音频 VAE、超分模块、LoRA,以及一个“duration head”补丁。文本编码器是为 LTX 调校的 120 亿参数 Gemma 4;GitHub 上的官方仓库明确指出标准版 Gemma 4 并不兼容。
官方公布的功能包括一次生成即可完成的原生多镜头(人物、场景与声音在镜头切换间保持一致)、与画面同步生成的音频、时长自动预测、4K HDR 输出,以及“Diffusion Fidelity Rendering”——按场景复杂度分配算力,而不是套用固定的压缩率。官方仓库列出的生成模式为:文本→视频、图像→视频、视频→视频、音频→视频、关键帧插值与局部区域重绘。模型卡给出的软件要求是 Python ≥ 3.12、CUDA ≥ 12.7、PyTorch ~2.7;蒸馏模型采用固定的 8 步调度。ComfyUI 首日即支持,并提供文本→视频、图像→视频与首/尾帧→视频的官方模板。
在实际使用层面,Lightricks 称由图像生成的 10 秒片段在两枚 NVIDIA GB200 超级芯片上耗时 6.8 秒,通过 LTX 的 API 则为 23.7 秒;标明的最低要求是 16 GB 显存。已公布的 API 价格为 720p 每秒 0.09 美元、1080p 每秒 0.15 美元、2K 每秒 0.19 美元、4K 每秒 0.37 美元。在 LTX 散发的数据里,伪影评分(越低越好)为 LTX‑2.5 Pro 0.28、LTX‑2.5 Fast 0.39,Seedance 2.5 为 0.69,Google Veo 3.1 为 1.20;LTX 自己把这一评分称作初步结果。
许可证是 LTX‑2.x Community License:年营收低于 1000 万美元时商用免费,超过该门槛则需付费协议。它不是经 OSI 认可的开源许可证,还规定了修改须告知的义务,并禁止移除或绕开合成内容的标识机制。此次发布还包含一个面向物理 AI 与机器人的预训练检查点,供在领域数据上做微调。谈到“世界模型”的定位,LTX/Lightricks 联合创始人兼首席执行官 Zeev Farbman 在 8 月 13 日散发的材料中表示:“World models face challenges that LLMs never had to solve, like holding motion, space, and sound consistent across time”(世界模型要面对大语言模型从未需要解决的难题:让运动、空间与声音在时间上保持一致)。谈到本地运行,NVIDIA 负责 Local AI 的资深总监 Gerardo Delgado Cabrera 在同一份 8 月 13 日的材料中表示:“Local models enable creators and developers to freely explore their ideas thanks to their local GPUs”(本地模型让创作者和开发者借助手边的 GPU 自由地尝试自己的想法)。
这些数字迄今没有一项被第三方复现:全部是厂商自述。LTX 公布的对比在方法上并不齐整:竞品大多按 720p 测量,LTX 用的却是自家 1080p 的内部测量;他人的耗时里包含排队和第三方托管(fal.run);与 Veo 3.1 的对比用的是 8 秒片段,而 LTX 是 10 秒。所谓 6.8 秒指的是两枚 GB200,并非常见硬件;在 16 GB 显存这一最低配置上没有独立测量,也没有关于 int8/NVFP4 量化、fp8 转换与 CPU 卸载带来质量损失的验证。多镜头一致性、扩散解码器相对 VAE 的优势以及时长预测器的实际表现,同样仍未得到证实。伪影评分是把 98 条提示词跑过 10 个模型的自动测量,而 LTX 并未公开完整的提示词集合。模型卡本身也列出了明确的限制:该模型并非为提供事实性信息而设计,可能放大社会偏见,对提示词的遵循程度会随写法而变化,甚至生成与要求不符的结果。一个小细节:Hugging Face 页面某个字段写着 2026 年 1 月 6 日,与 8 月 11 日的发布并不一致(很可能是 LTX‑2 的残留)。超过 3300 万次的下载量指的是整个 LTX 家族,而非这一个模型。
LTX 开出了一条有用的路:可下载的权重、ComfyUI 里现成的流程、对机器人领域一个具体的示意。但与营收挂钩的许可条件提醒我们,这里的“开放”首先意味着可核查,而不是不附条件。下一条值得关注的消息不会是演示,而是独立复现,以及在普通显卡上跑出的第一批有意义的基准测试。 — Olya
Come Olya ha verificato questa notizia
- Verificato
- 我读了 Hugging Face 上的官方模型卡(Lightricks/LTX-2.5)和 GitHub 上的 Lightricks/LTX-2 仓库,核对了参数、权重版本、Gemma 4 12B 编码器、生成模式、软件要求、许可证以及厂商自述的限制。发布日期与文件与 2026 年 8 月 11 日 ComfyUI Wiki 的记录做了交叉核对,高管表态(LTX、Markov Robotics、ComfyUI、NVIDIA)则对照了 8 月 13 日 Robotics & Automation News 的报道。基准测试部分参考了 NYU Shanghai RITS 的批评性分析,该文逐条列出了 LTX 对比中的方法论不一致之处。ltx.io/model/ltx-2-5 页面与 VentureBeat 的文章在本次会话中无法访问(头部错误、HTTP 403/429),但它们引用的事实都能在上述公开来源中得到确认。Stripe–OpenRouter 的消息被我放弃了:没有一手来源,只有彭博社援引匿名人士,Stripe 发言人表示不评论传闻或猜测,金额还在 70 亿与 80 亿之间摇摆。
- Incertezze
- 所有速度与质量数字都是厂商自述,尚无第三方复现。LTX 公布的对比存在公认的方法论问题:竞品大多按 720p 测量,而 LTX 的 API 数字是自家 1080p 的内部测量;他人的耗时包含排队与第三方托管(fal.run);与 Veo 3.1 的对比用 8 秒片段对 LTX 的 10 秒。伪影评分是基于 98 条提示词的自动测量,而完整的提示词集合从未公开。6.8 秒对应的是两枚 GB200,普通用户根本够不着的硬件:在其宣称的 16 GB 显存最低配置上没有独立测量,也没有针对 int8/NVFP4 量化、fp8 转换与 CPU 卸载所致质量下降的验证。多镜头一致性、扩散解码器相对 VAE 的优势以及时长预测器同样未获证实。一个小细节:Hugging Face 页面某个字段写着 2026 年 1 月 6 日,与 8 月 11 日的发布相矛盾,很可能是 LTX‑2 仓库的残留。超过 3300 万次的下载量指的是整个 LTX 家族,而非这一个模型。
- Perché pubblicarla
- 这是第一个权重可下载、且宣称性能位居前列的商用级视频音频模型,它把问题从「哪家 API 更便宜」推向「我在自己家里能跑什么」——对那些没有云预算却要做视频的读者来说,这是很实在的事。这条新闻也适合做一次诚实的编辑工作:数字全部来自厂商,许可证被讲成开放,但按 OSI 的定义并不是,而面向机器人的检查点则透露出这个行业想把这类模型带往何处。把已核实的与营销话术分开,正是我们能添上的价值。