← intelligenzAI.it

video

Google Research 推出一套用于生成连贯长视频的智能体

Olya2026/9/28⚙ AI-generated content

2026 年 9 月 24 日,Google Research 博客发布了研究人员 Yale Song 和 Yiwen Song 撰写的文章《Automating coherent long-form video generation》。文章介绍了四个研究系统,每个都有一篇独立的 arXiv 论文作为支撑。它们作为编排层运行在 Gemini 和 Veo 模型之上;据 Google 称,这些系统沿用了底层模型的安全机制,包括 SynthID 水印,并对最终视频额外应用了分类器。AI Video Co-Director、CANVAS、A²RD 和 VQQA 这四个系统被包装成一套能够生成长视频、同时保持叙事和画面连贯的“工具组合”。但需要指出的是,每个系统都是在各自的论文中单独评估的:没有任何一份文档衡量过四者合为一条流水线时的表现。

Co-Director(arXiv 2604.24842,2026 年 4 月 27 日)是一个分层多智能体框架,利用多臂老虎机算法来选择创意策略、叙事方式和美学原型。作者提出了基于 400 个虚构广告场景的基准 GenAD-Bench,并报告质量得分为 81.4。不过,这一结果针对的是短广告片,而不是长达数分钟的叙事,也没有经过第三方复现。

CANVAS(arXiv 2604.13452,2026 年 4 月 15 日)为角色、场景和物体维持持续的视觉记忆。在分镜基准测试中,它相对最佳基线报告了背景连续性 +21.6%、角色一致性 +9.6%、物体一致性 +7.6% 的提升。这些指标针对的是图像序列,而非完整视频,因此它们对长视频生成有多大意义仍不确定。

A²RD(arXiv 2605.06924,2026 年 5 月 7 日)采用“检索—合成—精修—更新”(Retrieve-Synthesize-Refine-Update)循环逐段生成视频,报告称相比基线一致性最多提升 30%,叙事连贯性最多提升 20%。这些结果由作者自行报告(A²RD 有人工评估作为佐证),尚未经过独立复现。该系统在公开基准以及新的 LVBench-C 上进行了测试,视频时长从一分钟到十分钟不等。

VQQA(arXiv 2603.12310,2026 年 3 月 12 日)借助视觉问题和视觉语言模型的点评来优化提示词,无需访问模型内部(黑盒方式),相比基础生成在 T2V-CompBench 上绝对提升 11.57 分,在 VBench2 上提升 8.43 分。

博客展示了一段十分钟的演示视频,但不清楚它是由哪些系统组合生成的;第三方分析(Superpower Daily)将其归于 A²RD,但原始来源并未证实这一点。此外,所有数字均由作者自行报告,论文也都是 arXiv 预印本,因此证据是否扎实仍有待检验。这些是在 COLM、EMNLP 等 2026 年学术会议上发表的研究成果,而不是商业产品。

Come Olya ha verificato questa notizia
Verificato
阅读了 Google Research 的原始博文(2026 年 9 月 24 日):作者、四个系统、GenAD-Bench 上的 81.4 分、基于 Gemini 和 Veo 的编排、SynthID 以及十分钟的影片。打开了四篇 arXiv 摘要(2604.24842、2604.13452、2605.06924、2603.12310),核对了标题、作者、提交日期和数据。MarkTechPost(2026 年 9 月 27 日)独立报道了相同的系统和数据。一篇第三方批评性分析指出了评估的局限,我们随后对照摘要进行了核实。
Incertezze
每个系统只在自己的论文中接受评估:尽管博客把它们作为一套组合来介绍,但没有任何文档把四者作为一条流水线来衡量。Co-Director 的 81.4 分针对的是短广告片,而非数分钟的叙事。CANVAS 的提升是在分镜(图像)上测得的,而非成品视频。博客中的十分钟影片由哪个系统生成尚不清楚:Superpower Daily 认为是 A²RD,但原始来源并未证实。数据由作者自行报告,未经复现;论文均为预印本。我们没有核实代码是否真的已在 GitHub 上公开。
Perché pubblicarla
这项工作针对视频生成器最广为人知的局限之一:让角色和场景在几分钟而不是几秒钟内保持一致。它出自一家大型实验室,附有公开论文和可核查的数据。它也适合不带炒作地解读,因为可以把真正测量过的内容(单个组件,往往基于短任务或分镜)与“一条能拍出完整电影的流水线”这种印象区分开来。

Fonti / Sources

  1. Google Research Blog — Automating coherent long-form video generation (Yale Song, Yiwen Song)
  2. arXiv 2605.06924 — A²RD: Agentic Autoregressive Diffusion for Long Video Consistency
  3. arXiv 2604.24842 — Co-Director: Agentic Generative Video Storytelling
  4. arXiv 2604.13452 — CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding

Commenta sul sito →