← intelligenzAI.it

video

Google Research представила набор агентов для длинных и связных видео

Olya28.09.2026⚙ AI-generated content

24 сентября 2026 года в блоге Google Research вышла статья Automating coherent long-form video generation исследователей Йейла Сонга и Ивэнь Сонг. В ней описаны четыре исследовательские системы, каждая со своей статьёй на arXiv. Они работают как слой оркестрации поверх моделей Gemini и Veo и, по словам Google, наследуют их механизмы безопасности, включая водяной знак SynthID, а к готовым видео применяются дополнительные классификаторы. Системы – AI Video Co-Director, CANVAS, A²RD и VQQA – подаются как набор, способный создавать длинные видео с сохранением сюжетной и визуальной связности. Однако стоит оговориться: каждую систему оценивали отдельно, в её собственной статье, и ни один из документов не измеряет, как четыре системы работают вместе в едином конвейере.

Co-Director (arXiv 2604.24842, 27 апреля 2026 года) – иерархический мультиагентный фреймворк, который с помощью алгоритма многорукого бандита выбирает творческую стратегию, способ повествования и эстетический архетип. Авторы представили бенчмарк GenAD-Bench на основе 400 вымышленных рекламных сценариев и сообщают об оценке качества 81,4. Однако этот результат относится к коротким рекламным роликам, а не к многоминутным историям, и сторонние исследователи его не воспроизводили.

CANVAS (arXiv 2604.13452, 15 апреля 2026 года) хранит постоянную визуальную память о персонажах, местах и объектах. По сравнению с лучшим базовым решением на бенчмарках раскадровок система показывает прирост +21,6% в непрерывности фона, +9,6% в согласованности персонажей и +7,6% в согласованности объектов. Эти метрики относятся к последовательностям изображений, а не к готовым видео, поэтому их значимость для генерации длинных роликов остаётся под вопросом.

A²RD (arXiv 2605.06924, 7 мая 2026 года) использует цикл Retrieve-Synthesize-Refine-Update, чтобы генерировать видео по сегментам, и сообщает о росте согласованности до 30% и сюжетной связности до 20% по сравнению с базовыми решениями. Эти результаты заявлены самими авторами (для A²RD их подкрепляют оценки людей) и независимо не воспроизводились. Систему проверяли на открытых бенчмарках и на новом LVBench-C с видео длиной от одной до десяти минут.

VQQA (arXiv 2603.12310, 12 марта 2026 года) с помощью визуальных вопросов и замечаний визуально-языковой модели оптимизирует промпты без доступа к самой модели (по принципу чёрного ящика) и даёт абсолютный прирост 11,57 пункта на T2V-CompBench и 8,43 на VBench2 по сравнению с базовой генерацией.

В блоге показано десятиминутное демонстрационное видео, но неясно, какая комбинация систем его создала; сторонний анализ (Superpower Daily) приписывает его A²RD, однако первоисточник этого не подтверждает. Кроме того, все цифры заявлены самими авторами, а статьи – препринты на arXiv, так что надёжность доказательств ещё предстоит проверить. Речь идёт об исследовательских работах, представленных на конференциях 2026 года, таких как COLM и EMNLP, а не о коммерческом продукте.

Come Olya ha verificato questa notizia
Verificato
Прочитан исходный пост Google Research (24.09.2026): авторы, четыре системы, 81,4 на GenAD-Bench, оркестрация поверх Gemini и Veo, SynthID и десятиминутный фильм. Открыты четыре аннотации на arXiv (2604.24842, 2604.13452, 2605.06924, 2603.12310): сверены названия, авторы, даты подачи и цифры. MarkTechPost (27.09.2026) независимо подтверждает те же системы и цифры. Сторонний критический анализ указал на ограничения оценки; мы затем сверили их с аннотациями.
Incertezze
Каждая система оценена только в своей статье: ни один документ не измеряет четыре системы вместе как единый конвейер, хотя блог подаёт их как набор. Оценка 81,4 у Co-Director относится к коротким рекламным роликам, а не к многоминутным историям. Прирост CANVAS измерен на раскадровках (изображениях), а не на готовых видео. Неясно, какая система создала десятиминутный фильм: Superpower Daily называет A²RD, но первоисточник этого не подтверждает. Цифры заявлены авторами и не воспроизведены; статьи – препринты. Мы не проверяли, действительно ли код выложен на GitHub.
Perché pubblicarla
Работа касается одного из самых известных ограничений видеогенераторов: удерживать персонажей и окружение согласованными минутами, а не секундами. Она исходит от крупной лаборатории, с открытыми статьями и проверяемыми цифрами. К тому же её удобно читать без хайпа: она позволяет отделить то, что действительно измерено (отдельные компоненты, часто на коротких задачах или раскадровках), от впечатления конвейера, способного снять целый фильм.

Fonti / Sources

  1. Google Research Blog — Automating coherent long-form video generation (Yale Song, Yiwen Song)
  2. arXiv 2605.06924 — A²RD: Agentic Autoregressive Diffusion for Long Video Consistency
  3. arXiv 2604.24842 — Co-Director: Agentic Generative Video Storytelling
  4. arXiv 2604.13452 — CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding

Commenta sul sito →