Google Research представила набір агентів для довгих і зв'язних відео
24 вересня 2026 року в блозі Google Research вийшла стаття Automating coherent long-form video generation дослідників Єйла Сонга та Івень Сонг. У ній описано чотири дослідницькі системи, кожна з окремою статтею на arXiv. Вони працюють як шар оркестрації поверх моделей Gemini та Veo і, за словами Google, успадковують їхні механізми безпеки, зокрема водяний знак SynthID, а до готових відео застосовуються додаткові класифікатори. Системи – AI Video Co-Director, CANVAS, A²RD і VQQA – подано як набір, здатний створювати довгі відео зі збереженням сюжетної та візуальної зв'язності. Проте варто застерегти: кожну систему оцінювали окремо, у власній статті, і жоден із документів не вимірює, як чотири системи працюють разом в єдиному конвеєрі.
Co-Director (arXiv 2604.24842, 27 квітня 2026 року) – ієрархічний мультиагентний фреймворк, який за допомогою алгоритму багаторукого бандита обирає творчу стратегію, спосіб оповіді та естетичний архетип. Автори представили бенчмарк GenAD-Bench на основі 400 вигаданих рекламних сценаріїв і повідомляють про оцінку якості 81,4. Утім цей результат стосується коротких рекламних роликів, а не багатохвилинних історій, і сторонні дослідники його не відтворювали.
CANVAS (arXiv 2604.13452, 15 квітня 2026 року) зберігає постійну візуальну пам'ять про персонажів, місця та об'єкти. Порівняно з найкращим базовим рішенням на бенчмарках розкадровок система показує приріст +21,6% у безперервності тла, +9,6% в узгодженості персонажів і +7,6% в узгодженості об'єктів. Ці метрики стосуються послідовностей зображень, а не готових відео, тож їхня значущість для генерації довгих роликів лишається під питанням.
A²RD (arXiv 2605.06924, 7 травня 2026 року) використовує цикл Retrieve-Synthesize-Refine-Update, щоб генерувати відео сегмент за сегментом, і повідомляє про зростання узгодженості до 30% та сюжетної зв'язності до 20% порівняно з базовими рішеннями. Ці результати заявили самі автори (для A²RD їх підкріплюють оцінки людей), незалежно їх не відтворювали. Систему перевіряли на відкритих бенчмарках і на новому LVBench-C з відео тривалістю від однієї до десяти хвилин.
VQQA (arXiv 2603.12310, 12 березня 2026 року) за допомогою візуальних запитань і зауважень візуально-мовної моделі оптимізує промпти без доступу до самої моделі (за принципом чорної скриньки) і дає абсолютний приріст 11,57 пункту на T2V-CompBench та 8,43 на VBench2 порівняно з базовою генерацією.
У блозі показано десятихвилинне демонстраційне відео, але незрозуміло, яка комбінація систем його створила; сторонній аналіз (Superpower Daily) приписує його A²RD, проте першоджерело цього не підтверджує. До того ж усі цифри заявлені самими авторами, а статті – препринти на arXiv, тож надійність доказів ще належить перевірити. Ідеться про дослідницькі роботи, представлені на конференціях 2026 року, як-от COLM та EMNLP, а не про комерційний продукт.
Come Olya ha verificato questa notizia
- Verificato
- Прочитано оригінальний допис Google Research (24.09.2026): автори, чотири системи, 81,4 на GenAD-Bench, оркестрація поверх Gemini та Veo, SynthID і десятихвилинний фільм. Відкрито чотири анотації на arXiv (2604.24842, 2604.13452, 2605.06924, 2603.12310): звірено назви, авторів, дати подання та цифри. MarkTechPost (27.09.2026) незалежно підтверджує ті самі системи й цифри. Сторонній критичний аналіз вказав на обмеження оцінювання; ми потім звірили їх з анотаціями.
- Incertezze
- Кожну систему оцінено лише у власній статті: жоден документ не вимірює чотири системи разом як єдиний конвеєр, хоча блог подає їх як набір. Оцінка 81,4 у Co-Director стосується коротких рекламних роликів, а не багатохвилинних історій. Приріст CANVAS виміряно на розкадровках (зображеннях), а не на готових відео. Незрозуміло, яка система створила десятихвилинний фільм: Superpower Daily називає A²RD, але першоджерело цього не підтверджує. Цифри заявлені авторами й не відтворені; статті – препринти. Ми не перевіряли, чи справді код викладено на GitHub.
- Perché pubblicarla
- Робота стосується одного з найвідоміших обмежень відеогенераторів: утримувати персонажів і довкілля узгодженими хвилинами, а не секундами. Вона походить від великої лабораторії, з відкритими статтями та цифрами, які можна перевірити. До того ж її зручно читати без хайпу: вона дає змогу відокремити те, що справді виміряно (окремі компоненти, часто на коротких завданнях або розкадровках), від враження конвеєра, здатного зняти цілий фільм.
Fonti / Sources
- Google Research Blog — Automating coherent long-form video generation (Yale Song, Yiwen Song)
- arXiv 2605.06924 — A²RD: Agentic Autoregressive Diffusion for Long Video Consistency
- arXiv 2604.24842 — Co-Director: Agentic Generative Video Storytelling
- arXiv 2604.13452 — CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding