Google Research prezentuje zestaw agentów do długich, spójnych filmów
24 września 2026 roku na blogu Google Research ukazał się tekst Automating coherent long-form video generation autorstwa badaczy Yale Songa i Yiwen Song. Opisuje on cztery systemy badawcze, każdy oparty na osobnej publikacji w arXiv, które działają jako warstwa orkiestracji nad modelami Gemini i Veo. Według Google dziedziczą one mechanizmy bezpieczeństwa tych modeli, w tym znak wodny SynthID, a do gotowych filmów stosowane są dodatkowe klasyfikatory. Systemy – AI Video Co-Director, CANVAS, A²RD i VQQA – przedstawiono jako zestaw zdolny do generowania długich filmów z zachowaniem spójności fabularnej i wizualnej. Trzeba jednak zaznaczyć, że każdy system oceniano osobno, we własnej publikacji: żaden z dokumentów nie mierzy wyników całej czwórki działającej razem jako jeden pipeline.
Co-Director (arXiv 2604.24842, 27 kwietnia 2026) to hierarchiczny framework wieloagentowy, który za pomocą algorytmu wielorękiego bandyty (multi-armed bandit) wybiera strategię twórczą, tryb narracji i archetyp estetyczny. Autorzy wprowadzili benchmark GenAD-Bench, oparty na 400 fikcyjnych scenariuszach reklamowych, i podają wynik jakości 81,4. Dotyczy on jednak krótkich spotów reklamowych, a nie kilkuminutowych opowieści, i nie został powtórzony przez niezależne zespoły.
CANVAS (arXiv 2604.13452, 15 kwietnia 2026) utrzymuje trwałą pamięć wizualną postaci, miejsc i obiektów. Względem najlepszego punktu odniesienia raportuje na benchmarkach storyboardowych poprawę o 21,6% w ciągłości tła, o 9,6% w spójności postaci i o 7,6% w spójności obiektów. Te miary dotyczą sekwencji obrazów, a nie pełnych filmów, więc ich znaczenie dla generowania długich wideo pozostaje niepewne.
A²RD (arXiv 2605.06924, 7 maja 2026) wykorzystuje pętlę Retrieve-Synthesize-Refine-Update, by generować film segment po segmencie, i wskazuje na wzrost spójności do 30% oraz spójności fabularnej do 20% w porównaniu z punktami odniesienia. Wyniki podają sami autorzy (w przypadku A²RD popierając je ocenami ludzi) i nie zostały one niezależnie powtórzone. System testowano na publicznych benchmarkach oraz na nowym LVBench-C, z filmami trwającymi od jednej do dziesięciu minut.
VQQA (arXiv 2603.12310, 12 marca 2026) wykorzystuje pytania wizualne i krytykę modelu wizyjno-językowego do optymalizacji promptów bez dostępu do samego modelu (czarna skrzynka), osiągając bezwzględną poprawę o 11,57 punktu na T2V-CompBench i o 8,43 na VBench2 względem generowania bazowego.
Blog pokazuje dziesięciominutowy film demonstracyjny, ale nie wiadomo, jakie połączenie systemów go wytworzyło; zewnętrzna analiza (Superpower Daily) przypisuje go A²RD, czego jednak źródło pierwotne nie potwierdza. Ponadto wszystkie liczby podają sami autorzy, a publikacje to preprinty w arXiv, więc solidność dowodów dopiero trzeba sprawdzić. Są to prace badawcze, prezentowane na konferencjach w 2026 roku, takich jak COLM i EMNLP, a nie produkt komercyjny.
Come Olya ha verificato questa notizia
- Verificato
- Przeczytany oryginalny wpis Google Research (24.09.2026): autorzy, cztery systemy, 81,4 na GenAD-Bench, orkiestracja nad Gemini i Veo, SynthID i dziesięciominutowy film. Otwarte cztery streszczenia z arXiv (2604.24842, 2604.13452, 2605.06924, 2603.12310) w celu sprawdzenia tytułów, autorów, dat zgłoszenia i liczb. MarkTechPost (27.09.2026) niezależnie potwierdza te same systemy i liczby. Krytyczna analiza zewnętrzna wskazała ograniczenia ewaluacji, które następnie sprawdziliśmy w streszczeniach.
- Incertezze
- Każdy system oceniono tylko we własnej publikacji: żaden dokument nie mierzy czwórki razem jako jednego pipeline'u, choć blog przedstawia je jako zestaw. Wynik 81,4 Co-Directora dotyczy krótkich spotów, nie kilkuminutowych opowieści. Zyski CANVAS zmierzono na storyboardach (obrazach), nie na gotowych filmach. Nie wiadomo, który system wytworzył dziesięciominutowy film: Superpower Daily wskazuje A²RD, ale źródło pierwotne tego nie potwierdza. Liczby podają sami autorzy i nikt ich nie powtórzył; publikacje to preprinty. Nie sprawdziliśmy, czy kod rzeczywiście jest na GitHubie.
- Perché pubblicarla
- Praca dotyka jednego z najbardziej znanych ograniczeń generatorów wideo: utrzymania spójności postaci i otoczenia przez minuty, a nie sekundy. Pochodzi z dużego laboratorium, z publicznymi publikacjami i sprawdzalnymi liczbami. Nadaje się też do lektury bez hype'u, bo pozwala oddzielić to, co naprawdę zmierzono (pojedyncze komponenty, często na krótkich zadaniach lub storyboardach), od wrażenia, że istnieje pipeline zdolny zrobić cały film.
Fonti / Sources
- Google Research Blog — Automating coherent long-form video generation (Yale Song, Yiwen Song)
- arXiv 2605.06924 — A²RD: Agentic Autoregressive Diffusion for Long Video Consistency
- arXiv 2604.24842 — Co-Director: Agentic Generative Video Storytelling
- arXiv 2604.13452 — CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding