Google Research onthult een reeks agents voor lange, samenhangende video's
Op 24 september 2026 publiceerde de blog van Google Research het stuk Automating coherent long-form video generation, geschreven door onderzoekers Yale Song en Yiwen Song. Het beschrijft vier onderzoekssystemen, elk onderbouwd met een eigen arXiv-paper, die als orkestratielaag bovenop de modellen Gemini en Veo werken. Volgens Google nemen ze de veiligheidsmechanismen van die modellen over, waaronder het SynthID-watermerk, en worden er extra classifiers op de uiteindelijke video's toegepast. De systemen – AI Video Co-Director, CANVAS, A²RD en VQQA – worden gepresenteerd als een suite die lange video's kan maken met behoud van verhalende en visuele samenhang. Wel een kanttekening: elk systeem is apart geëvalueerd in zijn eigen paper, en geen van de documenten meet hoe de vier samen presteren als één pipeline.
De Co-Director (arXiv 2604.24842, 27 april 2026) is een hiërarchisch multi-agentframework dat met een multi-armed bandit-algoritme de creatieve strategie, de verteltrant en het esthetische archetype kiest. De auteurs introduceerden de benchmark GenAD-Bench, gebaseerd op 400 fictieve reclamescenario's, en melden een kwaliteitsscore van 81,4. Dat resultaat gaat echter over korte reclamespots, niet over verhalen van meerdere minuten, en het is niet door derden gerepliceerd.
CANVAS (arXiv 2604.13452, 15 april 2026) houdt een blijvend visueel geheugen bij van personages, locaties en objecten. Ten opzichte van de beste baseline meldt het op storyboardbenchmarks verbeteringen van +21,6% in achtergrondcontinuïteit, +9,6% in consistentie van personages en +7,6% in consistentie van objecten. Deze metingen gaan over beeldreeksen, niet over complete video's, dus hoe relevant ze zijn voor het genereren van lange video's blijft onzeker.
A²RD (arXiv 2605.06924, 7 mei 2026) gebruikt een Retrieve-Synthesize-Refine-Update-lus om video segment voor segment te genereren en meldt tot 30% meer consistentie en 20% meer verhalende samenhang dan de baselines. De resultaten komen van de auteurs zelf (voor A²RD ondersteund door menselijke beoordelingen) en zijn niet onafhankelijk gerepliceerd. Het systeem is gemeten op openbare benchmarks en op het nieuwe LVBench-C, met video's van één tot tien minuten.
VQQA (arXiv 2603.12310, 12 maart 2026) gebruikt visuele vragen en de kritiek van een vision-languagemodel om prompts te optimaliseren zonder toegang tot het model zelf (black-box), met absolute verbeteringen van 11,57 punten op T2V-CompBench en 8,43 op VBench2 ten opzichte van de basisgeneratie.
De blog toont een demovideo van tien minuten, maar het is onduidelijk welke combinatie van systemen die heeft gemaakt; een analyse van derden (Superpower Daily) schrijft hem toe aan A²RD, maar de primaire bron bevestigt dat niet. Bovendien zijn alle cijfers door de auteurs zelf gemeld en zijn de papers arXiv-preprints, dus hoe stevig het bewijs is, moet nog blijken. Het gaat om onderzoekswerk, gepresenteerd op conferenties in 2026 zoals COLM en EMNLP, niet om een commercieel product.
Come Olya ha verificato questa notizia
- Verificato
- Het oorspronkelijke bericht van Google Research gelezen (24-9-2026): auteurs, de vier systemen, de 81,4 op GenAD-Bench, de orkestratie over Gemini en Veo, SynthID en de film van tien minuten. De vier arXiv-abstracts (2604.24842, 2604.13452, 2605.06924, 2603.12310) geopend om titels, auteurs, indieningsdata en cijfers te controleren. MarkTechPost (27-9-2026) bevestigt onafhankelijk dezelfde systemen en cijfers. Een kritische analyse van derden wees op de beperkingen van de evaluatie; die hebben we daarna aan de abstracts getoetst.
- Incertezze
- Elk systeem is alleen in zijn eigen paper geëvalueerd: geen enkel document meet de vier samen als één pipeline, ook al presenteert de blog ze als suite. De 81,4 van de Co-Director gaat over korte reclamespots, niet over verhalen van minuten. De winst van CANVAS is gemeten op storyboards (beelden), niet op afgewerkte video's. Onduidelijk is welk systeem de film van tien minuten heeft gemaakt: Superpower Daily noemt A²RD, maar de primaire bron bevestigt dat niet. De cijfers zijn door de auteurs gemeld en niet gerepliceerd; de papers zijn preprints. We hebben niet gecontroleerd of de code echt op GitHub staat.
- Perché pubblicarla
- Het pakt een van de bekendste beperkingen van videogeneratoren aan: personages en omgevingen minutenlang consistent houden in plaats van secondenlang. Het komt van een groot lab, met openbare papers en controleerbare cijfers. Het leent zich ook voor een nuchtere lezing zonder hype, omdat het scheidt wat echt is gemeten (losse componenten, vaak op korte taken of storyboards) van de indruk van een pipeline die een hele film kan maken.
Fonti / Sources
- Google Research Blog — Automating coherent long-form video generation (Yale Song, Yiwen Song)
- arXiv 2605.06924 — A²RD: Agentic Autoregressive Diffusion for Long Video Consistency
- arXiv 2604.24842 — Co-Director: Agentic Generative Video Storytelling
- arXiv 2604.13452 — CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding