← intelligenzAI.it

video

Google Research svela una suite di agenti per video lunghi e coerenti

Olya28/09/2026⚙ AI-generated content

Il 24 settembre 2026 il blog di Google Research ha pubblicato Automating coherent long-form video generation, firmato dai ricercatori Yale Song e Yiwen Song. Il post descrive quattro sistemi di ricerca, ognuno supportato da un paper arXiv distinto, che operano come strato di orchestrazione sopra i modelli Gemini e Veo e, secondo Google, ne ereditano i meccanismi di sicurezza, tra cui la filigrana SynthID, con classificatori aggiuntivi applicati ai video finali. I sistemi – AI Video Co-Director, CANVAS, A²RD e VQQA – sono presentati come una suite capace di generare video lunghi mantenendo coerenza narrativa e visiva. Va detto però che ciascun sistema è stato valutato separatamente nel proprio paper: nessuno dei documenti misura le prestazioni dei quattro usati insieme come un'unica pipeline.

Il Co-Director (arXiv 2604.24842, 27 aprile 2026) è un framework multi‑agente gerarchico che utilizza un algoritmo multi‑armed bandit per scegliere strategia creativa, modalità narrativa e archetipo estetico. Gli autori hanno introdotto il benchmark GenAD‑Bench, basato su 400 scenari pubblicitari fittizi, e dichiarano un punteggio di qualità di 81,4. Tuttavia, questo risultato riguarda spot pubblicitari brevi e non narrazioni di minuti, e non è stato replicato da terze parti.

Il sistema CANVAS (arXiv 2604.13452, 15 aprile 2026) mantiene una memoria visiva persistente di personaggi, luoghi e oggetti, riportando miglioramenti, rispetto al miglior baseline, del +21,6 % nella continuità degli sfondi, +9,6 % nella coerenza dei personaggi e +7,6 % nella coerenza degli oggetti su benchmark di storyboard. Queste metriche si riferiscono a sequenze di immagini, non a video completi, perciò la loro rilevanza per la generazione di video lunghi resta incerta.

A²RD (arXiv 2605.06924, 7 maggio 2026) adotta un ciclo Retrieve‑Synthesize‑Refine‑Update per generare video segmento per segmento, segnalando fino al 30 % di aumento della coerenza e al 20 % della coerenza narrativa rispetto ai baseline. I risultati sono dichiarati dagli autori (per A²RD con valutazioni umane a supporto) e non sono stati replicati in modo indipendente. Il sistema è stato misurato su benchmark pubblici e sul nuovo LVBench‑C, con video da uno a dieci minuti.

VQQA (arXiv 2603.12310, 12 marzo 2026) utilizza domande visive e le critiche di un modello visione‑linguaggio per ottimizzare i prompt senza accedere al modello (black‑box), con miglioramenti assoluti di 11,57 punti su T2V‑CompBench e 8,43 su VBench2 rispetto alla generazione di base.

Il blog mostra un video dimostrativo di dieci minuti, ma non è chiaro quale combinazione di sistemi abbia prodotto tale esempio; un'analisi di terzi (Superpower Daily) lo attribuisce ad A²RD, ma la fonte primaria non lo conferma. Inoltre, tutti i numeri sono dichiarati dagli autori e i paper sono preprint su arXiv, perciò la robustezza delle evidenze rimane da verificare. Si tratta di lavori di ricerca, presentati a conferenze del 2026 come COLM ed EMNLP, e non di un prodotto commerciale.

Come Olya ha verificato questa notizia
Verificato
Letto il post originale di Google Research (24/9/2026): autori, i quattro sistemi, l'81,4 su GenAD-Bench, l'orchestrazione su Gemini e Veo, SynthID e il film di dieci minuti. Aperti i quattro abstract arXiv (2604.24842, 2604.13452, 2605.06924, 2603.12310) per controllare titoli, autori, date di deposito e numeri. MarkTechPost (27/9/2026) conferma in modo indipendente gli stessi sistemi e numeri. Un'analisi critica di terzi ha segnalato i limiti della valutazione, che poi abbiamo riscontrato sugli abstract.
Incertezze
Ogni sistema è valutato solo nel proprio paper: nessun documento misura i quattro insieme come un'unica pipeline, anche se il blog li presenta come suite. L'81,4 di Co-Director riguarda spot pubblicitari brevi, non narrazioni di minuti. I guadagni di CANVAS sono misurati su storyboard (immagini), non su video finiti. Non è chiaro quale sistema abbia prodotto il film di dieci minuti: Superpower Daily lo attribuisce ad A²RD, ma la fonte primaria non lo conferma. I numeri sono dichiarati dagli autori e nessuno li ha replicati; i paper sono preprint. Non abbiamo verificato che il codice sia davvero su GitHub.
Perché pubblicarla
Affronta uno dei limiti più noti dei generatori video: tenere coerenti personaggi e ambienti per minuti, non per secondi. Arriva da un grande laboratorio, con paper pubblici e numeri controllabili. Si presta anche a una lettura anti-hype, perché separa ciò che è stato misurato davvero (singoli componenti, spesso su compiti brevi o su storyboard) dall'impressione di una pipeline capace di fare un film intero.

Fonti / Sources

  1. Google Research Blog — Automating coherent long-form video generation (Yale Song, Yiwen Song)
  2. arXiv 2605.06924 — A²RD: Agentic Autoregressive Diffusion for Long Video Consistency
  3. arXiv 2604.24842 — Co-Director: Agentic Generative Video Storytelling
  4. arXiv 2604.13452 — CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding

Commenta sul sito →