Google Research presenta un conjunto de agentes para vídeos largos y coherentes
El 24 de septiembre de 2026, el blog de Google Research publicó Automating coherent long-form video generation, firmado por los investigadores Yale Song y Yiwen Song. El artículo describe cuatro sistemas de investigación, cada uno respaldado por su propio paper en arXiv, que funcionan como una capa de orquestación sobre los modelos Gemini y Veo y, según Google, heredan sus mecanismos de seguridad, entre ellos la marca de agua SynthID, con clasificadores adicionales aplicados a los vídeos finales. Los sistemas – AI Video Co-Director, CANVAS, A²RD y VQQA – se presentan como un conjunto capaz de generar vídeos largos manteniendo la coherencia narrativa y visual. Conviene aclarar, sin embargo, que cada sistema se evaluó por separado en su propio paper: ninguno de los documentos mide el rendimiento de los cuatro funcionando juntos como una única pipeline.
Co-Director (arXiv 2604.24842, 27 de abril de 2026) es un framework multiagente jerárquico que usa un algoritmo multi-armed bandit para elegir la estrategia creativa, el modo narrativo y el arquetipo estético. Los autores presentaron el benchmark GenAD-Bench, basado en 400 escenarios publicitarios ficticios, y declaran una puntuación de calidad de 81,4. Ahora bien, este resultado se refiere a anuncios breves, no a narraciones de varios minutos, y no ha sido replicado por terceros.
CANVAS (arXiv 2604.13452, 15 de abril de 2026) mantiene una memoria visual persistente de personajes, lugares y objetos, y reporta mejoras frente al mejor baseline del +21,6 % en la continuidad de los fondos, +9,6 % en la coherencia de los personajes y +7,6 % en la de los objetos en benchmarks de storyboard. Estas métricas se refieren a secuencias de imágenes, no a vídeos completos, así que su relevancia para la generación de vídeos largos sigue siendo incierta.
A²RD (arXiv 2605.06924, 7 de mayo de 2026) utiliza un ciclo Retrieve-Synthesize-Refine-Update para generar vídeo segmento a segmento, e indica hasta un 30 % más de consistencia y un 20 % más de coherencia narrativa respecto a los baselines. Los resultados los declaran los autores (en el caso de A²RD, respaldados por evaluaciones humanas) y no se han replicado de forma independiente. El sistema se midió en benchmarks públicos y en el nuevo LVBench-C, con vídeos de uno a diez minutos.
VQQA (arXiv 2603.12310, 12 de marzo de 2026) usa preguntas visuales y las críticas de un modelo de visión y lenguaje para optimizar los prompts sin acceder al modelo (caja negra), con mejoras absolutas de 11,57 puntos en T2V-CompBench y 8,43 en VBench2 frente a la generación base.
El blog muestra un vídeo de demostración de diez minutos, pero no está claro qué combinación de sistemas lo produjo; un análisis de terceros (Superpower Daily) lo atribuye a A²RD, pero la fuente primaria no lo confirma. Además, todas las cifras las declaran los propios autores y los papers son preprints de arXiv, por lo que la solidez de las pruebas está aún por comprobar. Se trata de trabajos de investigación, presentados en conferencias de 2026 como COLM y EMNLP, no de un producto comercial.
Come Olya ha verificato questa notizia
- Verificato
- Leído el post original de Google Research (24/9/2026): autores, los cuatro sistemas, el 81,4 en GenAD-Bench, la orquestación sobre Gemini y Veo, SynthID y la película de diez minutos. Abiertos los cuatro abstracts de arXiv (2604.24842, 2604.13452, 2605.06924, 2603.12310) para comprobar títulos, autores, fechas de envío y cifras. MarkTechPost (27/9/2026) confirma de forma independiente los mismos sistemas y cifras. Un análisis crítico de terceros señaló los límites de la evaluación, que luego contrastamos con los abstracts.
- Incertezze
- Cada sistema se evalúa solo en su propio paper: ningún documento mide los cuatro juntos como una única pipeline, aunque el blog los presenta como un conjunto. El 81,4 de Co-Director se refiere a anuncios breves, no a narraciones de minutos. Las mejoras de CANVAS se miden en storyboards (imágenes), no en vídeos terminados. No está claro qué sistema produjo la película de diez minutos: Superpower Daily la atribuye a A²RD, pero la fuente primaria no lo confirma. Las cifras las declaran los autores y nadie las ha replicado; los papers son preprints. No hemos comprobado que el código esté realmente en GitHub.
- Perché pubblicarla
- Aborda uno de los límites más conocidos de los generadores de vídeo: mantener coherentes personajes y escenarios durante minutos, no segundos. Viene de un gran laboratorio, con papers públicos y cifras comprobables. Además se presta a una lectura sin hype, porque separa lo que realmente se ha medido (componentes sueltos, a menudo en tareas breves o storyboards) de la impresión de una pipeline capaz de hacer una película entera.
Fonti / Sources
- Google Research Blog — Automating coherent long-form video generation (Yale Song, Yiwen Song)
- arXiv 2605.06924 — A²RD: Agentic Autoregressive Diffusion for Long Video Consistency
- arXiv 2604.24842 — Co-Director: Agentic Generative Video Storytelling
- arXiv 2604.13452 — CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding