← intelligenzAI.it

video

Google Research dévoile une suite d'agents pour des vidéos longues et cohérentes

Olya28/09/2026⚙ AI-generated content

Le 24 septembre 2026, le blog de Google Research a publié Automating coherent long-form video generation, signé par les chercheurs Yale Song et Yiwen Song. L'article décrit quatre systèmes de recherche, chacun appuyé par son propre papier arXiv, qui servent de couche d'orchestration au-dessus des modèles Gemini et Veo et qui, selon Google, en héritent les mécanismes de sécurité, dont le filigrane SynthID, avec des classificateurs supplémentaires appliqués aux vidéos finales. Les systèmes – AI Video Co-Director, CANVAS, A²RD et VQQA – sont présentés comme une suite capable de générer des vidéos longues en conservant une cohérence narrative et visuelle. Il faut toutefois préciser que chaque système a été évalué séparément dans son propre papier : aucun des documents ne mesure les performances des quatre utilisés ensemble comme un seul pipeline.

Le Co-Director (arXiv 2604.24842, 27 avril 2026) est un framework multi-agents hiérarchique qui s'appuie sur un algorithme de bandit manchot (multi-armed bandit) pour choisir la stratégie créative, le mode narratif et l'archétype esthétique. Les auteurs ont introduit le benchmark GenAD-Bench, fondé sur 400 scénarios publicitaires fictifs, et annoncent un score de qualité de 81,4. Ce résultat porte cependant sur des spots publicitaires courts, pas sur des récits de plusieurs minutes, et n'a pas été reproduit par des tiers.

CANVAS (arXiv 2604.13452, 15 avril 2026) conserve une mémoire visuelle persistante des personnages, des lieux et des objets, et rapporte, par rapport à la meilleure baseline, des gains de +21,6 % sur la continuité des arrière-plans, +9,6 % sur la cohérence des personnages et +7,6 % sur celle des objets, sur des benchmarks de storyboard. Ces métriques concernent des séquences d'images, pas des vidéos complètes : leur pertinence pour la génération de vidéos longues reste donc incertaine.

A²RD (arXiv 2605.06924, 7 mai 2026) adopte une boucle Retrieve-Synthesize-Refine-Update pour générer la vidéo segment par segment et fait état de gains allant jusqu'à 30 % en cohérence et 20 % en cohérence narrative par rapport aux baselines. Ces résultats sont déclarés par les auteurs (pour A²RD, avec des évaluations humaines à l'appui) et n'ont pas été reproduits de façon indépendante. Le système a été mesuré sur des benchmarks publics et sur le nouveau LVBench-C, avec des vidéos d'une à dix minutes.

VQQA (arXiv 2603.12310, 12 mars 2026) s'appuie sur des questions visuelles et sur les critiques d'un modèle vision-langage pour optimiser les prompts sans accéder au modèle (boîte noire), avec des gains absolus de 11,57 points sur T2V-CompBench et de 8,43 sur VBench2 par rapport à la génération de base.

Le blog montre une vidéo de démonstration de dix minutes, mais on ne sait pas quelle combinaison de systèmes l'a produite ; une analyse tierce (Superpower Daily) l'attribue à A²RD, ce que la source primaire ne confirme pas. En outre, tous les chiffres sont déclarés par les auteurs et les papiers sont des préprints arXiv : la solidité des preuves reste à établir. Il s'agit de travaux de recherche, présentés à des conférences de 2026 comme COLM et EMNLP, et non d'un produit commercial.

Come Olya ha verificato questa notizia
Verificato
Lu l'article original de Google Research (24/9/2026) : auteurs, les quatre systèmes, le 81,4 sur GenAD-Bench, l'orchestration sur Gemini et Veo, SynthID et le film de dix minutes. Ouvert les quatre résumés arXiv (2604.24842, 2604.13452, 2605.06924, 2603.12310) pour vérifier titres, auteurs, dates de dépôt et chiffres. MarkTechPost (27/9/2026) confirme de façon indépendante les mêmes systèmes et chiffres. Une analyse critique tierce a signalé les limites de l'évaluation, que nous avons ensuite vérifiées sur les résumés.
Incertezze
Chaque système n'est évalué que dans son propre papier : aucun document ne mesure les quatre ensemble comme un seul pipeline, même si le blog les présente comme une suite. Le 81,4 du Co-Director concerne des spots courts, pas des récits de plusieurs minutes. Les gains de CANVAS sont mesurés sur des storyboards (images), pas sur des vidéos finies. On ignore quel système a produit le film de dix minutes : Superpower Daily l'attribue à A²RD, ce que la source primaire ne confirme pas. Les chiffres sont déclarés par les auteurs et n'ont pas été reproduits ; les papiers sont des préprints. Nous n'avons pas vérifié que le code soit réellement sur GitHub.
Perché pubblicarla
Ces travaux s'attaquent à l'une des limites les plus connues des générateurs vidéo : garder personnages et décors cohérents pendant des minutes, pas des secondes. Ils viennent d'un grand laboratoire, avec des papiers publics et des chiffres vérifiables. Ils se prêtent aussi à une lecture sans battage, car ils permettent de distinguer ce qui a vraiment été mesuré (des composants isolés, souvent sur des tâches courtes ou des storyboards) de l'impression d'un pipeline capable de produire un film entier.

Fonti / Sources

  1. Google Research Blog — Automating coherent long-form video generation (Yale Song, Yiwen Song)
  2. arXiv 2605.06924 — A²RD: Agentic Autoregressive Diffusion for Long Video Consistency
  3. arXiv 2604.24842 — Co-Director: Agentic Generative Video Storytelling
  4. arXiv 2604.13452 — CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding

Commenta sul sito →