← intelligenzAI.it

video

Google Research stellt eine Agenten-Suite für lange, kohärente Videos vor

Olya28.9.2026⚙ AI-generated content

Am 24. September 2026 veröffentlichte der Blog von Google Research den Beitrag Automating coherent long-form video generation der Forscher Yale Song und Yiwen Song. Beschrieben werden vier Forschungssysteme, jedes mit eigenem arXiv-Paper, die als Orchestrierungsschicht über den Modellen Gemini und Veo arbeiten. Laut Google übernehmen sie deren Sicherheitsmechanismen, darunter das SynthID-Wasserzeichen, und auf die fertigen Videos werden zusätzliche Klassifikatoren angewendet. Die Systeme – AI Video Co-Director, CANVAS, A²RD und VQQA – werden als Suite vorgestellt, die lange Videos mit erzählerischer und visueller Kohärenz erzeugen kann. Allerdings wurde jedes System getrennt in seinem eigenen Paper bewertet: Keines der Dokumente misst, wie die vier zusammen als eine einzige Pipeline abschneiden.

Der Co-Director (arXiv 2604.24842, 27. April 2026) ist ein hierarchisches Multi-Agenten-Framework, das mit einem Multi-Armed-Bandit-Algorithmus kreative Strategie, Erzählmodus und ästhetischen Archetyp auswählt. Die Autoren haben den Benchmark GenAD-Bench mit 400 fiktiven Werbeszenarien eingeführt und geben einen Qualitätswert von 81,4 an. Dieses Ergebnis betrifft jedoch kurze Werbespots, keine minutenlangen Erzählungen, und wurde von Dritten nicht repliziert.

CANVAS (arXiv 2604.13452, 15. April 2026) führt ein dauerhaftes visuelles Gedächtnis für Figuren, Orte und Objekte. Gegenüber der besten Baseline meldet es auf Storyboard-Benchmarks Verbesserungen von +21,6 % bei der Hintergrundkontinuität, +9,6 % bei der Figurenkonsistenz und +7,6 % bei der Objektkonsistenz. Diese Metriken beziehen sich auf Bildfolgen, nicht auf vollständige Videos; ihre Aussagekraft für lange Videos bleibt daher unklar.

A²RD (arXiv 2605.06924, 7. Mai 2026) nutzt eine Schleife aus Retrieve, Synthesize, Refine und Update, um Videos Segment für Segment zu erzeugen, und meldet gegenüber den Baselines bis zu 30 % mehr Konsistenz und 20 % mehr erzählerische Kohärenz. Die Ergebnisse stammen von den Autoren selbst (bei A²RD gestützt durch menschliche Bewertungen) und wurden nicht unabhängig repliziert. Gemessen wurde auf öffentlichen Benchmarks und auf dem neuen LVBench-C mit Videos von einer bis zehn Minuten Länge.

VQQA (arXiv 2603.12310, 12. März 2026) optimiert Prompts mithilfe visueller Fragen und der Kritik eines Vision-Language-Modells, ohne Zugriff auf das Modell selbst (Black-Box), und erreicht gegenüber der Basisgenerierung absolute Verbesserungen von 11,57 Punkten auf T2V-CompBench und 8,43 auf VBench2.

Der Blog zeigt ein zehnminütiges Demovideo, doch es bleibt offen, welche Kombination von Systemen es erzeugt hat; eine Analyse von Dritten (Superpower Daily) schreibt es A²RD zu, die Primärquelle bestätigt das aber nicht. Zudem sind alle Zahlen Eigenangaben der Autoren, und die Paper sind arXiv-Preprints – wie belastbar die Belege sind, muss sich also noch zeigen. Es handelt sich um Forschungsarbeiten, vorgestellt auf Konferenzen des Jahres 2026 wie COLM und EMNLP, nicht um ein kommerzielles Produkt.

Come Olya ha verificato questa notizia
Verificato
Den Originalbeitrag von Google Research gelesen (24.9.2026): Autoren, die vier Systeme, die 81,4 auf GenAD-Bench, die Orchestrierung über Gemini und Veo, SynthID und den zehnminütigen Film. Die vier arXiv-Abstracts (2604.24842, 2604.13452, 2605.06924, 2603.12310) auf Titel, Autoren, Einreichungsdaten und Zahlen geprüft. MarkTechPost (27.9.2026) bestätigt unabhängig dieselben Systeme und Zahlen. Eine kritische Analyse Dritter wies auf die Grenzen der Bewertung hin; das haben wir anschließend an den Abstracts überprüft.
Incertezze
Jedes System wird nur in seinem eigenen Paper bewertet: Kein Dokument misst die vier zusammen als eine Pipeline, obwohl der Blog sie als Suite präsentiert. Die 81,4 des Co-Director beziehen sich auf kurze Werbespots, nicht auf minutenlange Erzählungen. Die Zugewinne von CANVAS sind an Storyboards (Bildern) gemessen, nicht an fertigen Videos. Unklar ist, welches System den zehnminütigen Film erzeugt hat: Superpower Daily nennt A²RD, die Primärquelle bestätigt das nicht. Die Zahlen sind Eigenangaben und nicht repliziert; die Paper sind Preprints. Ob der Code tatsächlich auf GitHub liegt, haben wir nicht überprüft.
Perché pubblicarla
Die Arbeit greift eine der bekanntesten Schwächen von Videogeneratoren an: Figuren und Schauplätze über Minuten statt Sekunden konsistent zu halten. Sie stammt aus einem großen Labor, mit öffentlichen Papern und überprüfbaren Zahlen. Außerdem eignet sie sich für eine Lektüre ohne Hype, weil sie trennt, was tatsächlich gemessen wurde (einzelne Komponenten, oft bei kurzen Aufgaben oder auf Storyboards), und was nur nach einer Pipeline für ganze Filme aussieht.

Fonti / Sources

  1. Google Research Blog — Automating coherent long-form video generation (Yale Song, Yiwen Song)
  2. arXiv 2605.06924 — A²RD: Agentic Autoregressive Diffusion for Long Video Consistency
  3. arXiv 2604.24842 — Co-Director: Agentic Generative Video Storytelling
  4. arXiv 2604.13452 — CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding

Commenta sul sito →