
Google lar flere KI-agenter holde en ti minutter lang video sammenhengende

I forskningsomtalen fra 24. september 2026 presenterer Google Research metoder der flere KI-agenter planlegger og kontrollerer lengre video, og viser en ti minutter lang film laget med A²RD. Målet er å holde personer, steder og handling gjenkjennelige når historien bygges av mange klipp.
Filmen demonstrerer A²RD, som lager video i sammenhengende segmenter. Co-Director, CANVAS og VQQA tar for seg henholdsvis planlegging, visuelt minne og forbedring av genererte klipp. Det publiserte testgrunnlaget viser separate evalueringer av metodene, ikke en test av alle fire som én produksjonskjede.
Planen må holde gjennom hele fortellingen
Et godt enkeltklipp gir ingen garanti for en sammenhengende film. Hvis en figur får andre klær eller et rom endrer utforming mellom opptak, kan neste klipp bygge videre på feilen. Jo lenger den kjeden fortsetter, desto vanskeligere blir det å finne beslutningen som først brøt kontinuiteten. Historien kan også stanse opp selv om bildene hver for seg ser overbevisende ut.
Co-Director angriper problemet før klippene produseres. En koordinerende agent velger kreativ retning, fortellerform og visuelt uttrykk. En agent for forarbeid lager deretter et storyboard med scener og visuelle holdepunkter. Under produksjonen fordeles nøkkelbilder, bevegelige klipp og lyd på spesialiserte agenter, mens Gemini og Veo leverer generering under dette koordinerende laget. En vurderingsmodell gir tilbakemelding på den sammensatte filmen, slik at planleggingen kan justeres i en ny runde.
Arkitekturen i tekstform: Kreativ bestilling → Co-Director velger retning → storyboard og visuelle holdepunkter → agenter lager bilder, video og lyd → en modell vurderer resultatet. CANVAS holder rede på tilbakevendende visuelle detaljer; A²RD bruker minne mens videosegmenter genereres; VQQA vurderer kandidater og forbedrer instruksjoner. Oversikten viser hva forskningsmetodene gjør hver for seg.
CANVAS husker det kameraet vender tilbake til
En person eller et sted må kunne gjenkjennes også etter at handlingen har vært et annet sted. CANVAS lagrer strukturerte opplysninger og visuelle holdepunkter for figurer, omgivelser og gjenstander. Når en scene vender tilbake, kan systemet hente frem tidligere referanser i stedet for å lage alt på nytt ut fra en løs tekstbeskrivelse. Dermed kan et storyboard bevare sammenhengen mellom scener som ikke ligger ved siden av hverandre.
Poenget er å følge endringer som hører til handlingen, ikke å fryse utseendet til alt i filmen. En figur kan skifte klær, og en gjenstand kan flyttes; systemet må skille slike tilsiktede endringer fra tilfeldig drift. I en museumssekvens fra forskningen forsvinner en tyv ut av bildet før fortellingen vender tilbake til utstillingshallen. Da blir luen, edelstenen og rommets utforming konkrete prøver på om de visuelle holdepunktene fortsatt virker.
Dette er særlig krevende når et sted først gjenopptrer etter flere mellomliggende scener. Det siste klippet alene forteller lite om hvordan utstillingshallen så ut tidligere. Et vedvarende minne gir planleggingsdelen et holdepunkt lenger tilbake i historien, der en ren kjede av nye beskrivelser lettere kan miste detaljer.
A²RD lager neste segment med tidligere scener i minnet
A²RD står for den lange videodemonstrasjonen. Før et nytt segment lages, henter metoden relevant informasjon fra et multimodalt videominne. Den genererer segmentet, vurderer og forbedrer det, og oppdaterer så minnet. Slik blir tidligere scener mer enn bare det siste bildet i forrige klipp: de gir informasjon om personer, steder og hvordan handlingen har utviklet seg.
Agenten velger mellom to måter å føre videoen videre på. Ekstrapolering driver fortellingen mot en ny hendelse. Interpolering forankrer et segment til figurer eller omgivelser som allerede er etablert. Vekslingen er viktig fordi en film både må forandre seg og bevare identiteten til det som kommer tilbake. En metode som bare gjentar kjente bilder, ville holde enkelte detaljer stabile, men samtidig bremse historien.
I fagartikkelen om A²RD rapporterer forskerne tester av videoer fra ett til ti minutter, inkludert ti filmer på ti minutter, og opptil 30 prosent bedre konsistens og 20 prosent bedre narrativ sammenheng enn sammenligningsmetodene på tvers av testene. Prosentene gjelder dette evalueringsoppsettet; de er ikke et mål på forbedringen i demonstrasjonsfilmen alene.
Metoden kontrollerer både bilder ved grensene mellom segmenter og de ferdige videosegmentene før den går videre. Hensikten er å oppdage en feil mens den ennå kan rettes gjennom et nytt genereringsforsøk, før den blir del av minnet som neste segment bygger på. Det knytter kvalitetskontrollen direkte til problemet med feil som forplanter seg gjennom en lang film.
VQQA prøver en ny instruksjon når bildet svikter
VQQA undersøker et generert klipp ved å stille spørsmål om det visuelle innholdet. En modell som kan tolke bilder og tekst, bruker svarene til å gi konkret tilbakemelding på hva som ikke stemmer med bestillingen. Systemet justerer deretter tekstinstruksjonen og ber generatoren lage en ny kandidat. Det reparerer altså ikke pikslene i det mislykkede klippet direkte.
En egen utvelgelse vurderer kandidatene opp mot den opprinnelige bestillingen. Dermed kan en lokal forbedring av for eksempel en gjenstands materiale eller en persons rolle forkastes hvis resten av scenen blir mindre riktig. VQQA retter seg mot slike feil i genererte resultater, mens A²RD også kontrollerer overgangen fra ett videosegment til det neste. De to kontrollsløyfene løser beslektede, men ulike oppgaver.
Filmen, testene og tilgjengeligheten
Den viste filmen er et konkret resultat av A²RD. Forskningsartikkelens målinger er noe annet: De sammenligner metoden med andre oppsett under bestemte testvilkår. For de lange testfilmene ble konsistens vurdert av en KI-modell. Forskerne gjennomførte også menneskelige vurderinger, men på et annet utvalg med kortere videoer. Det skillet avgjør hvor langt resultatene kan brukes som belegg for pålitelighet i lange fortellinger.
Co-Director, CANVAS, A²RD og VQQA er foreløpig publiserte forskningsmetoder. Presentasjonen oppgir ingen pris, API eller lanseringsdato for et samlet sluttbrukerprodukt. Neste avgjørende resultat blir en dokumentert test der metodene brukes i samme produksjon, med tydelig angivelse av filmlengde, vurderingsmetode og hvor ofte personer og steder faktisk forblir gjenkjennelige.
Relaterte artikler


OpenAI-agenter sonderte offentlige systemer under vanlige nettsøk

Embeddingmodell for norsk RAG: globale topplister kan villede

MCP-auth i 2026: fire opt-in-valg avgjør om SDK-en følger standarden

Lokal eller skybasert språkmodell: personvern har en driftspris

Norge faller til femteplass i KI-bruk – veksten fortsetter likevel
Abonner på nyhetsbrevet vårt
Få de siste nyhetene om Web3, KI og krypto rett i innboksen.