Google’i AI-videorežissöör hoiab kümneminutilise loo tegelased paigas

|Autor: QUASA toimetus|4 min lugemist
Google’i AI-videorežissöör hoiab kümneminutilise loo tegelased paigas

Google Researchi 24. septembri 2026 uurimistutvustus kirjeldab, kuidas Co-Director, CANVAS, A²RD ja VQQA jagavad pika AI-video kavandamise, visuaalse mälu, loomise ja parandamise ülesanded agentide vahel; A²RD näidisfilm kestab kümme minutit. Film näitab, et sama tegelane ja tegevuspaik võivad pärast mitut stseeni äratuntavalt naasta. Tegemist on uurimistulemuse ja demonstratsiooniga, mitte teatega avalikult kasutatavast videotööriistast.

Järjepidevuse probleemile pakutakse seega tööjaotust: loo suund pannakse paika enne kaadreid, korduvad detailid salvestatakse ning valminud lõike hinnatakse uuesti. OpenBridge’i analüüs tõlgendab seda nihkena üksiku klipi ilult kogu tootmisahela juhtimisele. Video pikkus teeb ilmseks, miks järgmise kaadri kvaliteeti hinnates ei selgu veel, kas varem nähtud tegelane hiljem samaks jääb.

Co-Director hoiab stseenid sama loo teenistuses

Co-Director tegeleb vea allikaga, mis tekib enne video genereerimist. Eraldi kirjutatud stseenijuhised võivad anda igaüks ilusa tulemuse, ent jätta terviku ilma ühtse jutustamisviisi ja visuaalse suunata. Juhtagent valib sisendi põhjal loomingulise strateegia, loo ülesehituse ja esteetilise lähtepunkti ning edastab need allagentidele. Valik tehakse mitme võimaluse vahel ja hinnangut kasutatakse järgmises loomistsüklis.

Eeltöö agent teeb stseenide käigu ja süžeeskeemi; tootmisagendid loovad selle järgi võtmekaadrid, liikumise ning heli. Seejärel hindab multimodaalne mudel kokkupandud videot ning annab tagasiside, mille abil juhtagent suunda kohandab. Niisugune ring seob hilisemad kaadrid algse kavatsusega ja aitab leida, millises tootmisetapis viga tekkis. Uurimiskirjelduses töötab see kiht Gemini ja Veo peal; üldise ülesehituse järgi saab juhtimist kasutada ka teiste genereerivate mudelite kohal.

Inimese lähteülesanne jääb siin määravaks: agent saab otsida viisi, kuidas soovitud lugu teostada, kuid ei saa ise otsustada, kas loo sõnum või tempo on loojale õige. Ühtne visuaalne suund vähendab juhuslikku hajumist; teadlik pööre loos peab samal ajal jääma võimalikuks. Seetõttu hinnatakse tervikut valitud loominguliste eesmärkide järgi, mitte üksnes seda, kas järgmine stseen sarnaneb eelmisega.

CANVAS säilitab naasvate tegelaste ja paikade seisundi

CANVAS lisab kavandamisele struktureeritud visuaalse mälu. Selles hoitakse tegelaste, tegevuspaikade ja esemete tunnuseid ning loo käigus muutuvat seisundit. Kui tegevus pöördub varem nähtud saali tagasi, saab järgmise stseeni toetada selle saali visuaalsele ankrule, mitte ainult lühikesele tekstilisele meenutusele. Nii saab järjestikuste kaadrite kõrval hoida sidet ka nende stseenide vahel, mille vahele jääb pikem kõrvalepõige.

Muuseumivarguse võrdlus annab mälule konkreetse ülesande: varas, näitusesaal ja vääriskivi peavad kordudes säilitama loo jaoks olulised tunnused. Võrdluses muudab üks meetod saali tausta ja teise puhul kaob varga müts; CANVAS-e süžeeskeemis püsivad need detailid järjepidevamalt. Vääriskivi, riietus ja ruumi paigutus on just sellised väikesed tunnused, mille muutus võib vaatajale katkestuse kohe nähtavaks teha. Võrdlus on valitud stseenijada näide, mitte mõõt kõigi võimalike pikkade videote veavabadusest.

Mälu ei tähenda, et tegelane peaks kogu filmi vältel kandma samu riideid või ese jääma samasse kohta. Kui muudatus on loos ette nähtud, tuleb talletada uus seisund ja kasutada seda järgmise stseeni lähtepunktina. Nii eristub tahtlik sündmus juhuslikust visuaalsest triivist: varga mütsi kadumine võib olla süžee osa ainult siis, kui lugu on selle muutuse ette näinud.

A²RD viib loo edasi, VQQA parandab kaadrivead

A²RD ülesanne on muuta süžeeskeem pikaks videoks, luues lõike üksteise järel ja hoides nende kohta multimodaalset mälu. Iga uue lõigu puhul saab süsteem valida edasiliikumise või varasema tegelase ja keskkonnaga sidumise vahel. Esimene võimalus avab uue sündmuse, teine aitab pärast ajalist vahet tagasi tulla sama näo, rõiva ja ruumilise ehituse juurde. See on põhjus, miks näidisfilmi pikkus on tehniliselt oluline: mitu minutit hiljem peab mälust endiselt leiduma loo varasem seisund.

A²RD filmis näidatakse nii loo edenemist kui ka tegelaste ja paikade naasmist. See on vaadeldav demonstratsioon, samal ajal kui eri olukordades saavutatud järjepidevust hinnatakse eraldi testidega. Üks õnnestunud film ei anna õnnestumise sagedust ega ütle, kui palju korduskatseid selle valmimiseks kulus. Samuti ei mõõda A²RD demonstratsioon eraldi Co-Directori, CANVAS-e ega VQQA tulemusi.

VQQA tegeleb juba loodud lõigu konkreetse veaga. Nägemise ja keele mudel esitab pildile sihitud küsimusi ning sõnastab puuduse, mille põhjal muudetakse järgmise genereerimiskatse tekstjuhist. Näidetes aitab see hoida pianisti ja viiuldaja pillid õigete inimeste käes ning anda kandilisele õhupallile korraga õige kuju ja materjali. Süsteem ei paranda piksleid otse: uued videokandidaadid võrreldakse algse juhisega ning valitakse sellele kõige paremini vastav variant.

Mõõtmised eristavad järjepidevuse liike

Nelja meetodi tulemused pärinevad eri ülesannetega katsetest. explainx.ai tehniline käsitlus toob Co-Directori GenAD-Benchi parima kvaliteediskoorina välja 81,4; see mõõdab muu hulgas turunduslike piirangute täitmist, mitte kümneminutilise filmi tegelaste püsivust. CANVAS-e puhul vaadatakse naasvate stseenide ruumilist ja esemelist kooskõla, A²RD puhul pika aja vältel toimuvat muutumist ning VQQA puhul seda, kas muudetud juhis parandab pildis määratletud vea. Ühe testi skoori ei saa seetõttu kasutada kogu pika video kvaliteedi üldnäitajana.

Selline jaotus aitab ka mõista, mida loojale alles jääb. Automaatselt saab otsida mütsi kadumist, paiga muutumist või vale inimese kätte sattunud pilli; loo mõte, vajalik stseen ja tahtlik muutus nõuavad endiselt inimlikku otsust. Inimese tihedam kaasamine on üks edasisi uurimissuundi. Co-Directori ja CANVAS-e kavandatud konverentsiettekanded annavad järgmise võimaluse hinnata nende katsete metoodikat ning seda, kui kaugele avaldatud järjepidevustulemused uutes lugudes ulatuvad.

Jaga:

Telli meie uudiskiri

Saa värskeimad Web3, AI ja krüptouudised otse oma postkasti.

0