Google leagă minute de video IA fără deriva personajelor

|Autor: Echipa editorială QUASA|4 min de citit| 1
Google leagă minute de video IA fără deriva personajelor

La 24 septembrie 2026, Google Research a prezentat în articolul semnat de Yale Song și Yiwen Song o suită de cercetare pentru generarea unor povești video de mai multe minute. Co-Director, CANVAS, A²RD și VQQA împart între ele planificarea, memoria vizuală, producerea segmentelor și revizuirea rezultatului. Cercetătorii descriu un mod de a reduce schimbările neintenționate ale personajelor și decorurilor, nu lansarea unui produs pe care creatorii îl pot folosi deja.

Abordarea coordonează modele precum Gemini și Veo: stabilește repere pentru poveste, le recuperează când un personaj sau un loc reapare și evaluează ce a fost generat. Rezultatele publicate privesc însă componente testate în condiții diferite. Un film demonstrativ lung și un scor bun pentru reclame scurte spun lucruri distincte despre continuitate.

De ce contează revenirea la același decor

Continuitatea devine dificilă când povestea părăsește o încăpere și revine mai târziu. Un generator poate crea fiecare cadru convingător, dar poate schimba între timp hainele unui personaj, forma unui obiect sau configurația camerei. Dacă aceste detalii sunt stabilite doar prin descrieri separate ale cadrelor, o greșeală timpurie poate ajunge și în secvențele următoare.

Comparația vizuală pentru CANVAS folosește un furt fictiv dintr-un muzeu. Hoțul, șapca sa, piatra prețioasă și sala de expoziție trebuie să rămână recognoscibile inclusiv după ce narațiunea trece prin alte scene. În exemplele de referință, un model schimbă artefactul și fundalul, iar alt sistem pierde șapca hoțului. CANVAS păstrează repere pentru personaje, locuri și starea obiectelor, apoi le recuperează la revenire. Astfel, următorul cadru pornește de la lumea deja stabilită a poveștii.

Cum se împart sarcinile între cele patru componente

Co-Director se ocupă de direcția întregii producții. Un agent alege strategia creativă, structura narativă și abordarea vizuală; agenții de preproducție transformă alegerea într-un plan al scenelor. Alți agenți pregătesc imaginile de referință, mișcarea și sunetul. La final, un evaluator multimodal examinează montajul și trimite observații către o nouă rundă. Mecanismul încearcă să corecteze deciziile care afectează povestea în ansamblu, nu doar un cadru izolat.

CANVAS lucrează la continuitatea vizuală a planului. Păstrează reprezentări structurate ale personajelor, locurilor și obiectelor, împreună cu imagini de referință care pot fi reutilizate. Când acțiunea revine într-un spațiu cunoscut, componenta caută reperele potrivite înaintea generării. Această memorie este utilă mai ales când două apariții ale aceluiași element sunt despărțite de alte scene: sistemul trebuie să recunoască locul, dar și schimbările cerute de acțiunea dintre ele.

A²RD construiește videoclipul segment cu segment. Memoria sa multimodală urmărește contextul și dinamica materialului deja produs, iar pentru segmentul următor alege între extinderea acțiunii și ancorarea ei în personaje ori locuri cunoscute. Alegerea răspunde unei tensiuni concrete: o poveste trebuie să avanseze, însă revenirea la un personaj nu ar trebui să-i schimbe identitatea. După generare, componenta poate rafina atât cadrele de legătură, cât și segmentul rezultat.

VQQA intervine asupra defectelor observate în videoclipul generat. Formulează întrebări vizuale legate de cererea inițială, folosește răspunsurile unui model care interpretează imaginea și textul, apoi modifică descrierea pentru o nouă generare. Nu retușează pixelii clipului existent. Dintre variantele produse, un evaluator o selectează pe cea care respectă cel mai bine cererea inițială; această selecție împiedică o corecție locală să schimbe sensul scenei.

Ce arată scorul și filmul demonstrativ

Analiza Superpower Daily arată că scorul 81,4 din GenAD-Bench privește Co-Director și criterii pentru reclame video de 12 secunde, în timp ce evaluarea videoclipurilor de zece minute privește A²RD. Sunt rezultate pentru sarcini și configurații diferite. Scorul publicitar nu măsoară dacă același personaj își păstrează aspectul de-a lungul unui film de zece minute.

Filmul demonstrativ lung arată ce poate produce A²RD, iar lucrarea componentei raportează și evaluări ale continuității pe scenarii lungi. Pentru scenariile de zece minute, personajele, obiectele și mediile au fost punctate de un evaluator multimodal; evaluarea umană a folosit alte mostre, mai scurte. Filmul care poate fi urmărit este, la rândul său, distinct de setul de scenarii punctate. Această diferență contează când un exemplu vizual reușit este interpretat ca dovadă a fiabilității generale.

Rezultatele CANVAS privesc în principal continuitatea imaginilor din storyboard, iar VQQA este evaluat pentru îmbunătățirea clipurilor prin revizuirea descrierilor. Cercetările prezintă astfel dovezi pentru etape diferite ale producției. Evaluările publicate nu măsoară încă toate cele patru componente funcționând împreună într-un singur flux care produce și verifică un film lung.

Ce este disponibil creatorilor

MarkTechPost consemna la 27 septembrie 2026 că fluxul complet nu este un produs Google disponibil creatorilor. Există lucrări, demonstrații și depozite publice asociate unor componente, însă accesul la materiale de cercetare nu oferă un serviciu integrat în care utilizatorul să ceară generarea unui film lung cu aceste mecanisme activate împreună.

Pentru un creator din România sau Republica Moldova, schimbarea imediată este că poate vedea cum au fost abordate revenirea personajelor, păstrarea decorului și corectarea segmentelor. Accesul la un instrument complet depinde de o eventuală lansare ulterioară. Până atunci, rezultatul decisiv pentru această promisiune ar fi un test public al fluxului combinat, pe videoclipuri lungi și cu criterii de evaluare precizate.

Distribuie:

Abonează-te la newsletter

Primește cele mai noi știri despre Web3, IA și cripto direct în inbox.

0