Google ویدئوی چنددقیقه‌ای را یک مسئلهٔ حافظه کرد، نه فقط پرامپت

|نویسنده: تیم تحریریه QUASA|5 دقیقه مطالعه| 1
Google ویدئوی چنددقیقه‌ای را یک مسئلهٔ حافظه کرد، نه فقط پرامپت

Yale Song و Yiwen Song از Google Research در ۲۴ سپتامبر ۲۰۲۶، در معرفی پژوهش تولید ویدئوی بلند، چهار چارچوب Co-Director، CANVAS، A²RD و VQQA را شرح دادند. مسئلهٔ مشترک آن‌ها حفظ پیوستگی در ویدئوی چنددقیقه‌ای است: سامانه باید مسیر روایت و وضعیت شخصیت‌ها، مکان‌ها و اشیا را در طول نماها دنبال کند تا خطای یک بخش به بخش‌های بعدی سرایت نکند.

این معرفی، نتیجهٔ پژوهش و نمونه‌های نمایشی را در بر می‌گیرد، نه عرضهٔ یک ابزار آماده. پوشش روز انتشار نیز تصریح می‌کند که محصول عمومی یا تاریخ دسترسی برای این مجموعه اعلام نشده است. بنابراین اکنون می‌توان روش‌ها و خروجی‌های منتشرشده را دید، اما راهی برای خرید یا فراخوانی این مجموعه به‌عنوان یک سرویس معرفی نشده است.

Co-Director تصمیم‌های روایت را در سراسر ویدئو هماهنگ می‌کند

وقتی هر نما با دستوری جداگانه ساخته شود، کیفیت همان نما تضمینی برای پیوستگی کل داستان نیست. لباس شخصیت ممکن است عوض شود، صحنه‌ای که دوباره دیده می‌شود چیدمان دیگری پیدا کند یا روایت بدون پیشرفت روشن ادامه یابد. خطایی که در تصویر مرجع یا طرح اولیه رخ می‌دهد نیز می‌تواند وارد مراحل بعدی تولید شود؛ اصلاح دستورِ آخرین نما لزوماً منشأ آن خطا را برطرف نمی‌کند.

Co-Director برای هماهنگ‌کردن تصمیم‌های کلان ساخته شده است. یک عاملِ هماهنگ‌کننده راهبرد خلاقه، ساختار روایت و جهت بصری را انتخاب می‌کند. سپس عامل‌های پیش‌تولید و تولید، آن انتخاب را به طرح نماها، تصویرهای کلیدی، حرکت و صدا تبدیل می‌کنند. در پایان، یک مدل چندوجهی ویدئوی حاصل را ارزیابی می‌کند و بازخورد آن به دور بعدی انتخاب‌ها برمی‌گردد.

این لایه روی مدل‌های Gemini و Veo کار می‌کند. نقش آن ساختن یک مدل تازه برای هر فریم نیست؛ تصمیم‌هایی را که بر چندین نما اثر می‌گذارند در یک چرخهٔ برنامه‌ریزی و ارزیابی نگه می‌دارد. به این ترتیب، اگر نتیجه از هدف روایی دور شود، بازخورد فقط به یک تصویر منفرد محدود نمی‌ماند و می‌تواند انتخاب‌های بالادستی تولید را تغییر دهد.

CANVAS بازگشت شخصیت و مکان را با حافظهٔ بصری دنبال می‌کند

مشکل CANVAS زمانی آشکار می‌شود که داستان پس از چند نما به شخص یا مکانی آشنا برمی‌گردد. این چارچوب بازنمایی ساختاریافته‌ای از شخصیت‌ها، مکان‌ها و وضعیت اشیا نگه می‌دارد و برای نمای تازه، مرجع بصری مرتبط را از حافظه بازیابی می‌کند. بنابراین بازگشت به یک صحنه به آخرین نمای ساخته‌شده وابسته نمی‌ماند؛ ویژگی‌های ثبت‌شدهٔ همان صحنه نیز در دسترس‌اند.

نمونهٔ پژوهش، داستان سرقتی در سالن نمایش موزه است. سارق، کلاه او، گوهر و چیدمان سالن در نماهای جداگانه دوباره ظاهر می‌شوند. در مقایسهٔ منتشرشده، تولید مستقیم با Gemini 3.1 Pro شکل شیء و آرایش سالن را تغییر می‌دهد و در خروجی AutoStudio کلاه سارق ناپدید می‌شود. CANVAS برای حفظ همین ویژگی‌ها هنگام عبور روایت از یک مکان و بازگشت دوباره به آن طراحی شده است.

حافظه در اینجا صرفاً نگهداری تصویر نمای قبلی نیست. اگر شخصیت از سالن خارج شود و چند صحنه بعد برگردد، سامانه باید تشخیص دهد کدام ویژگی‌ها بخشی از هویت او و ساختار مکان‌اند و کدام وضعیت‌ها با پیشرفت داستان تغییر کرده‌اند. ثبت وضعیت شیء در کنار ظاهر شخصیت و هندسهٔ محیط، به CANVAS امکان می‌دهد پیوستگی را میان نماهای غیرمتوالی نیز دنبال کند.

A²RD پیوستگی را هنگام ساخت بخش‌های متحرک حفظ می‌کند

A²RD به مرحلهٔ تبدیل طرح نماها به ویدئوی بلند می‌پردازد. این چارچوب خروجی را بخش‌به‌بخش می‌سازد و پس از هر بخش، اطلاعات مربوط به تصویر و رخدادها را در حافظهٔ چندوجهی به‌روز می‌کند. هنگام تولید بخش بعدی، سابقهٔ مرتبط بازیابی می‌شود تا جزئیات شخصیت و محیط با گذشت زمان از دست نروند.

سامانه بسته به نیاز روایت میان دو شیوه جابه‌جا می‌شود. در یکی، داستان به رخداد و موقعیت تازه پیش می‌رود؛ در دیگری، بخش جدید به شخصیت‌ها و محیط‌هایی که پیش‌تر دیده شده‌اند متصل می‌شود. پیشروی مداوم بدون رجوع به گذشته می‌تواند ظاهر عناصر آشنا را تغییر دهد، و بازگشت مداوم به همان عناصر نیز حرکت داستان را کند می‌کند. انتخاب میان این دو شیوه، راه‌حل A²RD برای جمع‌کردن پیشرفت روایت و ثبات بصری است.

حافظهٔ CANVAS و A²RD دو نقش متفاوت دارند: اولی وضعیت جهان داستان را برای طرح‌ریزی نماها نگه می‌دارد و دومی سابقهٔ بخش‌های ویدئوییِ تولیدشده را در ادامهٔ ساخت به کار می‌گیرد. این‌ها چارچوب‌های پژوهشی با وظایف مرتبط‌اند؛ معرفی آن‌ها به معنای انتشار یک سامانهٔ عمومی نیست که همهٔ مراحل را برای کاربر اجرا کند.

VQQA خطای خروجی را به دستور تولید برمی‌گرداند

داشتن طرح و حافظه، خطاهای خودِ ویدئوی تولیدشده را حذف نمی‌کند. VQQA بر پایهٔ درخواست اولیه پرسش‌های بصری می‌سازد و از پاسخ یک مدل بینایی‌ـ‌زبان برای یافتن ناسازگاری‌ها استفاده می‌کند. بازخورد به اصلاح دستور تولید می‌رسد و مدل ویدئویی خروجی تازه‌ای می‌سازد؛ فریم قبلی مستقیماً دست‌کاری نمی‌شود.

در نمونهٔ دونوازی، خروجی اولیه پس از یک برش، نقش نوازندهٔ پیانو و ویولن را جابه‌جا می‌کند. نسخهٔ اصلاح‌شده پیوند هر نوازنده با سازش را در دو سوی برش حفظ می‌کند. این خطا فقط به شباهت ظاهری شخصیت‌ها مربوط نیست: دستور تولید باید رابطهٔ هر شخصیت با کنش خود را نیز در طول ویدئو حفظ کند.

VQQA آخرین نسخهٔ تولیدشده را خودکار بهترین خروجی فرض نمی‌کند. نامزدهای ساخته‌شده در چرخهٔ اصلاح دوباره با درخواست اصلی سنجیده می‌شوند و نسخه‌ای انتخاب می‌شود که در مجموع با آن سازگارتر باشد. این انتخاب برای جلوگیری از وضعیتی است که اصلاح یک نقص موضعی، ویژگی مهم دیگری از صحنه را از بین ببرد.

نتیجهٔ آزمایشگاهی چه چیزی را نشان می‌دهد؟

گزارش METAL از نمایش و ارزیابی‌ها به فیلم ده‌دقیقه‌ای ساخته‌شده با A²RD و امتیاز اوج ۸۱٫۴ برای Co-Director در آزمون GenAD-Bench اشاره می‌کند. این دو نتیجه به دو بخش متفاوت پژوهش تعلق دارند: فیلم، نمونه‌ای از تولید روایتی طولانی است؛ امتیاز، عملکرد Co-Director را در یک آزمون مشخص نشان می‌دهد. هیچ‌کدام به‌تنهایی کیفیت هر ویدئوی آینده یا عملکرد یک محصول عمومی را اندازه نمی‌گیرد.

تفاوت مهم برای مخاطب، فاصلهٔ میان دیدن خروجی و دسترسی به خودِ روش است. نمونهٔ موزه نشان می‌دهد حافظهٔ بصری کدام خطاها را هدف می‌گیرد و فیلم طولانی نشان می‌دهد تولید پیاپی تا کجا نمایش داده شده است. گام تعیین‌کنندهٔ بعدی، اعلام شیوه و شرایط دسترسی به این چارچوب‌هاست؛ تا آن زمان، توانایی قابل مشاهدهٔ آن‌ها به نمونه‌ها و ارزیابی‌های منتشرشده محدود می‌ماند.

اشتراک‌گذاری:

عضویت در خبرنامه

تازه‌ترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.

0