
Google ویدئوی چنددقیقهای را یک مسئلهٔ حافظه کرد، نه فقط پرامپت

Yale Song و Yiwen Song از Google Research در ۲۴ سپتامبر ۲۰۲۶، در معرفی پژوهش تولید ویدئوی بلند، چهار چارچوب Co-Director، CANVAS، A²RD و VQQA را شرح دادند. مسئلهٔ مشترک آنها حفظ پیوستگی در ویدئوی چنددقیقهای است: سامانه باید مسیر روایت و وضعیت شخصیتها، مکانها و اشیا را در طول نماها دنبال کند تا خطای یک بخش به بخشهای بعدی سرایت نکند.
این معرفی، نتیجهٔ پژوهش و نمونههای نمایشی را در بر میگیرد، نه عرضهٔ یک ابزار آماده. پوشش روز انتشار نیز تصریح میکند که محصول عمومی یا تاریخ دسترسی برای این مجموعه اعلام نشده است. بنابراین اکنون میتوان روشها و خروجیهای منتشرشده را دید، اما راهی برای خرید یا فراخوانی این مجموعه بهعنوان یک سرویس معرفی نشده است.
Co-Director تصمیمهای روایت را در سراسر ویدئو هماهنگ میکند
وقتی هر نما با دستوری جداگانه ساخته شود، کیفیت همان نما تضمینی برای پیوستگی کل داستان نیست. لباس شخصیت ممکن است عوض شود، صحنهای که دوباره دیده میشود چیدمان دیگری پیدا کند یا روایت بدون پیشرفت روشن ادامه یابد. خطایی که در تصویر مرجع یا طرح اولیه رخ میدهد نیز میتواند وارد مراحل بعدی تولید شود؛ اصلاح دستورِ آخرین نما لزوماً منشأ آن خطا را برطرف نمیکند.
Co-Director برای هماهنگکردن تصمیمهای کلان ساخته شده است. یک عاملِ هماهنگکننده راهبرد خلاقه، ساختار روایت و جهت بصری را انتخاب میکند. سپس عاملهای پیشتولید و تولید، آن انتخاب را به طرح نماها، تصویرهای کلیدی، حرکت و صدا تبدیل میکنند. در پایان، یک مدل چندوجهی ویدئوی حاصل را ارزیابی میکند و بازخورد آن به دور بعدی انتخابها برمیگردد.
این لایه روی مدلهای Gemini و Veo کار میکند. نقش آن ساختن یک مدل تازه برای هر فریم نیست؛ تصمیمهایی را که بر چندین نما اثر میگذارند در یک چرخهٔ برنامهریزی و ارزیابی نگه میدارد. به این ترتیب، اگر نتیجه از هدف روایی دور شود، بازخورد فقط به یک تصویر منفرد محدود نمیماند و میتواند انتخابهای بالادستی تولید را تغییر دهد.
CANVAS بازگشت شخصیت و مکان را با حافظهٔ بصری دنبال میکند
مشکل CANVAS زمانی آشکار میشود که داستان پس از چند نما به شخص یا مکانی آشنا برمیگردد. این چارچوب بازنمایی ساختاریافتهای از شخصیتها، مکانها و وضعیت اشیا نگه میدارد و برای نمای تازه، مرجع بصری مرتبط را از حافظه بازیابی میکند. بنابراین بازگشت به یک صحنه به آخرین نمای ساختهشده وابسته نمیماند؛ ویژگیهای ثبتشدهٔ همان صحنه نیز در دسترساند.
نمونهٔ پژوهش، داستان سرقتی در سالن نمایش موزه است. سارق، کلاه او، گوهر و چیدمان سالن در نماهای جداگانه دوباره ظاهر میشوند. در مقایسهٔ منتشرشده، تولید مستقیم با Gemini 3.1 Pro شکل شیء و آرایش سالن را تغییر میدهد و در خروجی AutoStudio کلاه سارق ناپدید میشود. CANVAS برای حفظ همین ویژگیها هنگام عبور روایت از یک مکان و بازگشت دوباره به آن طراحی شده است.
حافظه در اینجا صرفاً نگهداری تصویر نمای قبلی نیست. اگر شخصیت از سالن خارج شود و چند صحنه بعد برگردد، سامانه باید تشخیص دهد کدام ویژگیها بخشی از هویت او و ساختار مکاناند و کدام وضعیتها با پیشرفت داستان تغییر کردهاند. ثبت وضعیت شیء در کنار ظاهر شخصیت و هندسهٔ محیط، به CANVAS امکان میدهد پیوستگی را میان نماهای غیرمتوالی نیز دنبال کند.
A²RD پیوستگی را هنگام ساخت بخشهای متحرک حفظ میکند
A²RD به مرحلهٔ تبدیل طرح نماها به ویدئوی بلند میپردازد. این چارچوب خروجی را بخشبهبخش میسازد و پس از هر بخش، اطلاعات مربوط به تصویر و رخدادها را در حافظهٔ چندوجهی بهروز میکند. هنگام تولید بخش بعدی، سابقهٔ مرتبط بازیابی میشود تا جزئیات شخصیت و محیط با گذشت زمان از دست نروند.
سامانه بسته به نیاز روایت میان دو شیوه جابهجا میشود. در یکی، داستان به رخداد و موقعیت تازه پیش میرود؛ در دیگری، بخش جدید به شخصیتها و محیطهایی که پیشتر دیده شدهاند متصل میشود. پیشروی مداوم بدون رجوع به گذشته میتواند ظاهر عناصر آشنا را تغییر دهد، و بازگشت مداوم به همان عناصر نیز حرکت داستان را کند میکند. انتخاب میان این دو شیوه، راهحل A²RD برای جمعکردن پیشرفت روایت و ثبات بصری است.
حافظهٔ CANVAS و A²RD دو نقش متفاوت دارند: اولی وضعیت جهان داستان را برای طرحریزی نماها نگه میدارد و دومی سابقهٔ بخشهای ویدئوییِ تولیدشده را در ادامهٔ ساخت به کار میگیرد. اینها چارچوبهای پژوهشی با وظایف مرتبطاند؛ معرفی آنها به معنای انتشار یک سامانهٔ عمومی نیست که همهٔ مراحل را برای کاربر اجرا کند.
VQQA خطای خروجی را به دستور تولید برمیگرداند
داشتن طرح و حافظه، خطاهای خودِ ویدئوی تولیدشده را حذف نمیکند. VQQA بر پایهٔ درخواست اولیه پرسشهای بصری میسازد و از پاسخ یک مدل بیناییـزبان برای یافتن ناسازگاریها استفاده میکند. بازخورد به اصلاح دستور تولید میرسد و مدل ویدئویی خروجی تازهای میسازد؛ فریم قبلی مستقیماً دستکاری نمیشود.
در نمونهٔ دونوازی، خروجی اولیه پس از یک برش، نقش نوازندهٔ پیانو و ویولن را جابهجا میکند. نسخهٔ اصلاحشده پیوند هر نوازنده با سازش را در دو سوی برش حفظ میکند. این خطا فقط به شباهت ظاهری شخصیتها مربوط نیست: دستور تولید باید رابطهٔ هر شخصیت با کنش خود را نیز در طول ویدئو حفظ کند.
VQQA آخرین نسخهٔ تولیدشده را خودکار بهترین خروجی فرض نمیکند. نامزدهای ساختهشده در چرخهٔ اصلاح دوباره با درخواست اصلی سنجیده میشوند و نسخهای انتخاب میشود که در مجموع با آن سازگارتر باشد. این انتخاب برای جلوگیری از وضعیتی است که اصلاح یک نقص موضعی، ویژگی مهم دیگری از صحنه را از بین ببرد.
نتیجهٔ آزمایشگاهی چه چیزی را نشان میدهد؟
گزارش METAL از نمایش و ارزیابیها به فیلم دهدقیقهای ساختهشده با A²RD و امتیاز اوج ۸۱٫۴ برای Co-Director در آزمون GenAD-Bench اشاره میکند. این دو نتیجه به دو بخش متفاوت پژوهش تعلق دارند: فیلم، نمونهای از تولید روایتی طولانی است؛ امتیاز، عملکرد Co-Director را در یک آزمون مشخص نشان میدهد. هیچکدام بهتنهایی کیفیت هر ویدئوی آینده یا عملکرد یک محصول عمومی را اندازه نمیگیرد.
تفاوت مهم برای مخاطب، فاصلهٔ میان دیدن خروجی و دسترسی به خودِ روش است. نمونهٔ موزه نشان میدهد حافظهٔ بصری کدام خطاها را هدف میگیرد و فیلم طولانی نشان میدهد تولید پیاپی تا کجا نمایش داده شده است. گام تعیینکنندهٔ بعدی، اعلام شیوه و شرایط دسترسی به این چارچوبهاست؛ تا آن زمان، توانایی قابل مشاهدهٔ آنها به نمونهها و ارزیابیهای منتشرشده محدود میماند.
مقالات مرتبط


CapCut یا Descript؛ کلیپ سریع در برابر تدوین با متن

ChatGPT Plus یا Claude Pro؛ قیمت برابر، سقف ابزارها متفاوت است

Leonardo AI یا Midjourney؛ طرح ارزانتر الزاماً تصویر خصوصی نمیدهد

حافظهٔ ابری Google کلید را به دستگاه میسپارد؛ ادعای حریم خصوصی زیر ذرهبین

ChatGPT یا Perplexity برای تحقیق؛ تعداد منبع بیشتر مساوی دقت بیشتر نیست
عضویت در خبرنامه
تازهترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.