استخراج استدلال OpenAI متوقف شد؛ پایگاه داده هک نشده بود

|نویسنده: تیم تحریریه QUASA|6 دقیقه مطالعه| 1
استخراج استدلال OpenAI متوقف شد؛ پایگاه داده هک نشده بود

OpenAI در گزارش امنیتی ۳۰ سپتامبر ۲۰۲۶ اعلام کرد کارزار هماهنگ برای استخراج استدلال محافظت‌شده مدل‌هایش را تا ۲۸ ژوئیه متوقف کرده است. به گفته شرکت، عاملان با دست‌کاری تعامل با مدل کوشیدند محتوای پنهان را در پاسخ قابل‌مشاهده بازسازی کنند؛ رمزنگاری شکسته نشد، پایگاه داده‌ای مورد نفوذ قرار نگرفت و دسترسی مستقیمی به مکالمات ذخیره‌شده کاربران به دست نیامد.

گزارش اول اکتبر Tom’s Hardware آغاز فعالیت در اول ژوئیه، اوج ۱۶ هزار درخواست با الگوی استخراج از بیش از چهار هزار کاربر در روزهای ۲۴ و ۲۵ ژوئیه و شناسایی فعالیت مرتبط در خوشه‌ای شامل بیش از ۱۵ هزار کاربر را شرح می‌دهد. این‌ها شمار تلاش‌ها و کاربران مرتبط با الگوی درخواست هستند، نه تعداد استخراج‌های موفق. هسته‌ای از فعالیت به افراد مرتبط با Moonshot AI، سازنده Kimi، نسبت داده شده است؛ روشن نیست همه عاملان به یک گروه تعلق داشته‌اند.

خط زمانی کارزار چه چیزی را نشان می‌دهد؟

رشد فعالیت ناگهانی بود، ولی رقم مربوط به اوج دو روزه با اندازه خوشه‌ای که بعداً شناسایی شد یکسان نیست. ترتیب رویدادها کمک می‌کند «درخواست»، «کاربر» و «خوشه مرتبط» به جای یک معیار واحد گرفته نشوند:

  1. اول ژوئیه: نخستین فعالیت مشاهده‌شده کم‌حجم بود. این تاریخ آغاز فعالیت ثبت‌شده است، نه لزوماً آغاز برنامه‌ریزی عاملان.
  2. ۲۴ و ۲۵ ژوئیه: الگوی استخراج به ۱۶ هزار درخواست از بیش از چهار هزار کاربر رسید. وجود این الگو به‌تنهایی نشان نمی‌دهد پاسخ موردنظر در هر درخواست به دست آمده است.
  3. تا ۲۸ ژوئیه: بررسی الگوهای مشابه، خوشه‌ای شامل بیش از ۱۵ هزار کاربر را آشکار کرد و فعالیت مرتبط با آن به‌طور کامل مختل شد.

گروه بیش از چهار هزار نفری به درخواست‌های دو روز اوج مربوط است؛ گروه بیش از ۱۵ هزار نفری از بررسی دامنه بزرگ‌تری از الگوهای درخواست به دست آمد. نمی‌توان رقم دوم را به شمار حساب‌های مهاجم در همان دو روز یا به شمار افرادی تبدیل کرد که واقعاً به استدلال پنهان دست یافته‌اند. گزارش عمومی نرخ موفقیت تلاش‌ها و مدل‌های مشخص هدف‌گرفته‌شده را نیز اعلام نمی‌کند.

استدلال چگونه میان مکالمات بازپخش شد؟

استدلال محافظت‌شده، مسیر داخلی مدل برای کار روی یک مسئله است؛ بخشی از آن ممکن است در پاسخ نهایی دیده نشود. در تقطیر خصمانه، خروجی یا استدلال یک مدل به‌صورت نظام‌مند و بدون مجوز برای آموزش، بازتولید یا بهبود مدل دیگر استفاده می‌شود. بنابراین گرفتن استدلال پنهان می‌تواند بیش از جمع‌آوری پاسخ‌های معمول به بازسازی توانایی مدل کمک کند.

در یکی از روش‌های مشاهده‌شده، عاملان بلوک رمز‌شده استدلال را از یک مکالمه برمی‌داشتند و آن را در مکالمه دیگری به مدل می‌دادند تا محتوای پنهان را بازگشایی و رونویسی کند. شرح The Hacker News نیز مسیر بازپخش و بسته شدن راه بازیابی محتوا از بلوکی را که از پیش در اختیار فرد بود توضیح می‌دهد. مسئله در این مسیر، رفتار مدل هنگام دریافت بلوک در زمینه‌ای تازه بود؛ گزارشی از شکستن خود الگوریتم رمزنگاری منتشر نشده است.

بستن یک مسیر بازپخش اهمیت ظریفی دارد: فردی که از قبل بلوک رمز‌شده استدلال کاربر دیگری را در اختیار داشت می‌توانست آن را دوباره وارد تعامل کند و محتوایش را بازیابد. این شرط با دسترسی مستقیم به محل نگهداری مکالمات فرق دارد. جزئیات عمومی روشن نمی‌کند بلوک متعلق به دیگری در هر مورد چگونه به دست می‌آمد یا چه مقدار محتوا از این راه واقعاً بازیابی شد؛ از این رو دامنه افشای احتمالی را نمی‌توان از شمار درخواست‌ها محاسبه کرد.

آیا داده مکالمات کاربران افشا شد؟

یافته منتشرشده دسترسی مستقیم عاملان به مکالمات ذخیره‌شده کاربران را نشان نمی‌دهد. موضوع اصلی، استخراج محتوایی بود که در جریان تعامل با مدل پنهان می‌ماند؛ نفوذ به پایگاه داده مستلزم دسترسی غیرمجاز به مخزن اطلاعات است و در این کارزار گزارش نشده است. شمار زیاد درخواست‌های استخراج درباره وضعیت مخزن مکالمات چیزی نمی‌گوید.

  • سطح مشاهده‌شده حمله: درخواست‌های هماهنگ به مدل و بازپخش بلوک استدلال میان مکالمات برای نمایان کردن محتوای محافظت‌شده.
  • وضعیت داده ذخیره‌شده: گزارشی از نفوذ به پایگاه داده یا خواندن مستقیم مکالمات ذخیره‌شده کاربران وجود ندارد.

با این حال، محدود کردن رخداد به «تلاش برای کپی مدل» هم تصویر کاملی نمی‌دهد. اگر محتوای یک بلوک استدلال متعلق به کاربر دیگر از مسیر بازپخش آشکار شده باشد، همان محتوا می‌تواند مسئله حفاظت از داده ایجاد کند، حتی وقتی پایگاه داده سالم مانده است. اطلاعات منتشرشده شمار کاربران متأثر یا مقدار استدلال بازیابی‌شده را تعیین نمی‌کند؛ بنابراین درباره افشای مشخص مکالمه یک کاربر نمی‌توان از این گزارش نتیجه فردی گرفت.

انتساب و پاسخ OpenAI چه محدوده‌ای دارد؟

انتساب منتشرشده محدود به هسته‌ای از فعالیت است که با افراد مرتبط با Moonshot AI پیوند داده شد، نه کل خوشه کاربران. نسبت دادن فعالیت به افراد مرتبط با یک شرکت به معنای اثبات هدایت همه درخواست‌ها از سوی خود شرکت نیست. این احتیاط به‌ویژه برای خوشه بزرگ‌تر مهم است که بر پایه شباهت الگوی درخواست شناسایی شد.

در واکنش، حساب‌های متقلب مسدود یا محدود شدند، کنترل‌های ثبت‌نام و زیرساخت تقویت شد و پایش شبکه حساب‌های مرتبط گسترش یافت. مسیر بازپخش بلوک استدلال متعلق به کاربر دیگر بسته شد، کنترل‌هایی برای تشخیص و متوقف کردن خروجی جریانیِ احتمالاً افشاکننده استدلال اضافه شد و حفاظت‌ها در مرز کاربران، فضاهای کاری، سازمان‌ها و خانواده‌های مدل تقویت شد. وقتی بخشی از فعالیت از خدمات طرف ثالث عبور کرد، ارائه‌دهندگان آن خدمات نیز در شناسایی و مختل کردن حساب‌های مربوط مشارکت کردند.

این پاسخ نشان می‌دهد مسئله فقط درخواست منفرد به یک مدل نبود: عاملان می‌توانستند درخواست‌های مشابه را میان حساب‌ها و مسیرهای ارائه خدمت توزیع کنند. برای تیم‌های ارائه‌دهنده API یا عامل‌های دارای استدلال محافظت‌شده، سه نقطه کنترل از سازوکار همین رخداد بیرون می‌آید:

  • بلوک استدلال قابل‌حمل باید هنگام انتقال میان کاربر، فضای کاری، سازمان یا خانواده مدل دوباره از نظر مرز دسترسی سنجیده شود.
  • خروجی جریانی باید برای آشکار شدن استدلال پنهان کنترل شود؛ پاسخ نهایی تنها جایی نیست که چنین محتوایی می‌تواند ظاهر شود.
  • پایش الگوی درخواست باید ارتباط حساب‌های متعدد و خدمات واسط را ببیند تا جهش هماهنگ به شکل رفتارهای کوچک و جداگانه پنهان نماند.

یافته‌های مربوط از مسیر Frontier Model Forum و کانال‌های دولتی تبادل اطلاعات به اشتراک گذاشته شد. گسترش حفاظت‌های مشابه به استقرارهای میزبانی‌شده نزد شرکا و مقابله با حمله از مسیر خروجی ابزارها هنوز در برنامه ادامه‌دار شرکت است. برای کاربران سامانه‌هایی که بلوک استدلال را میان درخواست‌ها جابه‌جا می‌کنند، امنیت چنین بلوکی به کنترل بازپخش و مرز هر جلسه نیز وابسته است.

بیشتر بخوانید:

اشتراک‌گذاری:

عضویت در خبرنامه

تازه‌ترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.

0