خلاصهٔ غلط هوش مصنوعی حافظه را هم عوض کرد؛ دقت از ۸۳٫۶٪ به ۴۴٫۸٪ رسید

|نویسنده: تیم تحریریه QUASA|5 دقیقه مطالعه
خلاصهٔ غلط هوش مصنوعی حافظه را هم عوض کرد؛ دقت از ۸۳٫۶٪ به ۴۴٫۸٪ رسید

در گزارش ۲۵ سپتامبر ۲۰۲۶ دانشگاه جورج‌تاون از پژوهش مشترک با دانشگاه واشینگتن، ۸۳٫۶٪ کسانی که خلاصهٔ درست یک ویدئو را خوانده بودند، به پرسشی دربارهٔ تابلوی راهنمایی پاسخ صحیح دادند؛ این رقم پس از خواندن خلاصهٔ گمراه‌کنندهٔ هوش مصنوعی ۴۴٫۸٪ بود. پژوهشگران متن خلاصه را در آزمایشی کنترل‌شده تغییر دادند و دیدند همان جزئیات نادرست بر پاسخ بعدی افراد دربارهٔ صحنه‌ای که خودشان دیده بودند اثر می‌گذارد.

این نتیجه به یادآوری یک جزئیات مشخص مربوط است، نه دقت حافظه در همهٔ زمینه‌ها. به گفتهٔ متیا سیم، سرپرست پژوهش، در گزارش Neuroscience News، «AI is a new method of delivering misinformation». در این آزمایش، راه انتقال اطلاعات گمراه‌کننده متنی بود که شرکت‌کنندگان پس از دیدن ویدئو و پیش از پاسخ‌دادن به پرسش حافظه خواندند.

شرکت‌کنندگان چه دیدند و چه زمانی خلاصه را خواندند؟

شرکت‌کنندگان ویدئویی انیمیشنی از خودرویی قرمز دیدند که به چهارراه می‌رسید، به راست می‌پیچید و با عابری که وارد خیابان شده بود برخورد می‌کرد. دو نسخهٔ ویدئو در یک جزئیات تعیین‌کننده فرق داشتند: خودرو در یکی به تابلوی ایست و در دیگری به تابلوی حق تقدم می‌رسید. افراد به‌طور تصادفی یکی از نسخه‌ها را دیدند تا نتیجه فقط بازتاب آسان‌تر به‌خاطرماندن یکی از تابلوها نباشد.

در مقالهٔ پژوهشی ثبت‌شده در ۲۳ سپتامبر ۲۰۲۶ آمده است که ۳۳۱ نفر هر دو مرحله را تکمیل کردند؛ پس از کنار گذاشتن سه نفر که بررسی توجه را نگذرانده بودند، داده‌های ۳۲۸ نفر تحلیل شد. فاصلهٔ دیدن ویدئو تا خواندن خلاصه ۲۴ تا ۴۸ ساعت بود. این فاصله مهم است، چون افراد هنگام مواجهه با متن دیگر صحنه را پیش چشم نداشتند و باید جزئیات آن را از حافظه بازیابی می‌کردند.

خلاصه‌ای که در مرحلهٔ دوم به افراد نشان داده شد بر پایهٔ خروجی ChatGPT تهیه شده بود. پژوهشگران متنی را انتخاب و برای یکسان‌ماندن شرایط تنظیم کردند، سپس اشارهٔ آن به تابلو را برای برخی افراد درست و برای برخی دیگر گمراه‌کننده گذاشتند. بعد از خواندن متن، از شرکت‌کنندگان خواستند بر اساس ویدئوی اصلی بگویند کدام تابلو را دیده‌اند. بنابراین مقایسه، اثر یک جزئیات دست‌کاری‌شده در خلاصه را بر پاسخ به همان جزئیات می‌سنجد.

دانستن منشأ هوش مصنوعی متن چه اثری داشت؟

پژوهشگران علاوه بر درستی متن، برچسب نویسندهٔ آن را نیز تغییر دادند. به بخشی از افراد گفته شد خلاصه را هوش مصنوعی نوشته و به بخشی دیگر گفته شد نویسنده یک رونویس انسانی است؛ متن در عمل در هر دو حالت منشأ هوش مصنوعی داشت. این طراحی امکان می‌داد اثر محتوای گمراه‌کننده را از برداشت افراد دربارهٔ نویسنده جدا کنند.

برچسب «هوش مصنوعی» در این آزمایش اثر اطلاعات گمراه‌کننده را از میان نبرد. افراد حتی وقتی می‌دانستند متن به هوش مصنوعی نسبت داده شده است، ممکن بود تابلوی ذکرشده در خلاصه را به جای تابلوی دیده‌شده در ویدئو انتخاب کنند. پژوهش همچنین رابطهٔ معناداری میان میزان اعتماد یا آشنایی افراد با هوش مصنوعی و مقاومت آن‌ها در برابر این خطا پیدا نکرد؛ این یافته به شرایط همین آزمون محدود است.

نکتهٔ ظریف آزمایش آن است که شرکت‌کنندگان مأمور بودند به ویدئوی اصلی فکر کنند، نه اینکه پاسخ را از روی خلاصه بدهند. بااین‌حال، متنِ خوانده‌شده پس از رویداد بر پاسخ مربوط به آن اثر گذاشت. پژوهشگران از پاسخ افراد به پرسش‌های دیگر نیز دریافتند که آن‌ها بخش‌های زیادی از صحنه را به یاد داشتند؛ اختلاف اصلی بر سر جزئیاتی بود که خلاصه دربارهٔ آن اطلاعات ناسازگار ارائه می‌کرد.

خلاصه‌های تولیدشده چه خطاهای دیگری داشتند؟

آزمایش انسانی تنها بخش پژوهش نبود. پژوهشگران در ارزیابی جداگانه، از ChatGPT و Gemini خواستند ویدئوهای مشابه را خلاصه کنند و خروجی‌ها را با رویدادهای تصویر سنجیدند. هر یک از ۲۰ خلاصهٔ بررسی‌شده دست‌کم هفت خطا داشت. این متن‌ها همان خلاصهٔ کنترل‌شده‌ای نبودند که برای سنجش حافظه به شرکت‌کنندگان نشان داده شد؛ ارزیابی آن‌ها شکل خطاهای احتمالی در خروجی مدل‌ها را نشان می‌داد.

بیشترین خطا از نوع حذف بود: به‌طور میانگین ۵۱٫۶٪ جزئیات اصلی در آن خلاصه‌ها نیامده بود و ۹۵٪ خلاصه‌ها حتی به برخورد خودرو با عابر اشاره نکرده بودند. بعضی خروجی‌ها مسیر حرکت را نادرست توصیف می‌کردند یا خودروها و عابران دیگری به صحنه می‌افزودند. حذف برخورد با عابر با عوض‌کردن نام تابلو یکسان نیست، اما هر دو نشان می‌دهند متنی روان می‌تواند روایت رویداد را به شکلی مهم تغییر دهد.

این خطاها برای خواننده‌ای که فقط خلاصه را می‌بیند به‌آسانی آشکار نمی‌شوند. وقتی رخداد اصلی حذف شود، متن ممکن است همچنان پیوسته و باورپذیر به نظر برسد؛ وقتی جزئیاتی نادرست افزوده شود، همان جزئیات می‌تواند بعداً در پاسخ فرد دربارهٔ منبع اصلی ظاهر شود. بخش ارزیابی مدل‌ها فراوانی و گونهٔ خطا را در ویدئوهای مورد استفاده نشان داد و بخش آزمایش انسانی اثر یک جزئیات گمراه‌کننده را بر یادآوری سنجید.

این نتیجه برای خلاصه‌های حساس چه معنایی دارد؟

خطر عملی زمانی پدید می‌آید که فرد خلاصه را پیش از ثبت روایت نهایی بخواند و برای تشخیص خطا تنها به حافظهٔ خود تکیه کند. در یک صورت‌جلسه، گزارش رویداد یا یادداشت بالینی، نام شخص، ترتیب رخدادها یا تصمیم ثبت‌شده ممکن است بعداً اهمیت پیدا کند. این کاربردها در آزمایش آزموده نشدند، اما سازوکار مشاهده‌شده توضیح می‌دهد چرا بازبینی انسانی بر پایهٔ یادآوری، به‌تنهایی، تضمین کافی برای درست‌بودن خلاصه نیست.

برای خلاصه‌ای که قرار است مبنای تصمیم یا سابقهٔ رسمی شود، راستی‌آزمایی باید به ثبت اولیه برگردد. چک‌لیست کوتاه متناسب با خطاهای دیده‌شده چنین است:

  • جزئیات تعیین‌کننده، مانند شخص، زمان، تصمیم و ترتیب رویدادها، با ضبط جلسه، ویدئو یا پروندهٔ اصلی تطبیق داده شوند.
  • حذف رخداد اصلی به اندازهٔ افزودن جزئیات نادرست بررسی شود؛ متن خوش‌خوان می‌تواند هر دو نوع خطا را پنهان کند.
  • جزئیاتی که در منبع اولیه پیدا نشده‌اند، پیش از ورود به گزارش نهایی به‌عنوان واقعیت قطعی ثبت نشوند.

این‌ها تدابیر احتیاطی برگرفته از سازوکار آزمایش‌اند، نه نتیجهٔ یک آزمون میدانی دربارهٔ همهٔ سامانه‌های خلاصه‌ساز. ویدئوها انیمیشنی بودند و آزمون حافظه بر تشخیص تابلو در صحنهٔ تصادف تمرکز داشت؛ اندازهٔ اثر به‌دست‌آمده را نمی‌توان مستقیم به پروندهٔ پزشکی، گزارش پلیس یا صورت‌جلسهٔ واقعی تعمیم داد. پژوهشگران بررسی ویدئوهای واقعی‌تر، از جمله تصاویر دوربین همراه مأموران، را در ادامه دنبال می‌کنند تا روشن شود این اثر در گزارش‌های عملی چگونه ظاهر می‌شود.

اشتراک‌گذاری:

عضویت در خبرنامه

تازه‌ترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.

0