
خلاصهٔ غلط هوش مصنوعی حافظه را هم عوض کرد؛ دقت از ۸۳٫۶٪ به ۴۴٫۸٪ رسید

در گزارش ۲۵ سپتامبر ۲۰۲۶ دانشگاه جورجتاون از پژوهش مشترک با دانشگاه واشینگتن، ۸۳٫۶٪ کسانی که خلاصهٔ درست یک ویدئو را خوانده بودند، به پرسشی دربارهٔ تابلوی راهنمایی پاسخ صحیح دادند؛ این رقم پس از خواندن خلاصهٔ گمراهکنندهٔ هوش مصنوعی ۴۴٫۸٪ بود. پژوهشگران متن خلاصه را در آزمایشی کنترلشده تغییر دادند و دیدند همان جزئیات نادرست بر پاسخ بعدی افراد دربارهٔ صحنهای که خودشان دیده بودند اثر میگذارد.
این نتیجه به یادآوری یک جزئیات مشخص مربوط است، نه دقت حافظه در همهٔ زمینهها. به گفتهٔ متیا سیم، سرپرست پژوهش، در گزارش Neuroscience News، «AI is a new method of delivering misinformation». در این آزمایش، راه انتقال اطلاعات گمراهکننده متنی بود که شرکتکنندگان پس از دیدن ویدئو و پیش از پاسخدادن به پرسش حافظه خواندند.
شرکتکنندگان چه دیدند و چه زمانی خلاصه را خواندند؟
شرکتکنندگان ویدئویی انیمیشنی از خودرویی قرمز دیدند که به چهارراه میرسید، به راست میپیچید و با عابری که وارد خیابان شده بود برخورد میکرد. دو نسخهٔ ویدئو در یک جزئیات تعیینکننده فرق داشتند: خودرو در یکی به تابلوی ایست و در دیگری به تابلوی حق تقدم میرسید. افراد بهطور تصادفی یکی از نسخهها را دیدند تا نتیجه فقط بازتاب آسانتر بهخاطرماندن یکی از تابلوها نباشد.
در مقالهٔ پژوهشی ثبتشده در ۲۳ سپتامبر ۲۰۲۶ آمده است که ۳۳۱ نفر هر دو مرحله را تکمیل کردند؛ پس از کنار گذاشتن سه نفر که بررسی توجه را نگذرانده بودند، دادههای ۳۲۸ نفر تحلیل شد. فاصلهٔ دیدن ویدئو تا خواندن خلاصه ۲۴ تا ۴۸ ساعت بود. این فاصله مهم است، چون افراد هنگام مواجهه با متن دیگر صحنه را پیش چشم نداشتند و باید جزئیات آن را از حافظه بازیابی میکردند.
خلاصهای که در مرحلهٔ دوم به افراد نشان داده شد بر پایهٔ خروجی ChatGPT تهیه شده بود. پژوهشگران متنی را انتخاب و برای یکسانماندن شرایط تنظیم کردند، سپس اشارهٔ آن به تابلو را برای برخی افراد درست و برای برخی دیگر گمراهکننده گذاشتند. بعد از خواندن متن، از شرکتکنندگان خواستند بر اساس ویدئوی اصلی بگویند کدام تابلو را دیدهاند. بنابراین مقایسه، اثر یک جزئیات دستکاریشده در خلاصه را بر پاسخ به همان جزئیات میسنجد.
دانستن منشأ هوش مصنوعی متن چه اثری داشت؟
پژوهشگران علاوه بر درستی متن، برچسب نویسندهٔ آن را نیز تغییر دادند. به بخشی از افراد گفته شد خلاصه را هوش مصنوعی نوشته و به بخشی دیگر گفته شد نویسنده یک رونویس انسانی است؛ متن در عمل در هر دو حالت منشأ هوش مصنوعی داشت. این طراحی امکان میداد اثر محتوای گمراهکننده را از برداشت افراد دربارهٔ نویسنده جدا کنند.
برچسب «هوش مصنوعی» در این آزمایش اثر اطلاعات گمراهکننده را از میان نبرد. افراد حتی وقتی میدانستند متن به هوش مصنوعی نسبت داده شده است، ممکن بود تابلوی ذکرشده در خلاصه را به جای تابلوی دیدهشده در ویدئو انتخاب کنند. پژوهش همچنین رابطهٔ معناداری میان میزان اعتماد یا آشنایی افراد با هوش مصنوعی و مقاومت آنها در برابر این خطا پیدا نکرد؛ این یافته به شرایط همین آزمون محدود است.
نکتهٔ ظریف آزمایش آن است که شرکتکنندگان مأمور بودند به ویدئوی اصلی فکر کنند، نه اینکه پاسخ را از روی خلاصه بدهند. بااینحال، متنِ خواندهشده پس از رویداد بر پاسخ مربوط به آن اثر گذاشت. پژوهشگران از پاسخ افراد به پرسشهای دیگر نیز دریافتند که آنها بخشهای زیادی از صحنه را به یاد داشتند؛ اختلاف اصلی بر سر جزئیاتی بود که خلاصه دربارهٔ آن اطلاعات ناسازگار ارائه میکرد.
خلاصههای تولیدشده چه خطاهای دیگری داشتند؟
آزمایش انسانی تنها بخش پژوهش نبود. پژوهشگران در ارزیابی جداگانه، از ChatGPT و Gemini خواستند ویدئوهای مشابه را خلاصه کنند و خروجیها را با رویدادهای تصویر سنجیدند. هر یک از ۲۰ خلاصهٔ بررسیشده دستکم هفت خطا داشت. این متنها همان خلاصهٔ کنترلشدهای نبودند که برای سنجش حافظه به شرکتکنندگان نشان داده شد؛ ارزیابی آنها شکل خطاهای احتمالی در خروجی مدلها را نشان میداد.
بیشترین خطا از نوع حذف بود: بهطور میانگین ۵۱٫۶٪ جزئیات اصلی در آن خلاصهها نیامده بود و ۹۵٪ خلاصهها حتی به برخورد خودرو با عابر اشاره نکرده بودند. بعضی خروجیها مسیر حرکت را نادرست توصیف میکردند یا خودروها و عابران دیگری به صحنه میافزودند. حذف برخورد با عابر با عوضکردن نام تابلو یکسان نیست، اما هر دو نشان میدهند متنی روان میتواند روایت رویداد را به شکلی مهم تغییر دهد.
این خطاها برای خوانندهای که فقط خلاصه را میبیند بهآسانی آشکار نمیشوند. وقتی رخداد اصلی حذف شود، متن ممکن است همچنان پیوسته و باورپذیر به نظر برسد؛ وقتی جزئیاتی نادرست افزوده شود، همان جزئیات میتواند بعداً در پاسخ فرد دربارهٔ منبع اصلی ظاهر شود. بخش ارزیابی مدلها فراوانی و گونهٔ خطا را در ویدئوهای مورد استفاده نشان داد و بخش آزمایش انسانی اثر یک جزئیات گمراهکننده را بر یادآوری سنجید.
این نتیجه برای خلاصههای حساس چه معنایی دارد؟
خطر عملی زمانی پدید میآید که فرد خلاصه را پیش از ثبت روایت نهایی بخواند و برای تشخیص خطا تنها به حافظهٔ خود تکیه کند. در یک صورتجلسه، گزارش رویداد یا یادداشت بالینی، نام شخص، ترتیب رخدادها یا تصمیم ثبتشده ممکن است بعداً اهمیت پیدا کند. این کاربردها در آزمایش آزموده نشدند، اما سازوکار مشاهدهشده توضیح میدهد چرا بازبینی انسانی بر پایهٔ یادآوری، بهتنهایی، تضمین کافی برای درستبودن خلاصه نیست.
برای خلاصهای که قرار است مبنای تصمیم یا سابقهٔ رسمی شود، راستیآزمایی باید به ثبت اولیه برگردد. چکلیست کوتاه متناسب با خطاهای دیدهشده چنین است:
- جزئیات تعیینکننده، مانند شخص، زمان، تصمیم و ترتیب رویدادها، با ضبط جلسه، ویدئو یا پروندهٔ اصلی تطبیق داده شوند.
- حذف رخداد اصلی به اندازهٔ افزودن جزئیات نادرست بررسی شود؛ متن خوشخوان میتواند هر دو نوع خطا را پنهان کند.
- جزئیاتی که در منبع اولیه پیدا نشدهاند، پیش از ورود به گزارش نهایی بهعنوان واقعیت قطعی ثبت نشوند.
اینها تدابیر احتیاطی برگرفته از سازوکار آزمایشاند، نه نتیجهٔ یک آزمون میدانی دربارهٔ همهٔ سامانههای خلاصهساز. ویدئوها انیمیشنی بودند و آزمون حافظه بر تشخیص تابلو در صحنهٔ تصادف تمرکز داشت؛ اندازهٔ اثر بهدستآمده را نمیتوان مستقیم به پروندهٔ پزشکی، گزارش پلیس یا صورتجلسهٔ واقعی تعمیم داد. پژوهشگران بررسی ویدئوهای واقعیتر، از جمله تصاویر دوربین همراه مأموران، را در ادامه دنبال میکنند تا روشن شود این اثر در گزارشهای عملی چگونه ظاهر میشود.
مقالات مرتبط


آگهیهای فناوری به اوج سهساله رسید؛ بازار عمومی تقریباً ایستاد

ChatGPT یا Perplexity برای تحقیق؛ تعداد منبع بیشتر مساوی دقت بیشتر نیست

کپی ویدئوی YouTube را آرشیو نکنید؛ Archive چیزی را حذف نمیکند

عامل OpenAI وارد سامانهٔ دولتی استرالیا شد؛ گزارشدهی سه ماه طول کشید

GraphRAG یا Vector RAG؛ گراف فقط در پرسشهای چندمرحلهای جلو میافتد
عضویت در خبرنامه
تازهترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.