ChatGPT یا Perplexity برای تحقیق؛ تعداد منبع بیشتر مساوی دقت بیشتر نیست

|نویسنده: تیم تحریریه QUASA|7 دقیقه مطالعه| 2
ChatGPT یا Perplexity برای تحقیق؛ تعداد منبع بیشتر مساوی دقت بیشتر نیست

برای تحقیق مستند، اگر هنوز در پی یافتن منابع و زاویه‌های مسئله هستید، Perplexity می‌تواند نقطهٔ شروع مناسبی باشد. اگر پرسش شما چند بخش وابسته به هم دارد و می‌خواهید فایل‌های خود را نیز وارد روند تهیهٔ گزارش کنید، ChatGPT Deep Research امکانات مشخصی برای این کار دارد. هیچ‌یک را صرفاً با تعداد پیوندهای خروجی انتخاب نکنید؛ ارزش گزارش به ارتباط منابع با پرسش و پشتیبانی آن‌ها از ادعاها بستگی دارد.

این انتخاب برای پایان‌نامه، گزارش حرفه‌ای و پژوهش دربارهٔ ایران یا افغانستان به موضوع نیز وابسته است. گزارشی با منابع فراوان ممکن است عمدتاً به نوشته‌های عمومی انگلیسی تکیه کند، در حالی که پرسش به دادهٔ محلی، متن رسمی یا مقالهٔ اصلی نیاز دارد. دو اندازه‌گیری منتشرشده جنبه‌های متفاوتی از عملکرد این سرویس‌ها را روشن می‌کنند، اما نتیجهٔ هیچ‌کدام به‌تنهایی حکم کلی دربارهٔ همهٔ گزارش‌های فارسی نیست.

شمار منابع دقیقاً چه چیزی را اندازه می‌گیرد؟

در مطالعهٔ Prefer دربارهٔ ۹۶۰ پاسخ در سپتامبر ۲۰۲۶، Perplexity به‌طور میانگین ۱۹٫۴۸ و ChatGPT به‌طور میانگین ۳٫۰۵ منبع برای هر پاسخ آورد. این اعداد می‌گویند پاسخ‌ها در آن آزمایش چند پیوند ارائه کردند؛ نشان نمی‌دهند که متن هر صفحه واقعاً از جملهٔ کنار ارجاع پشتیبانی می‌کند. حتی چند پیوند متفاوت ممکن است یک ادعای اولیه را بازنشر کرده باشند و شاهد مستقلی به گزارش اضافه نکنند.

دامنهٔ آزمایش هم در تفسیر عدد مهم است. پرسش‌ها دربارهٔ جست‌وجوی هوش مصنوعی و بازاریابی جست‌وجو بودند و پاسخ‌ها با درخواست جست‌وجوی وب از طریق یک واسط API گردآوری شدند. بنابراین مقایسهٔ یادشده رفتار دو حالت Deep Research در برنامه‌های مصرف‌کننده را مستقیماً نمی‌سنجد. برای پژوهشگر، تعداد بیشتر می‌تواند سرنخ‌های بیشتری برای جست‌وجوی اولیه فراهم کند، ولی کیفیت آن سرنخ‌ها تازه پس از باز کردن صفحهٔ مقصد و بررسی متن آن معلوم می‌شود.

پوشش وب نیز فقط با شمار کل پیوندها سنجیده نمی‌شود. در پرسشی دربارهٔ یک مقررات، رسیدن به متن نهاد صادرکننده و نسخهٔ معتبر آن از یافتن چندین توضیح ثانویه مهم‌تر است. در مرور پژوهش‌ها، مقالهٔ اصلی، روش گردآوری داده و جامعهٔ بررسی‌شده وزن متفاوتی با خلاصه‌های وب دارند. اگر ابزار این تفاوت را در گزارش روشن نکند، فهرست بلند منابع ممکن است تصویر کامل‌تری از شواهد به خواننده ندهد.

قابلیت‌های پژوهش عمیق چه تفاوتی برای کار شما دارند؟

معرفی رسمی OpenAI از Deep Research جست‌وجوی چندمرحله‌ای در وب، بررسی متن، تصویر و PDF و تهیهٔ گزارش دارای ارجاع را شرح می‌دهد. در ChatGPT می‌توان فایل یا صفحه‌گسترده را به پرسش افزود و خلاصه‌ای از مراحل کار و منابع استفاده‌شده را دید. این ویژگی‌ها به‌ویژه وقتی مفیدند که مواد اولیه‌ای در اختیار دارید و می‌خواهید گزارش به پرسش‌ها و محدوده‌ای از پیش تعیین‌شده پاسخ دهد؛ وجود فایل ورودی البته درستی برداشت ابزار از آن را تضمین نمی‌کند.

در سوی دیگر، معرفی Perplexity از Deep Research جست‌وجوی تکرارشونده، خواندن اسناد، اصلاح مسیر پژوهش و ترکیب یافته‌ها در یک گزارش را توصیف می‌کند؛ خروجی آن را نیز می‌توان برای اشتراک‌گذاری صادر کرد. پس هر دو محصول برای پرسش‌های پیچیده فراتر از پاسخ کوتاه عمل می‌کنند. تفاوت تعیین‌کننده در یک کار مشخص این است که کدام‌یک به منابع اصلی مربوط به همان موضوع می‌رسد، اختلاف شواهد را درست بازگو می‌کند و امکان دنبال‌کردن ادعا تا متن پشتیبان را می‌دهد.

امتیاز بالاتر در DRACO چه معنایی دارد؟

در ارزیابی DRACO روی ۱۰۰ وظیفه، Perplexity Deep Research با مدل پایهٔ Opus 4.6 امتیاز نرمال‌شدهٔ ۷۰٫۵٪ و OpenAI Deep Research مبتنی بر o3 امتیاز ۵۲٫۱٪ گرفت؛ بیشتر نویسندگان این پژوهش وابسته به Perplexity هستند. این نتیجه به ترکیب سامانه و مدل آزموده‌شده تعلق دارد، نه به نام تجاری هر سرویس در هر نسخه و تنظیمی. همچنین درصدها سهم ارجاع‌های درست از کل ارجاع‌ها نیستند.

امتیاز کلی از معیارهای وزن‌دار دربارهٔ صحت واقعیت‌ها، گستره و عمق تحلیل، کیفیت ارائه و کیفیت استناد ساخته شده است. پاسخ‌ها را داور مبتنی بر مدل زبانی با معیارهای مخصوص هر وظیفه ارزیابی کرده است. از این رو، عدد کلی برای مقایسهٔ عملکرد آن پیکربندی‌ها در مجموعهٔ آزمون مفید است، اما جای بررسی یک ادعای مشخص در گزارش خودتان را نمی‌گیرد. کیفیت استناد در این آزمون بخشی از ارزیابی است؛ در اندازه‌گیری شمار منابعِ بخش پیشین اصلاً همان پرسش سنجیده نشده بود.

انتخاب وظایف نیز بر دامنهٔ نتیجه اثر می‌گذارد: پرسش‌های اولیه از درخواست‌های انگلیسی کاربران Perplexity گرفته، سپس بازنویسی و تکمیل شدند. آزمون خروجی متنیِ تعامل تک‌مرحله‌ای را بررسی می‌کند. بنابراین امتیاز بالاتر را باید شاهدی دربارهٔ همان شرایط دانست، نه پیش‌بینی آماده‌ای برای گفت‌وگوی چندمرحله‌ای به فارسی یا برای موضوعی که منابع اصلی آن در وب محلی پراکنده‌اند. وابستگی نویسندگان دلیل کنارگذاشتن داده نیست، اما هنگام وزن‌دادن به نتیجه باید همراه با روش انتخاب نمونه دیده شود.

چرا پیوند معتبر ممکن است ارجاع نامعتبر باشد؟

صحت ارجاع چند لایه دارد: صفحه باید باز شود، به همان موضوع و بازهٔ مورد بحث بپردازد و واقعاً گزارهٔ گزارش را پشتیبانی کند. ممکن است پیوندی به یک نشریهٔ معتبر برسد، اما مقالهٔ دیگری را نشان دهد؛ یا صفحهٔ درست، نتیجه‌ای محتاطانه بیان کند که گزارش آن را به ادعایی قطعی تبدیل کرده است. در هر دو حالت، ظاهر منبع‌دار پاسخ می‌تواند خواننده را دربارهٔ استحکام شواهد گمراه کند.

آزمون Tow Center دربارهٔ ارجاع به خبرها با ۱۶۰۰ پرسش از هشت ابزار جست‌وجوی هوش مصنوعی نشان داد که در بیش از ۶۰٪ پاسخ‌ها شناسایی مقاله، ناشر یا URL خطا داشت. این آزمایش دربارهٔ بازیابی مقاله از روی بخشی از متن خبر بود، نه سنجش مستقیم گزارش‌های Deep Research یا پژوهش دانشگاهی. بااین‌حال، روشن می‌کند که دیدن نام ناشر یا یک پیوند، به‌تنهایی بررسی منشأ ادعا را بی‌نیاز نمی‌کند.

برای موضوع‌های فارسی‌زبان یک لایهٔ دیگر هم وجود دارد: منبع ممکن است دربارهٔ کشور، نهاد یا دوره‌ای متفاوت باشد و تنها به‌خاطر شباهت واژه‌ها وارد گزارش شود. اگر دو منبع معتبر نتیجه‌های متفاوتی دارند، باید روش، نمونه و زمان آن‌ها کنار هم قرار گیرد. گزارشی که این اختلاف را توضیح می‌دهد، حتی با پیوندهای کمتر، برای استدلال پژوهشی مفیدتر از فهرستی است که اختلاف‌ها را پنهان می‌کند.

انتخاب ابزار و بازبینی گزارش

برای یافتن مسیرهای جست‌وجو، نام نهادها و منابع احتمالی، شروع با Perplexity انتخابی معقول است؛ این توصیه بر کاربرد فهرست گستردهٔ پیوندها به‌عنوان سرنخ تکیه دارد، نه بر ادعای دقت بیشتر آن. برای پرسشی چندبخشی که به فایل‌های خودتان و گزارش دارای ارجاع نیاز دارد، قابلیت‌های ChatGPT Deep Research را نیز بسنجید. اگر انتخاب میان خروجی دو سرویس مهم است، پرسش، محدودهٔ جغرافیایی، دورهٔ مورد نظر و انتظار از نوع منابع را برای هر دو یکسان بیان کنید.

سپس به‌جای مقایسهٔ طول گزارش، چند ادعای تعیین‌کنندهٔ نتیجه را بازبینی کنید:

  1. پیوند کنار هر ادعا را باز کنید و بخش دقیق پشتیبان آن را پیدا کنید. ارجاع به صفحهٔ اصلی یک وب‌سایت یا مطلبی صرفاً هم‌موضوع، برای اثبات آن جمله کافی نیست.
  2. مکان، زمان، جامعهٔ بررسی‌شده و معنای عدد یا اصطلاح را با عبارت گزارش تطبیق دهید. در ادعاهای مهم، مقاله، داده یا متن رسمی را بر بازنشر و خلاصه مقدم بدانید.
  3. اگر منابع اختلاف دارند، ببینید آیا دربارهٔ یک موضوع و دوره سخن می‌گویند و روش یکسانی داشته‌اند. ادعایی را که پشتوانه‌اش پیدا نمی‌شود محدودتر بنویسید یا کنار بگذارید.

ابزاری را برای همان پروژه برگزینید که ادعاهای اصلی‌اش با منابع مرتبط‌تر و قابل پیگیری‌تر پشتیبانی می‌شوند. این معیار ممکن است در موضوع‌های مختلف به انتخاب‌های متفاوتی برسد؛ شمار پیوندها فقط یکی از نشانه‌های پوشش است، نه جانشین صحت ارجاع.

بیشتر بخوانید:

اشتراک‌گذاری:

عضویت در خبرنامه

تازه‌ترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.

0