
ChatGPT یا Perplexity برای تحقیق؛ تعداد منبع بیشتر مساوی دقت بیشتر نیست

برای تحقیق مستند، اگر هنوز در پی یافتن منابع و زاویههای مسئله هستید، Perplexity میتواند نقطهٔ شروع مناسبی باشد. اگر پرسش شما چند بخش وابسته به هم دارد و میخواهید فایلهای خود را نیز وارد روند تهیهٔ گزارش کنید، ChatGPT Deep Research امکانات مشخصی برای این کار دارد. هیچیک را صرفاً با تعداد پیوندهای خروجی انتخاب نکنید؛ ارزش گزارش به ارتباط منابع با پرسش و پشتیبانی آنها از ادعاها بستگی دارد.
این انتخاب برای پایاننامه، گزارش حرفهای و پژوهش دربارهٔ ایران یا افغانستان به موضوع نیز وابسته است. گزارشی با منابع فراوان ممکن است عمدتاً به نوشتههای عمومی انگلیسی تکیه کند، در حالی که پرسش به دادهٔ محلی، متن رسمی یا مقالهٔ اصلی نیاز دارد. دو اندازهگیری منتشرشده جنبههای متفاوتی از عملکرد این سرویسها را روشن میکنند، اما نتیجهٔ هیچکدام بهتنهایی حکم کلی دربارهٔ همهٔ گزارشهای فارسی نیست.
شمار منابع دقیقاً چه چیزی را اندازه میگیرد؟
در مطالعهٔ Prefer دربارهٔ ۹۶۰ پاسخ در سپتامبر ۲۰۲۶، Perplexity بهطور میانگین ۱۹٫۴۸ و ChatGPT بهطور میانگین ۳٫۰۵ منبع برای هر پاسخ آورد. این اعداد میگویند پاسخها در آن آزمایش چند پیوند ارائه کردند؛ نشان نمیدهند که متن هر صفحه واقعاً از جملهٔ کنار ارجاع پشتیبانی میکند. حتی چند پیوند متفاوت ممکن است یک ادعای اولیه را بازنشر کرده باشند و شاهد مستقلی به گزارش اضافه نکنند.
دامنهٔ آزمایش هم در تفسیر عدد مهم است. پرسشها دربارهٔ جستوجوی هوش مصنوعی و بازاریابی جستوجو بودند و پاسخها با درخواست جستوجوی وب از طریق یک واسط API گردآوری شدند. بنابراین مقایسهٔ یادشده رفتار دو حالت Deep Research در برنامههای مصرفکننده را مستقیماً نمیسنجد. برای پژوهشگر، تعداد بیشتر میتواند سرنخهای بیشتری برای جستوجوی اولیه فراهم کند، ولی کیفیت آن سرنخها تازه پس از باز کردن صفحهٔ مقصد و بررسی متن آن معلوم میشود.
پوشش وب نیز فقط با شمار کل پیوندها سنجیده نمیشود. در پرسشی دربارهٔ یک مقررات، رسیدن به متن نهاد صادرکننده و نسخهٔ معتبر آن از یافتن چندین توضیح ثانویه مهمتر است. در مرور پژوهشها، مقالهٔ اصلی، روش گردآوری داده و جامعهٔ بررسیشده وزن متفاوتی با خلاصههای وب دارند. اگر ابزار این تفاوت را در گزارش روشن نکند، فهرست بلند منابع ممکن است تصویر کاملتری از شواهد به خواننده ندهد.
قابلیتهای پژوهش عمیق چه تفاوتی برای کار شما دارند؟
معرفی رسمی OpenAI از Deep Research جستوجوی چندمرحلهای در وب، بررسی متن، تصویر و PDF و تهیهٔ گزارش دارای ارجاع را شرح میدهد. در ChatGPT میتوان فایل یا صفحهگسترده را به پرسش افزود و خلاصهای از مراحل کار و منابع استفادهشده را دید. این ویژگیها بهویژه وقتی مفیدند که مواد اولیهای در اختیار دارید و میخواهید گزارش به پرسشها و محدودهای از پیش تعیینشده پاسخ دهد؛ وجود فایل ورودی البته درستی برداشت ابزار از آن را تضمین نمیکند.
در سوی دیگر، معرفی Perplexity از Deep Research جستوجوی تکرارشونده، خواندن اسناد، اصلاح مسیر پژوهش و ترکیب یافتهها در یک گزارش را توصیف میکند؛ خروجی آن را نیز میتوان برای اشتراکگذاری صادر کرد. پس هر دو محصول برای پرسشهای پیچیده فراتر از پاسخ کوتاه عمل میکنند. تفاوت تعیینکننده در یک کار مشخص این است که کدامیک به منابع اصلی مربوط به همان موضوع میرسد، اختلاف شواهد را درست بازگو میکند و امکان دنبالکردن ادعا تا متن پشتیبان را میدهد.
امتیاز بالاتر در DRACO چه معنایی دارد؟
در ارزیابی DRACO روی ۱۰۰ وظیفه، Perplexity Deep Research با مدل پایهٔ Opus 4.6 امتیاز نرمالشدهٔ ۷۰٫۵٪ و OpenAI Deep Research مبتنی بر o3 امتیاز ۵۲٫۱٪ گرفت؛ بیشتر نویسندگان این پژوهش وابسته به Perplexity هستند. این نتیجه به ترکیب سامانه و مدل آزمودهشده تعلق دارد، نه به نام تجاری هر سرویس در هر نسخه و تنظیمی. همچنین درصدها سهم ارجاعهای درست از کل ارجاعها نیستند.
امتیاز کلی از معیارهای وزندار دربارهٔ صحت واقعیتها، گستره و عمق تحلیل، کیفیت ارائه و کیفیت استناد ساخته شده است. پاسخها را داور مبتنی بر مدل زبانی با معیارهای مخصوص هر وظیفه ارزیابی کرده است. از این رو، عدد کلی برای مقایسهٔ عملکرد آن پیکربندیها در مجموعهٔ آزمون مفید است، اما جای بررسی یک ادعای مشخص در گزارش خودتان را نمیگیرد. کیفیت استناد در این آزمون بخشی از ارزیابی است؛ در اندازهگیری شمار منابعِ بخش پیشین اصلاً همان پرسش سنجیده نشده بود.
انتخاب وظایف نیز بر دامنهٔ نتیجه اثر میگذارد: پرسشهای اولیه از درخواستهای انگلیسی کاربران Perplexity گرفته، سپس بازنویسی و تکمیل شدند. آزمون خروجی متنیِ تعامل تکمرحلهای را بررسی میکند. بنابراین امتیاز بالاتر را باید شاهدی دربارهٔ همان شرایط دانست، نه پیشبینی آمادهای برای گفتوگوی چندمرحلهای به فارسی یا برای موضوعی که منابع اصلی آن در وب محلی پراکندهاند. وابستگی نویسندگان دلیل کنارگذاشتن داده نیست، اما هنگام وزندادن به نتیجه باید همراه با روش انتخاب نمونه دیده شود.
چرا پیوند معتبر ممکن است ارجاع نامعتبر باشد؟
صحت ارجاع چند لایه دارد: صفحه باید باز شود، به همان موضوع و بازهٔ مورد بحث بپردازد و واقعاً گزارهٔ گزارش را پشتیبانی کند. ممکن است پیوندی به یک نشریهٔ معتبر برسد، اما مقالهٔ دیگری را نشان دهد؛ یا صفحهٔ درست، نتیجهای محتاطانه بیان کند که گزارش آن را به ادعایی قطعی تبدیل کرده است. در هر دو حالت، ظاهر منبعدار پاسخ میتواند خواننده را دربارهٔ استحکام شواهد گمراه کند.
آزمون Tow Center دربارهٔ ارجاع به خبرها با ۱۶۰۰ پرسش از هشت ابزار جستوجوی هوش مصنوعی نشان داد که در بیش از ۶۰٪ پاسخها شناسایی مقاله، ناشر یا URL خطا داشت. این آزمایش دربارهٔ بازیابی مقاله از روی بخشی از متن خبر بود، نه سنجش مستقیم گزارشهای Deep Research یا پژوهش دانشگاهی. بااینحال، روشن میکند که دیدن نام ناشر یا یک پیوند، بهتنهایی بررسی منشأ ادعا را بینیاز نمیکند.
برای موضوعهای فارسیزبان یک لایهٔ دیگر هم وجود دارد: منبع ممکن است دربارهٔ کشور، نهاد یا دورهای متفاوت باشد و تنها بهخاطر شباهت واژهها وارد گزارش شود. اگر دو منبع معتبر نتیجههای متفاوتی دارند، باید روش، نمونه و زمان آنها کنار هم قرار گیرد. گزارشی که این اختلاف را توضیح میدهد، حتی با پیوندهای کمتر، برای استدلال پژوهشی مفیدتر از فهرستی است که اختلافها را پنهان میکند.
انتخاب ابزار و بازبینی گزارش
برای یافتن مسیرهای جستوجو، نام نهادها و منابع احتمالی، شروع با Perplexity انتخابی معقول است؛ این توصیه بر کاربرد فهرست گستردهٔ پیوندها بهعنوان سرنخ تکیه دارد، نه بر ادعای دقت بیشتر آن. برای پرسشی چندبخشی که به فایلهای خودتان و گزارش دارای ارجاع نیاز دارد، قابلیتهای ChatGPT Deep Research را نیز بسنجید. اگر انتخاب میان خروجی دو سرویس مهم است، پرسش، محدودهٔ جغرافیایی، دورهٔ مورد نظر و انتظار از نوع منابع را برای هر دو یکسان بیان کنید.
سپس بهجای مقایسهٔ طول گزارش، چند ادعای تعیینکنندهٔ نتیجه را بازبینی کنید:
- پیوند کنار هر ادعا را باز کنید و بخش دقیق پشتیبان آن را پیدا کنید. ارجاع به صفحهٔ اصلی یک وبسایت یا مطلبی صرفاً همموضوع، برای اثبات آن جمله کافی نیست.
- مکان، زمان، جامعهٔ بررسیشده و معنای عدد یا اصطلاح را با عبارت گزارش تطبیق دهید. در ادعاهای مهم، مقاله، داده یا متن رسمی را بر بازنشر و خلاصه مقدم بدانید.
- اگر منابع اختلاف دارند، ببینید آیا دربارهٔ یک موضوع و دوره سخن میگویند و روش یکسانی داشتهاند. ادعایی را که پشتوانهاش پیدا نمیشود محدودتر بنویسید یا کنار بگذارید.
ابزاری را برای همان پروژه برگزینید که ادعاهای اصلیاش با منابع مرتبطتر و قابل پیگیریتر پشتیبانی میشوند. این معیار ممکن است در موضوعهای مختلف به انتخابهای متفاوتی برسد؛ شمار پیوندها فقط یکی از نشانههای پوشش است، نه جانشین صحت ارجاع.
بیشتر بخوانید:
مقالات مرتبط


GraphRAG یا Vector RAG؛ گراف فقط در پرسشهای چندمرحلهای جلو میافتد

RAG را درست ارزیابی کنید؛ یک امتیاز خوب میتواند خطای بازیابی را پنهان کند

خلاصهٔ غلط هوش مصنوعی حافظه را هم عوض کرد؛ دقت از ۸۳٫۶٪ به ۴۴٫۸٪ رسید

۹۳٪ کارجویان خود را آمادهٔ AI میدانند؛ کارفرمایان انتظار بیشتری دارند

آنبوردینگ دورکار با فایل تمام نمیشود؛ دوست همراه و نخستین کار لازماند
عضویت در خبرنامه
تازهترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.