GraphRAG یا Vector RAG؛ گراف فقط در پرسش‌های چندمرحله‌ای جلو می‌افتد

|نویسنده: تیم تحریریه QUASA|6 دقیقه مطالعه| 1
GraphRAG یا Vector RAG؛ گراف فقط در پرسش‌های چندمرحله‌ای جلو می‌افتد

اگر پاسخ بیشتر پرسش‌های کاربران در یک قطعهٔ متن پیدا می‌شود، Vector RAG معمولاً نقطهٔ شروع مناسب‌تری است. شواهد مقایسه‌ای نشان می‌دهند که مزیت روش گراف‌محور در پاسخ‌گویی به پرسش‌های چندمرحله‌ای آشکار می‌شود؛ یعنی جایی که پاسخ به پیوند دادن واقعیت‌های پراکنده نیاز دارد. صرف بزرگ بودن مجموعهٔ اسناد، دلیل کافی برای ساخت گراف نیست.

این انتخاب هم بر کیفیت پاسخ اثر دارد و هم بر هزینهٔ آماده‌سازی داده. بازیابی برداری قطعه‌های نزدیک به پرسش را پیدا می‌کند؛ گراف می‌تواند رابطهٔ میان موجودیت‌ها را نیز وارد مسیر بازیابی کند، اما ساخت و به‌روز نگه داشتن آن رابطه‌ها کار بیشتری می‌طلبد. برای تصمیم معماری باید دید پرسش‌های مهم سامانه چه نوع شاهدی می‌خواهند، نه اینکه فقط تعداد اسناد را شمرد.

هر روش چه چیزی را برای بازیابی آماده می‌کند؟

در مسیر برداری، سند به قطعه‌های متن تقسیم می‌شود و نمایش برداری آن‌ها امکان جست‌وجوی معنایی را فراهم می‌کند. پرسشی مانند یافتن یک مهلت یا تعریف مشخص، اغلب با بازیابی قطعه‌ای که همان واقعیت را دارد پاسخ می‌گیرد. وقتی پاسخ میان چند قطعه پخش شده باشد، نزدیک بودن هر قطعه به متن پرسش لزوماً نشان نمی‌دهد که آن قطعه‌ها چه رابطه‌ای با یکدیگر دارند.

در طرح رسمی GraphRAG مایکروسافت، موجودیت‌ها و رابطه‌ها از متن استخراج می‌شوند، گراف به اجتماع‌های سلسله‌مراتبی تقسیم می‌شود و برای اجتماع‌ها خلاصه ساخته می‌شود. جست‌وجو سپس می‌تواند از همسایگی یک موجودیت یا از خلاصه‌های سطح بالاتر کمک بگیرد. این ظرفیت به کیفیت مرحلهٔ ساخت وابسته است: اگر دو نام به‌اشتباه یکی فرض شوند یا رابطه‌ای از متن استخراج نشود، مسیر بازیابی نیز بر همان ساختار ناقص تکیه می‌کند.

اعداد بنچمارک کجا برتری را نشان می‌دهند؟

در ارزیابی نظام‌مند Han و همکاران با مدل پاسخ‌ساز Llama-3.1-8B-Instruct، در مجموعهٔ تک‌مرحله‌ای Natural Questions امتیاز F1 روش RAG برابر ۶۴٫۷۸ و Community-GraphRAG با جست‌وجوی محلی ۶۳٫۰۱ بود؛ در مجموعهٔ MultiHop-RAG، دقت کلی HippoRAG2 به ۷۰٫۲۷٪ و RAG به ۶۷٫۰۲٪ رسید. این اعداد نتیجهٔ سامانه‌های کامل در شرایط همان آزمون‌اند، نه امتیاز مستقلِ یک پایگاه برداری یا یک گراف.

تفاوت نام روش‌های گرافی اهمیت دارد. نتیجهٔ چندمرحله‌ای به HippoRAG2 تعلق دارد و نمی‌توان آن را به همهٔ پیاده‌سازی‌های GraphRAG نسبت داد. افزون بر این، F1 و دقت کلی دو سنجهٔ متفاوت روی دو مجموعهٔ متفاوت‌اند؛ اختلاف آن‌ها اندازهٔ سودی نیست که یک سامانه پس از تغییر معماری تضمین‌شده به دست می‌آورد. پیام قابل استفادهٔ آزمون، تغییر جهت برتری با تغییر شکل پرسش است.

همهٔ پرسش‌هایی که در یک مجموعهٔ چندمرحله‌ای قرار می‌گیرند نیز رفتار یکسان ندارند. پرسش‌های مقایسه‌ای یا زمانی می‌توانند از پیوندهای استخراج‌شده سود ببرند، در حالی که پرسش دارای یک پاسخ صریح ممکن است با متن اصلی بهتر پاسخ داده شود. بنابراین برچسب مجموعهٔ آزمون جای بررسی پرسش‌های واقعی محصول را نمی‌گیرد؛ به‌ویژه برای دادهٔ فارسی که کیفیت تشخیص نام‌ها و رابطه‌ها باید در همان زبان سنجیده شود.

ماتریس انتخاب بر پایهٔ شکل پرسش

  • تک‌مرحله‌ای: در یک مثال فرضی، کاربر می‌پرسد «مهلت ثبت درخواست در کدام بند آمده است؟» اگر پاسخ در یک قطعهٔ مشخص باشد، Vector RAG می‌تواند همان شاهد را مستقیم برگرداند. افزودن گراف برای چنین پرسشی معمولاً مسیر پاسخ را طولانی‌تر می‌کند، بی‌آنکه رابطهٔ تازه‌ای برای کشف وجود داشته باشد.
  • چندمرحله‌ای: در مثالی فرضی، پاسخ به «کدام تصمیم بر طرحی اثر گذاشت که بعداً به گروه دیگری واگذار شد؟» در چند سند پراکنده است. سامانه باید تصمیم، طرح و واگذاری را به هم وصل کند. گرافِ درست‌ساخته می‌تواند این مسیر رابطه‌ای را به بازیابی وارد کند؛ ارزش آن به این بستگی دارد که همین نوع پرسش در کاربرد واقعی چقدر مهم باشد.
  • کل‌نگر: در مثالی فرضی، کاربر می‌پرسد «موضوع‌های مشترک گزارش‌های چند گروه چیست؟» هدف، جمع‌بندی الگوهای مجموعه است، نه یافتن یک واقعیت کوتاه. خلاصه‌های اجتماع‌ها برای پوشش این گستره طراحی شده‌اند، اما پاسخ کلی ممکن است جزئیات موجود در متن اسناد را کنار بگذارد.

مرز عملی این دسته‌ها، محل شواهد لازم برای پاسخ است. یک پرسش طولانی می‌تواند تک‌مرحله‌ای باشد اگر شاهد آن در یک بند قرار گیرد؛ یک پرسش کوتاه نیز ممکن است چندمرحله‌ای باشد اگر برای پاسخ به آن باید هویت‌ها یا رویدادهای ثبت‌شده در اسناد جداگانه به هم وصل شوند. به همین دلیل، طول پرسش یا شمار کلمات آن معیار مناسبی برای انتخاب مسیر بازیابی نیست.

پرسش کل‌نگر چه تفاوتی با استدلال چندمرحله‌ای دارد؟

شرح موتور جست‌وجوی GraphRAG جست‌وجوی محلی را ترکیبی از دادهٔ گراف و قطعه‌های متن اصلی معرفی می‌کند؛ جست‌وجوی سراسری بر گزارش‌های اجتماع‌ها تکیه دارد و برای پرسش دربارهٔ کل مجموعه طراحی شده است. همان شرح، مسیر سراسری را پرمصرف توصیف می‌کند. پس «استفاده از گراف» به‌تنهایی نوع شاهدی را که به مدل می‌رسد مشخص نمی‌کند.

این تمایز برای پرسشی که نام، تاریخ یا عبارت دقیقی می‌خواهد تعیین‌کننده است. خلاصهٔ سطح بالا ممکن است آن جزئیات را حذف کرده باشد، هرچند تصویری مناسب از موضوع‌های تکرارشونده بدهد. در سوی دیگر، چند قطعهٔ نزدیک به یک پرسش کل‌نگر ممکن است فقط گوشه‌ای از مجموعه را پوشش دهند. کاربرد جمع‌بندی سراسری را باید جدا از برتری مشاهده‌شده در پاسخ‌گویی چندمرحله‌ای سنجید؛ مناسب بودن یک مسیر برای یک کار، نتیجهٔ بنچمارک کار دیگر را ثابت نمی‌کند.

هزینهٔ ساخت و نگهداری گراف از کجا می‌آید؟

در روش استاندارد، استخراج موجودیت و رابطه، یکپارچه کردن توصیف‌های تکراری و ساخت گزارش اجتماع‌ها به پردازش بیشتری نسبت به نمایهٔ برداری متن نیاز دارد. شرح روش‌های نمایه‌سازی مایکروسافت سهم استخراج گراف را حدود ۷۵٪ هزینهٔ نمایه‌سازی روش استاندارد برآورد می‌کند. این سهم، برآورد خط لولهٔ همان پروژه است و قیمت ثابتی برای هر پیکره، مدل یا زبان به حساب نمی‌آید.

روش FastGraphRAG بخشی از استخراج مبتنی بر مدل زبانی را با روش‌های پردازش زبان جایگزین می‌کند و هزینه را کاهش می‌دهد، ولی رابطه‌های حاصل بیشتر بر هم‌رخدادی در متن متکی‌اند و گراف می‌تواند نویز بیشتری داشته باشد. چنین مبادله‌ای برای جمع‌بندی‌های وسیع ممکن است پذیرفتنی باشد؛ برای پرسشی که به تشخیص دقیق رابطهٔ میان دو موجودیت وابسته است، کیفیت همان رابطه بخش اصلی تصمیم است. در داده‌ای که مرتب تغییر می‌کند، تازه ماندن موجودیت‌ها، پیوندها و خلاصه‌های وابسته نیز به هزینهٔ اجرا اضافه می‌شود.

چه زمانی پیچیدگی اضافه توجیه دارد؟

مبنای انتخاب، مجموعه‌ای از پرسش‌های نمایندهٔ کاربرد واقعی است: کدام پاسخ با یک قطعه به دست می‌آید، کدام به پیوند چند شاهد نیاز دارد و کدام جمع‌بندی کل مجموعه را می‌خواهد؟ اگر پرسش‌های مستقیم غالب‌اند، بهبود قطعه‌بندی، بازیابی و رتبه‌بندی مسیر برداری می‌تواند پیش از ساخت گراف بررسی شود. اگر پرسش‌های رابطه‌محور سهم مهمی دارند، آزمودن مسیر گرافی روی همان پرسش‌ها مبنای روشن‌تری برای پذیرفتن هزینهٔ نمایه‌سازی فراهم می‌کند.

در چنین آزمونی، کیفیت پاسخ نهایی تنها معیار نیست: باید معلوم شود شاهدهای لازم بازیابی شده‌اند، رابطهٔ موردنیاز درست ثبت شده و جزئیات پاسخ به متن اصلی برمی‌گردند. همچنین می‌توان پرسش‌های مستقیم را به مسیر برداری و پرسش‌های رابطه‌محور را به مسیر گرافی فرستاد. این انتخابِ ترکیبی خود به تشخیص نوع پرسش و نگهداری هر دو نمایه نیاز دارد؛ زمانی ارزشمند است که بهبود پاسخ به پرسش‌های مهم سامانه، این هزینهٔ اضافه را جبران کند.

اشتراک‌گذاری:

عضویت در خبرنامه

تازه‌ترین اخبار Web3، هوش مصنوعی و رمزارز را مستقیم در صندوق ایمیل خود دریافت کنید.

0