
Дуг контекст или RAG: више токена не значи увек бољи одговор

Ако је скуп докумената мали и питање тражи повезивање више његових делова, полазна опција је цео контекст. Ако је база велика, често се мења или корисник тражи конкретан податак, RAG прво проналази релевантне делове, па их шаље моделу. Хибрид има смисла када претрага може да одабере документе, али одговор захтева да модел прочита већи део изабраног документа.
Величина контекстног прозора сама не одређује који ће приступ дати бољи одговор. У упоредној евалуацији дугог контекста и RAG-а дуги контекст је углавном био успешнији на тестовима питања и одговора, нарочито на питањима заснованим на Википедији, док је RAG имао предност код дијалошких и општих питања. У истој евалуацији проналажење засновано на сажетку било је упоредиво са дугим контекстом, а проналажење по одломцима слабије. Избор зато зависи и од врсте питања и од начина на који систем проналази текст.
Колико текста модел може да искористи?
Контекстни прозор је граница капацитета, а не обећање да ће модел једнако добро користити сваки његов део. Документација за Claude наводи прозоре до милион токена, зависно од модела, али упозорава да тачност и присећање опадају како улаз расте. У исту границу улазе упутства, историја разговора, резултати алата, документи и нови одговор. Зато номинални капацитет није простор који се у целости може доделити корпусу.
Чак и када сви документи стају, положај важне информације може да утиче на резултат. У истраживању положаја релевантног податка испитани модели су га често успешније користили када је био на почетку или крају улаза него у средини. То је нарочито важно када се тражена одредба налази међу многим сличним одломцима: већи прозор омогућава да се сви пошаљу, али не гарантује да ће модел издвојити прави.
Шта претрага добија, а шта може да изгуби?
RAG смањује количину текста послатог моделу када је за одговор потребан само мали део корпуса. Пре генерисања одговора систем проналази одломке и шаље их уз питање. Тај избор има цену у квалитету: ако претрага изостави пресудан пасус или раздвоји правило од изузетка, модел неће имати све што му је потребно. Ширење пронађеног контекста може да помогне, али поново повећава број токена.
За интерну претрагу и корисничку подршку важно је да одговор задржи везу са документом из ког потиче. AWS-ов водич за RAG архитектуре описује припрему и индексирање докумената, претрагу и генерисање као одвојене делове система; индекс може да садржи текст и метаподатке, а поједине опције подржавају филтрирање и ажурирање извора. Водич разликује управљана и прилагођена решења и избор повезује са постојећом инфраструктуром, потребном латенцијом и правилима организације. Назив документа, одељак и верзија могу да прате пронађени одломак, мада исправно наведен одељак сам по себи не гарантује исправно тумачење.
Стабло одлуке: три врсте посла са документима
Прво питање је колики део корпуса типичан одговор заиста захтева. Затим је битно колико се извор мења и да ли питања траже један налаз, поређење више места или разумевање целине. Следећи случајеви су условни примери архитектонског избора, а не резултати спроведеног теста.
- Мали пакет уговора. Ако сви документи стају у расположиви буџет токена, а питања траже поређење одредаба кроз пакет, цео контекст је разумна полазна опција. Модел тада добија дефиниције, изузетке и упућивања између одредаба заједно. За одговор који мора да наведе основ, и у овом приступу сачувајте ознаке документа и одељка: слање целине не ствара аутоматски проверљив навод.
- Велика база знања која се мења. Ако питање обично захвата мали број страница, RAG је разумна полазна опција. Индекс треба ускладити са променама извора, а уз резултат пренети верзију документа и ограничења приступа. Када питање тражи поређење политика или тумачење читавог одељка, хибрид може прво да пронађе одговарајуће документе, а затим да моделу пошаље шири део сваког од њих.
- Дуг разговор о документима. За текући разговор користан је сажетак циља, отворених питања и донетих одлука, док се стари доказ поново проналази када постане потребан. Слање целе историје при сваком потезу увећава улаз и оставља мање простора за актуелно питање. Ако нови одговор зависи од прецизне раније формулације, потребан је изворни део разговора или документа, јер сажетак може да изостави услов који мења значење.
Граница преласка није исти број токена за сваки систем. Претрага постаје привлачнија када је релевантан део мали у односу на корпус који би се иначе слао изнова, под условом да проналажење редовно враћа све делове неопходне за одговор. Ако питања често повезују удаљене одредбе, шири контекст или цео одабрани документ могу бити вредни додатног улаза.
Цена целог контекста и цена индекса
Рачуницу поставите за исти период, исти модел и исти очекивани број упита. За цео контекст приближни трошак је број упита × [(заједнички улазни токени + токени целог корпуса) × цена улазног токена + токени одговора × цена излазног токена]. За RAG је то индексирање + ажурирање и чување индекса + број упита × [(заједнички улазни токени + токени пронађених делова) × цена улазног токена + токени одговора × цена излазног токена + цена претраге]. То је модел за поређење, па у конкретну рачуницу улазе стварни услови наплате и кеширања код добављача.
RAG финансијски добија предност када уштеда улазних токена по упиту, умањена за цену претраге, током посматраног периода покрије индексирање, ажурирање и чување. Ако је та разлика по упиту нула или негативна, већи број упита сам по себи неће поправити рачуницу. За хибрид раздвојте врсте питања: кратко тражење чињенице и поређење целих докумената немају исту количину пронађеног текста, цену ни трајање захтева.
Квалитет одређује коначну границу
Одлука о архитектури тражи исти скуп питања за оба приступа: питања о једној одредби, питања која спајају више докумената и питања на која у корпусу нема одговора. Поред тачности одговора, битно је да ли су моделу били доступни сви потребни делови текста, да ли наведени одељак стварно подржава тврдњу и колико траје цео захтев. Код RAG-а посебно се виде промашаји претраге; код целог контекста корисно је упоредити одговоре када се важан одломак налази на различитим местима у улазу.
Такво поређење може да постави границу по врсти питања, уместо једне границе за цео производ. Питање о једној страници може да прође кроз претрагу, док питање о међусобно повезаним одредбама добија читав пронађени документ. Избор тада прати стварну количину потребног контекста, цену и поузданост одговора.
Повезани чланци


ESA уводи Mistral AI у свемирске операције, уз европску инфраструктуру

Signal или Telegram: подразумевано шифровање мења цео избор

n8n или Make: број корака мења јефтинији избор

Claude Code или Codex: врста задатка бира победника

Claude је стигао до девет петљи, али није измислио нову физику
Претплатите се на наш билтен
Добијајте најновије вести о Web3, AI-у и криптовалутама директно у пријемно сандуче.