
RAG ці fine-tuning: свежыя факты і стыль патрабуюць розных падыходаў

Калі карпаратыўны памочнік павінен адказваць паводле дакументаў, якія змяняюцца, і паказваць падставу для фактаў, пачынайце з RAG: кіраўніцтва AWS раіць гэты падыход для пытанняў па ўласных дакументах. Калі галоўная цяжкасць — устойлівы фармат, тон або тэрміналогія, разглядайце fine-tuning, або данавучанне мадэлі. Калі патрэбны і актуальныя звесткі, і аднолькавы спосаб адказу, падыходы можна спалучыць.
Розніца ў тым, дзе сістэма атрымлівае патрэбнае для адказу. RAG знаходзіць фрагменты ў базе і перадае іх мадэлі разам з пытаннем; fine-tuning змяняе паводзіны мадэлі праз навучальныя прыклады. Таму аб’ём карпаратыўных файлаў сам па сабе не вызначае выбар. Важней, ці павінны новыя звесткі хутка трапляць у адказы, ці патрэбныя спасылкі і наколькі строга трэба паўтараць заданую форму.
Якія патрабаванні вызначаюць выбар
- Калі правілы, інструкцыі або апісанні прадуктаў часта змяняюцца, патрэбны спосаб абнаўляць крыніцы адказу. Для пытанняў па такіх дакументах адпраўны варыянт — RAG.
- Калі супрацоўнік павінен адкрыць дакумент і звярыць адказ з патрэбнай рэдакцыяй, сістэма мусіць захоўваць паходжанне знойдзенага фрагмента і даваць спасылку на яго.
- Калі факты ў адказе правільныя, але рэгулярна парушаюцца структура, тон або прынятыя назвы, спачатку праверце дакладную падказку з прыкладамі. Fine-tuning мае сэнс, калі гэтага недастаткова.
- Калі абодва патрабаванні істотныя, параўнайце гібрыд з адным RAG. Навучанне дадае працу з прыкладамі, таму яго карысць павінна быць бачная ў выніку, а не толькі ў апісанні архітэктуры.
Гэтыя пытанні варта задаць да параўнання тарыфаў на выклікі мадэлі. Умоўнаму памочніку па ўнутраных інструкцыях патрэбны правільны раздзел дакумента, а генератару кароткіх адказаў з ужо пададзеных карыстальнікам фактаў — прадказальная форма. Абедзве задачы могуць выкарыстоўваць карпаратыўныя даныя, але патрабуюць розных выдаткаў на падрыхтоўку і падтрымку.
Калі RAG дае актуальны і правяральны адказ
RAG карысны, калі адказ залежыць ад канкрэтнай версіі дакумента. Паводле тлумачэння Microsoft Foundry, сістэма знаходзіць адпаведны змест у індэксе, дадае яго да запыту мадэлі і можа вярнуць спасылкі на выкарыстаныя матэрыялы. Новы змест можна ўнесці ў базу без паўторнага навучання самой мадэлі.
Актуальнасць тут залежыць ад усяго шляху дакумента да адказу. Тэкст трэба падзяліць на прыдатныя для пошуку фрагменты, захаваць назву і версію крыніцы, а пры пошуку ўлічыць правы доступу. Калі знаходзіцца састарэлы раздзел, спасылка толькі робіць памылку больш пераканаўчай. У базе з беларускімі і рускімі рэдакцыямі аднаго дакумента важна адрозніваць патрэбную мову і версію, а не выбіраць тэкст толькі паводле сэнсавай блізкасці.
Пошук таксама не гарантуе, што мадэль дакладна перадасць знойдзены фрагмент. Якасць варта раздзяляць на тры пытанні: ці трапіў у кантэкст патрэбны дакумент, ці адпавядае яму адказ і ці вядзе спасылка да сцверджанага факту. Гэта дапамагае зразумець, што выпраўляць: падрыхтоўку базы, пошук або інструкцыю мадэлі. Калі трэба абагульніць вялікі дакумент цалкам, пошук асобных фрагментаў можа прапусціць істотны кантэкст.
Калі патрэбна данавучанне мадэлі
Fine-tuning варта разглядаць, калі мадэль ужо атрымлівае правільныя факты, але не трымаецца патрабаванняў да спосабу адказу. рэкамендацыі AWS па архітэктуры называюць падставай для яго асаблівы стыль, фармат або вузкую тэрміналогію, якія цяжка надзейна задаць падказкай ці RAG. Для навучання патрэбныя якасныя пары «запыт — пажаданы адказ», што прадстаўляюць рэальныя працоўныя сітуацыі.
Напрыклад, умоўны аддзел падтрымкі патрабуе адказаў з нязменным парадкам палёў і прынятымі беларускімі назвамі дэталяў. Прыклады могуць дапамагчы мадэлі засвоіць гэтую форму. Але характарыстыкі дэталяў, якія змяняюцца, усё роўна трэба падаваць з актуальнай крыніцы: данавучаная мадэль сама па сабе не паказвае, з якога дакумента ўзяты канкрэтны факт.
Перад навучаннем варта параўнаць вынік з добрай падказкай, прыкладамі ў запыце і невялікім тэрміналагічным слоўнікам. Калі іх дастаткова, падрыхтоўка навучальнага набору не дае патрэбнай карысці. Калі форма ўсё ж зрываецца на новых пытаннях, правярайце данавучаную мадэль на прыкладах, якіх не было пры падрыхтоўцы: запамінанне навучальных адказаў яшчэ не азначае ўстойлівых паводзін у працы.
Чаму танны выклік можа даць дарагі адказ
Для выбару важны кошт прынятага адказу, а не толькі цана аднаго выкліку мадэлі. У даследаванні на двух закрытых аўтамабільных наборах BMW Group невялікія адкрытыя мадэлі з RAG наблізіліся па якасці да буйнейшых мадэляў, а базавая канфігурацыя на задачах пра якасць аўтамабіля дала разліковы поўны кошт $1,43 за вырашаную задачу супраць прынятых у разліку $1 за ручное выкананне. У поўны кошт даследчыкі ўключылі паўторныя спробы, праверку адказу чалавекам і ручную працу, калі карыстальнік адмаўляецца ад новых спроб.
Гэтыя сумы — вынік мадэлі выдаткаў з зададзенымі дапушчэннямі, а не назіранне за аплатай працы ў беларускай кампаніі. Пытанні для даследавання былі створаны аўтаматычна з рэальных дакументаў, а правільнасць адказаў ацэньвала іншая мадэль. Таму выснова пра выгаду RAG у тых умовах не задае ўніверсальнай цаны або дакладнасці для чужой базы.
У сваім разліку злучайце выдаткі на падрыхтоўку дакументаў ці навучальных прыкладаў, пошук, выклікі мадэлі, абнаўленні і час спецыяліста. Калі адказ трэба правяраць, паўтараць запыт або шукаць звесткі ўручную, гэтыя дзеянні ўваходзяць у цану выніку. Пры вялікім патоку падобных запытаў першапачатковыя выдаткі на данавучанне размяркоўваюцца паміж большай колькасцю адказаў; пры частых зменах дакументаў вяртаецца праца па падтрымцы актуальнасці. Доўгі кантэкст RAG таксама каштуе грошай, асабліва калі пошук дадае нерэлевантныя фрагменты.
Калі спалучэнне апраўданае
Гібрыд патрэбны, калі адзін адказ адначасова патрабуе свежага факту з дакумента і строга вызначанай формы. RAG дастаўляе фрагмент разам з яго паходжаннем, а данавучаная мадэль выкарыстоўвае гэты кантэкст і захоўвае ўзоры адказу. Умоўны прыклад — памочнік, які адказвае паводле абноўленых унутраных інструкцый, але заўсёды выкарыстоўвае прынятую тэрміналогію і кароткую структуру тлумачэння.
Такое спалучэнне дадае падтрымку абодвух кампанентаў. Калі пошук ужо дае дакладны факт, а падказка ўтрымлівае патрэбную форму, данавучанне можа не палепшыць вынік настолькі, каб апраўдаць падрыхтоўку прыкладаў. Калі ж патрабаванне да формы стабільна не выконваецца, параўноўвайце RAG і гібрыд на адных пытаннях: разам з дакладнасцю фактаў і спасылак улічвайце адпаведнасць фармату, паўторныя запыты і час чалавечай праверкі.
Падобныя артыкулы


LangChain ці LlamaIndex: аркестрацыя супраць якасці пошуку ў RAG

RAGAS ці DeepEval: больш метрык не гарантуе надзейнай ацэнкі RAG

Dify ці Flowise: лёгкі запуск можа саступіць, калі праект стане камандным

Гібрыд ці поўная аддаленасць: прадукцыйнасць залежыць ад тыпу задачы

AWS Continuum закрыў 89% поўных задач — але тэст бачыць толькі C і C++
Падпішыцеся на нашу рассылку
Атрымлівайце свежыя навіны пра Web3, ШІ і крыптавалюты проста на пошту.