
RAG vai modeļa pielāgošana: lielākai precizitātei ir sava cena

Mainīgām uzņēmuma zināšanām parasti izvēlies RAG: sistēma atrod attiecīgo dokumentu un nodod to modelim atbildes sagatavošanai. Modeļa pielāgošana ir pamatotāka, ja pareizais avots jau ir pieejams, bet modelis atkārtoti kļūdās, to izmantojot. Hibrīds var palīdzēt, ja vajadzīgi gan aktuāli avoti, gan konsekventa rīcība ar pretrunīgu informāciju.
Izvēle ietekmē izmaksas un kļūdu risku. RAG prasa uzturēt dokumentus un meklēšanu; pielāgošanai vajadzīgi kvalitatīvi mācību piemēri, apmācība un atkārtota novērtēšana. Precizitātes pieaugums vienā šaurā uzdevumā var nākt kopā ar vājāku sniegumu citos uzdevumos, tāpēc jāvērtē visa uzņēmuma zināšanu sistēma.
Kad pietiek ar avotu izgūšanu
Ja atbildei jāatspoguļo spēkā esoša politika, produktu noteikumi vai nesen mainīta procedūra, RAG ir loģisks sākumpunkts. Pēc dokumenta izmaiņām var atjaunināt avotu kopumu un meklēšanas indeksu, lai nākamajā pieprasījumā modelis saņemtu jauno redakciju. Atbildei var pievienot izmantotā dokumenta norādi, kas ļauj cilvēkam pārbaudīt tās pamatojumu.
EMNLP publicētajā pētījumā par zināšanu ievadi modeļos RAG pārspēja neuzraudzītu pielāgošanu gan uzdevumos par iepriekš sastaptām zināšanām, gan par jauniem faktiem. Pētījuma robeža ir svarīga: tajā salīdzināta konkrēta pielāgošanas metode un zināšanu uzdevumi, nevis visi iespējamie uzņēmuma asistenti. Daļā eksperimentu pielāgota modeļa pievienošana RAG uzlaboja rezultātu, taču šis ieguvums nebija konsekvents.
RAG vājā vieta ir ceļš no dokumentu krātuves līdz atbildei. Meklētājs var atgriezt novecojušu redakciju, tematiski līdzīgu, bet neatbilstošu dokumentu vai fragmentu bez izšķirošā nosacījuma. Uzņēmumā, kur glabājas vairākas vienas procedūras versijas, atlasei tāpēc jāņem vērā dokumenta spēkā esamība un lietotāja piekļuves tiesības. Ja pareizais avots netiek atrasts, ģeneratora pielāgošana trūkstošo informāciju tam nepiegādās.
Kad ir jēga pielāgot modeli
Pielāgošana risina citu problēmu: avots ir atrasts, bet modelis sistemātiski rīkojas nepareizi. Tas var sajaukt uzticamu un maldinošu fragmentu, izlaist obligātu atbildes struktūru vai sniegt pārliecinošu atbildi, kad dokumentos pamata tai nav. Reprezentatīvi mācību piemēri var mācīt vēlamo rīcību šādos gadījumos. Tie nav ērts aizstājējs dokumentu krātuvei, kuras fakti regulāri mainās.
Izšķirošs ir piemēru pārklājums. Ja apmācībā ir tikai vienveidīgi, skaidri jautājumi, modelis var apgūt šauru formātu, bet kļūdīties pie citādi formulēta pieprasījuma vai konfliktējošiem avotiem. Mācību kopā jābūt arī gadījumiem, kuros pareizā rīcība ir norādīt neskaidrību vai atteikties izdarīt secinājumu. Ja šādus piemērus nevar droši sagatavot, apmācības izdevumi paši par sevi nedod ticamāku atbildi.
Kad hibrīds dod izmērāmu ieguvumu
Hibrīdā RAG piegādā avotus, bet pielāgošana maina veidu, kā modelis tos izmanto. Finetune-RAG eksperimentā ar Llama 3.1–8B-Instruct un 1653 piemēru kopu Bench-RAG vērtētā faktu precizitāte pieauga no 76,97% līdz 98,18% jeb par 21,21 procentpunktu. Vērtēšanā modelis saņēma gan pareizu, gan izdomātu kontekstu, un atbildes vērtēja GPT-4o. Tātad mērīts, cik labi modelis izmanto pareizo fragmentu šādā testa situācijā, nevis cik labi uzņēmuma meklētājs atrod dokumentus.
Šis ieguvums ir būtisks situācijā, kur meklēšana savu darbu jau paveikusi, bet atbildē nonāk arī maldinošā fragmenta saturs. Ja kļūda sākas agrāk — vajadzīgais dokuments nav indeksā vai meklētājs izvēlas nepareizo versiju — vispirms jālabo avotu atlase. Atšķirība nosaka, kur ieguldīt: uzlabot dokumentu un meklēšanas sistēmu vai mācīt modelim labāk izmantot jau atrasto informāciju.
Šauras precizitātes cena
Atsevišķa kļūdas veida samazinājums vēl nenozīmē labāku modeli kopumā. USENIX pētījumā par DeepSeek Coder 6.7B neesošu programmatūras pakotņu ieteikumu īpatsvars pēc pielāgošanas kritās no 16,14% līdz 2,66%, aptuveni par 83%, bet tā paša modeļa HumanEval pass@1 rādītājs saruka no 51,4% līdz 25,3%. Pielāgošana tātad sekmīgi mazināja konkrēto pakotņu kļūdu, vienlaikus pasliktinot rezultātu citā koda ģenerēšanas pārbaudē.
Tas ir programmēšanas eksperiments, tāpēc tā procentus nevar pārcelt uz uzņēmuma dokumentu asistentu. Taču tas skaidri parāda, kāpēc papildus mērķa kļūdai jāvērtē arī citas vajadzīgās spējas. Zināšanu sistēmā tās var būt vairāku dokumentu salīdzināšana, pilnīgas atbildes sniegšana un pamatota atturēšanās, ja avotos atbildes nav. Kļūdas cena nosaka līdzsvaru: kritiskā procesā piesardzība var būt vērtīga, bet pārmērīga atteikšanās atbildēt samazina sistēmas lietderību.
Izvēles koks uzņēmuma zināšanu sistēmai
Lēmumu nosaka četri jautājumi: cik bieži mainās fakti, vai ir pietiekami daudz uzticamu mācību piemēru, cik dārga ir nepareiza atbilde un kuras modeļa spējas jāsaglabā. Tie ir ieviešanas kritēriji, nevis universāli sliekšņi, ko varētu pārņemt no viena etalontesta.
- Ja fakti mainās bieži vai atbildei vajadzīgs pārbaudāms pamatojums, izvēlies RAG. Galvenais darbs ir dokumentu kvalitāte, versiju pārvaldība, piekļuves noteikumi un pareizo fragmentu atrašana.
- Ja avoti ir pieejami, bet daudzos līdzīgos gadījumos kļūdaina ir modeļa rīcība, apsver pielāgošanu. Tai vajadzīgi dažādi pareizas rīcības piemēri un atsevišķi jautājumi novērtēšanai ārpus mācību kopas.
- Ja vajadzīgi gan aktuāli avoti, gan stabila rīcība ar maldinošiem fragmentiem, salīdzini RAG ar hibrīdu. Hibrīda ieguvumam jāatsver uzturēšanas izdevumi un iespējamais kritums citos uzņēmumam svarīgos uzdevumos.
Izmaksas ir jāskaita visā sistēmas darbības laikā. RAG nozīmē avotu atjaunināšanu, indeksēšanu, meklēšanu un papildu kontekstu pie pieprasījumiem. Pielāgošana prasa piemēru sagatavošanu, apmācību, modeļa versiju uzturēšanu un pārbaudi pēc izmaiņām. Hibrīds apvieno abus uzturēšanas darbus, tāpēc pat izmērāms precizitātes pieaugums ne vienmēr ir saimnieciski pamatots.
Salīdzināšanai izmanto vienu un to pašu uzņēmuma jautājumu kopu sākotnējam modelim, RAG un, ja vajadzīgs, pielāgotajai vai hibrīdajai versijai. Iekļauj spēkā esošus un novecojušus dokumentus, līdzīgus nosaukumus, jautājumus bez atbildes avotos un uzdevumus ārpus šaurās specializācijas. Atsevišķi mēri, vai atrasts pareizais avots, vai atbilde tam atbilst un vai saglabātas pārējās vajadzīgās spējas. Tā kļūst redzams gan precizitātes ieguvums, gan tā cena.
Saistītie raksti


Azul MI palīgs meklē Java riskus — piekļuvei vajag jaunu līgumu

DeepL vai ChatGPT latviešu tulkojumiem: mērījumi dod skaidru signālu

Latvijas jaunuzņēmumu izaugsme sasniegusi 13,17% — ko īsti mēra balva

OpenAI aģentu spieti skāra ārējas datubāzes — robežas vēl nav skaidras

MI akts jau darbojas: septiņu soļu pārbaude Latvijas uzņēmumam
Abonējiet mūsu jaunumu vēstuli
Saņemiet jaunākās Web3, MI un kriptovalūtu ziņas tieši savā e-pastā.