
RAG ili fine-tuning: znanje i ponašanje traže različita ulaganja

Ako interni AI sustav mora odgovarati prema dokumentima koji se mijenjaju i pokazati na čemu temelji tvrdnju, RAG je prikladniji početni izbor. Ako su potrebne činjenice već dostupne, ali model nedosljedno izvršava stabilan zadatak, vrijedi razmotriti fino podešavanje. AWS-ova usporedba preporučuje dohvat za pitanja o vlastitim dokumentima koja traže upućivanje na izvor te upozorava da fino podešen model sam po sebi ne daje referencu na dokument.
Odluku je korisno razložiti na četiri osi: koliko se brzo mijenja znanje, mora li odgovor navesti provjerljiv izvor, koje ponašanje model treba usvojiti i koliko stoji ispravno riješen upit. Latencija pripada posljednjoj osi jer dodatno čekanje može biti važnije od male razlike u cijeni obrade. Kombinacija oba pristupa ima smisla kada svaki rješava zaseban problem; sama po sebi ne jamči bolji odgovor.
Promjenjive činjenice trebaju vezu s važećim dokumentom
RAG pri upitu pronalazi dijelove vanjskog skupa podataka i predaje ih modelu kao kontekst za odgovor. Kad se promijeni interni pravilnik ili uputa za proizvod, sadržaj i indeks mogu se ažurirati bez novog treniranja modela. Takav je pristup posebno koristan kada zaposlenik treba saznati što piše u trenutačno važećoj verziji, a ne dobiti odgovor zasnovan na primjerima prikupljenima prije izmjene.
Dohvaćeni odlomak omogućuje da odgovor bude povezan s konkretnim dokumentom. Ipak, prikazan citat vrijedi samo ako pronađeni odlomak doista podupire tvrdnju: sustav može dohvatiti staru verziju, pogrešan odjeljak ili tekst namijenjen drugoj skupini korisnika. Za interne sustave zato su uz pretraživanje važni označavanje verzija i ograničenje pristupa dokumentima prema ovlastima korisnika.
Fino podešavanje može u model unijeti domensku terminologiju i dio znanja, ali kasnija izmjena dokumenta ne mijenja automatski njegove parametre. Kod često promjenjivih uvjeta, postupaka ili cijena to znači novi posao pripreme podataka i provjere modela. RAG pak ovisi o tome je li potreban podatak uopće ušao u indeks te može li ga sustav pronaći među sličnim dokumentima.
Stabilan zadatak može opravdati prilagodbu modela
Fino podešavanje najviše vrijedi kada se pogreška ponavlja u načinu odgovaranja: model pogrešno razvrstava upite, preskače tražena polja ili neujednačeno koristi stručne izraze. Učenje na dosljednim parovima ulaza i poželjnog izlaza može pomoći da takav obrazac primjenjuje bez dugih uputa pri svakom upitu. Primjeri za treniranje pritom moraju predstavljati pitanja koja će sustav stvarno dobivati.
Za strogo zadani format ipak najprije treba provjeriti mogu li ga osigurati jasna uputa, strukturirani izlaz i provjera sheme. Microsoftove arhitekturne smjernice preporučuju te mogućnosti prije finog podešavanja kada je problem prvenstveno oblik izlaza; prilagodba modela postaje korisnija ako one ne uklone ponavljajuće pogreške ili zahtijevaju previše uputa u svakom upitu.
Uzmimo uvjetan primjer sustava koji korisničku prijavu treba svrstati u ustaljenu kategoriju i vratiti kratak razlog. Ako su kategorije stabilne, a odgovori nedosljedni unatoč jasnoj uputi, fino podešavanje odgovara vrsti problema. Ako se pravila razvrstavanja često mijenjaju ili razlog mora upućivati na točku važeće upute, modelu treba i pristup aktualnom tekstu. Razlika je u tome nedostaje li mu činjenica ili dosljedan način obrade dostupnih činjenica.
Zašto su istraživanja dobila različite rezultate
Istraživanje automobilskih pitanja usporedilo je osnovne, fino podešene, RAG i kombinirane konfiguracije na dva zatvorena skupa izvedena iz priručnika za vozila i zapisa o kvaliteti koje je ustupio BMW Group. RAG je ondje bio najučinkovitiji u odnosu kvalitete i ukupnog troška. Iako dohvat povećava trošak pojedinačnog upita, bolja točnost u korištenom modelu troška smanjila je očekivani rad na provjeri, ponavljanju i ručnom rješavanju. Otvoreni modeli uz RAG približili su se kvaliteti jačih komercijalnih modela u tim zadacima.
To mjerenje ima važnu granicu: pitanja i odgovori nastali su iz stvarnih, ali nejavnih podataka, a točnost odgovora ocjenjivao je drugi jezični model. Procjena ukupnog troška uključuje pretpostavke o ljudskom radu. Zaključak je stoga koristan za dokumentacijska pitanja slična onima u pokusu, ali ne određuje unaprijed rezultat za svaki interni skup podataka ili drukčiji način provjere.
U kontroliranoj usporedbi medicinskih pitanja domenski prilagođen MedGemma 4B nadmašio je opći Gemma 3 4B za 6,8 postotnih bodova na testu pitanja s ponuđenim odgovorima. Dodavanje odlomaka dohvaćenih iz korpusa medicinskih objašnjenja nije donijelo statistički značajno poboljšanje ni jednom modelu. Uspoređeni su različiti modeli iste veličine, a ne isti model prije i poslije zasebnog finog podešavanja u tom pokusu. Pitanja su tražila i medicinsko zaključivanje; rezultat se ne može preslikati na traženje važeće stavke internog pravilnika.
Trošak odgovora i vrijeme čekanja nisu ista mjera
RAG traži pripremu dokumenata, indeks, pretraživanje i dodatni tekst u ulazu modela. Fino podešavanje traži označene primjere, treniranje te održavanje prilagođene verzije modela. Početni trošak treniranja može se rasporediti na mnogo upita, dok se dohvat izvršava pri uporabi; obje računice ovise o prometu i o tome koliko se često mijenjaju izvori ili zadatak.
Vrijeme odgovora treba promatrati kroz cijeli put upita. AWS-ove smjernice za dohvat izdvajaju pretvaranje upita, pretraživanje i ponovno rangiranje kao korake kojima treba zasebno mjeriti latenciju; dodatne korake preporučuju ondje gdje njihova korist za relevantnost opravdava čekanje. Za poslovni sustav zato nije dovoljno usporediti samo cijenu poziva modelu: važni su i trajanje odgovora te udio upita koje zaposlenik mora ispravljati.
Hibrid ima smisla kada su potrebne obje sposobnosti
Kombinacija je opravdana ako sustav mora dohvatiti važeći, korisniku dostupan odlomak i zatim dosljedno obaviti poseban zadatak s tim tekstom. Primjer je odgovor temeljen na internoj uputi koji mora navesti odgovarajući odlomak i vratiti ga u ustaljenoj strukturi. Dohvat tada rješava pristup znanju, a fino podešavanje može rješavati ponavljajuću pogrešku u obradi ili obliku odgovora.
Za izbor arhitekture mjerodavan je isti skup reprezentativnih upita za osnovni model, dohvat, prilagodbu i njihovu kombinaciju. Treba odvojeno gledati točnost tvrdnje, valjanost citata, dosljednost zadatka, trošak ispravnog odgovora i latenciju. Ako dodatna prilagodba ne popravlja pogrešku koja ostaje nakon dohvata, hibrid uvodi održavanje bez jasne koristi. Ako se, pak, relevantan tekst uredno dohvaća, a model i dalje pogrešno obavlja stabilan zadatak, to je konkretniji razlog za ulaganje u fino podešavanje.
Pročitajte i:
Povezani članci


Dify ili Langflow: brži proizvod sudara se s dubljim prototipom

Perplexity Pro ili ChatGPT Plus: izvori nasuprot svestranosti

Koji AI najbolje poznaje Hrvatsku? Cijene ostaju najveća zamka

n8n ili Zapier: kontrola infrastrukture nasuprot 9.000 integracija

93% kandidata smatra se spremnima za AI — poslodavci traže više
Pretplatite se na naš newsletter
Primajte najnovije vijesti o Web3-u, AI-ju i kriptovalutama izravno u svoj sandučić.