
RAG sau fine-tuning: datele noi și comportamentul cer soluții diferite

Pentru un asistent pe documentele companiei, alegeți RAG când faptele se schimbă sau răspunsul trebuie să indice pasajul folosit. Testați fine-tuningul când informația corectă este deja disponibilă, dar modelul greșește repetat formatul ori o sarcină precisă. Ghidul Microsoft Foundry distinge între recuperarea datelor private sau schimbătoare și ajustarea comportamentului modelului.
Unele aplicații au ambele nevoi: găsirea regulii valabile pentru utilizatorul care întreabă și redactarea răspunsului într-o formă strictă. Ghidul AWS pentru documente proprii recomandă să se înceapă cu RAG pentru întrebări care cer referințe la documente și descrie posibilitatea de a-l combina cu un model ajustat. Alegerea depinde de eroarea observată, de ritmul actualizării datelor și de rezultatul evaluării.
Ce anume greșește asistentul?
Un răspuns ratat poate avea cauze diferite. Dacă asistentul folosește o procedură veche, omite o clauză existentă sau nu poate arăta baza unei afirmații, investigați mai întâi documentele și recuperarea lor. Dacă primește pasajul corect, dar îl transformă într-un răspuns care încalcă schema cerută, problema ține mai probabil de instrucțiuni sau de comportamentul modelului.
Separați documentul absent din colecție de pasajul prezent, dar negăsit, și de pasajul găsit, dar interpretat greșit. Primele două situații cer corectarea surselor, a indexării ori a căutării; ajustarea modelului care formulează răspunsul nu le aduce documentul lipsă. În al treilea caz, încercați mai întâi instrucțiuni și exemple mai clare în cerere, apoi măsurați dacă eroarea persistă.
Când documentele se schimbă, RAG păstrează legătura cu sursa
RAG caută conținut relevant pentru întrebare și îl adaugă în contextul primit de model. O companie poate astfel actualiza politici, cataloage sau instrucțiuni în colecția consultată fără să reantreneze modelul la fiecare modificare. Actualizarea răspunsurilor depinde însă de momentul în care noua versiune ajunge în index și de capacitatea căutării de a selecta pasajul potrivit.
Pentru răspunsuri citabile, aplicația poate păstra împreună pasajul și metadatele documentului, precum titlul sau identificatorul său. Citarea trebuie verificată la nivelul afirmației: un document indicat lângă răspuns poate fi real, dar pasajul ales să nu susțină concluzia formulată. De aceea, calitatea căutării și fidelitatea răspunsului față de pasaj sunt măsurători diferite.
Permisiunile sunt o parte a aceleiași arhitecturi. Dacă un document este accesibil doar unui departament, filtrarea după drepturile persoanei care întreabă trebuie făcută înainte ca pasajul să intre în contextul modelului. Într-un exemplu ipotetic, aceeași întrebare adresată de doi angajați cu drepturi diferite trebuie să folosească numai documentele permise fiecăruia. Un index comun, fără această filtrare, poate trimite modelului informații pe care utilizatorul nu are voie să le consulte.
Când informația există, dar răspunsul nu respectă cerința
Fine-tuningul supravegheat ajustează modelul cu exemple de intrare și ieșire dorită. Documentația OpenAI despre această metodă enumeră clasificarea, traducerea nuanțată, generarea într-un format specific și corectarea dificultăților de a urma instrucțiuni. Pentru un asistent intern, candidatul potrivit este o eroare de acest fel care continuă să apară după îmbunătățirea cererii.
Exemplele de antrenare trebuie să semene cu solicitările reale, inclusiv cu cele ambigue sau dificile. Păstrați separat întrebările folosite la evaluare: dacă modelul a văzut deja răspunsurile în antrenare, rezultatul nu arată cât de bine va lucra pe cereri noi. Măsurați și calitatea conținutului, nu doar respectarea formei; un răspuns perfect structurat poate interpreta greșit documentul primit.
Faptele învățate în parametrii modelului nu vin cu o trimitere la documentul din care au provenit. Nici drepturile diferite ale utilizatorilor asupra acelor fapte nu pot fi aplicate prin simpla schimbare a întrebării. O regulă care se modifică frecvent sau este vizibilă numai anumitor persoane are nevoie de o sursă controlată la recuperare, chiar dacă modelul este ajustat pentru forma răspunsului.
Când cele două metode aduc câștiguri diferite
Combinația merită testată dacă pasajele recuperate sunt corecte, dar modelul nu le folosește consecvent în sarcina cerută. Documentele furnizează atunci faptele, versiunile și regulile de acces, iar exemplele de antrenare vizează felul în care modelul transformă contextul într-un răspuns. Această împărțire permite schimbarea unei politici în sursă fără a trata fiecare revizuire ca pe o nouă sarcină de antrenare.
În studiul despre întrebări agricole legate de regiune, autorii raportează un câștig de peste șase puncte procentuale al acurateței prin fine-tuning și încă cinci puncte procentuale după adăugarea RAG în configurația evaluată. Rezultatul arată că îmbunătățirile se pot cumula în acea sarcină; nu stabilește câștigul așteptat pentru un asistent pe documentele unei alte companii. Dacă ajustarea nu aduce un progres pe întrebări nevăzute, complexitatea combinației rămâne fără un beneficiu măsurat.
Costul alegerii include operarea și evaluarea
RAG adaugă pregătirea documentelor, actualizarea indexului, căutarea și pasaje suplimentare în fiecare cerere. Fine-tuningul cere exemple curate, antrenare și evaluări repetate când se schimbă sarcina sau modelul de bază. Comparația Ryz Labs recomandă să se înceapă cu instrucțiuni, RAG și un set de evaluare, iar ajustarea să fie luată în calcul când rămâne un deficit de comportament.
Comparați variantele la un volum reprezentativ de cereri, cu aceleași condiții de calitate. Pentru recuperare contează timpul de căutare, lungimea contextului trimis modelului și munca de menținere a indexului. Pentru ajustare contează pregătirea exemplelor, antrenarea și verificarea modelului rezultat. Varianta combinată preia costuri din ambele fluxuri, astfel că trebuie să reducă erori pe care fiecare variantă singură le lasă nerezolvate.
Un set minim de probe pentru decizie
Adunați întrebări reprezentative din activitatea pentru care construiți asistentul. Includeți documente recent modificate, cereri cu format obligatoriu, întrebări fără răspuns în surse și cazuri în care utilizatorii au drepturi de acces diferite. Pentru fiecare, stabiliți răspunsul acceptabil, documentele permise și situația în care asistentul trebuie să spună că nu are suficiente informații.
- Rulați setul cu modelul de bază și instrucțiuni clare. Notați separat erorile de fapt, de format și cazurile în care răspunsul nu indică o sursă necesară.
- Adăugați RAG. Verificați dacă au fost găsite pasajele potrivite, dacă răspunsul este susținut de ele și dacă filtrarea respectă drepturile fiecărui utilizator.
- Dacă pasajele sunt corecte, dar rămân erori repetate de comportament, testați ajustarea pe exemple distincte de cele folosite la evaluare. Comparați modelul ajustat singur și împreună cu RAG pe același set de probe.
Decizia poate fi luată după erorile eliminate și costul de operare al fiecărei variante. Când problema este accesul la fapte schimbătoare și citabile, recuperarea răspunde direct nevoii. Când problema rămasă este executarea consecventă a unei sarcini înguste, efectul ajustării trebuie demonstrat pe cereri pe care modelul nu le-a întâlnit la antrenare.
Citește și:
Articole similare


Munca autonomă prin IA s-ar putea dubla, dar valoarea rămâne în urmă

Turing mută riscul IA de la model la întregul sistem

ChatGPT sau Gemini pentru viața digitală: integrarea nu garantează prioritizarea

DeepL sau Google Translate pentru română: testul arată 90% vs 82%

Oprești antrenarea AI, dar conversația poate rămâne până la 72 de ore
Abonează-te la newsletter
Primește cele mai noi știri despre Web3, IA și cripto direct în inbox.