
RAG o fine-tuning: aggiornare i fatti non richiede sempre addestramento

Se le risposte devono usare dati aziendali che cambiano e indicare da dove provengono, il RAG è il punto di partenza. Se i fatti sono già disponibili ma il modello non rispetta con regolarità un formato, un tono o una regola del compito, valuta il fine-tuning. Quando il servizio richiede entrambe le capacità, le tecniche possono essere combinate.
La differenza sta nel momento in cui arrivano le informazioni: il RAG recupera contenuti esterni e li inserisce nella richiesta prima della risposta; il fine-tuning adatta il modello attraverso esempi di addestramento. La documentazione di Microsoft Foundry indica il RAG per dati privati o soggetti a cambiamenti frequenti e il fine-tuning per modificare comportamento, stile o prestazioni in un compito. Nel primo caso si aggiorna la fonte consultata; nel secondo si prepara e si valuta una nuova versione del modello.
Fatti che cambiano e risposte citabili
Il RAG è adatto quando la risposta si trova in documenti, pagine interne o altre fonti aziendali identificabili. Il sistema cerca i passaggi pertinenti, li aggiunge al contesto della domanda e genera una risposta a partire da quel materiale. Se una procedura cambia, il documento e l’indice usato per recuperarlo possono essere aggiornati senza addestrare di nuovo il modello; la velocità con cui la modifica arriva alle risposte dipende però dal processo di indicizzazione.
La provenienza è decisiva quando chi legge deve risalire alla regola o al dato usato. L’indice deve conservare riferimenti utili, come documento e passaggio, e il sistema deve associare la citazione all’affermazione che quel passaggio sostiene. Una citazione visibile non basta da sola: il testo generato può interpretare male una fonte pertinente oppure richiamare un passaggio che non sostiene la risposta. È la distinzione approfondita nel caso delle citazioni nei sistemi RAG.
Il recupero può essere utile anche per fatti specialistici che cambiano poco ma sono scarsamente rappresentati nei dati di addestramento. Uno studio sulle entità fattuali meno note rileva che, nelle prove di risposta a domande considerate dagli autori, il RAG supera gli approcci di fine-tuning confrontati soprattutto per la conoscenza meno popolare. È un risultato circoscritto a quel compito e alle configurazioni studiate: suggerisce di valutare il recupero prima di convertire un archivio specialistico in esempi di addestramento.
Formato e comportamento: quando valutare il fine-tuning
Il fine-tuning risponde a un’esigenza diversa: rendere più costante l’esecuzione di un compito attraverso esempi di input e output corretti. Può essere pertinente se un sistema deve classificare richieste secondo categorie definite, compilare uno schema ricorrente o adottare un lessico specialistico e le istruzioni nel prompt non raggiungono la qualità richiesta. Gli esempi devono rappresentare le richieste reali e mostrare il comportamento desiderato, non essere soltanto una raccolta di documenti aziendali.
Se invece cambiano prezzi, procedure o condizioni di un servizio, usare il fine-tuning per mantenere aggiornati quei fatti impone un ciclo diverso: preparare nuovi esempi, addestrare e valutare nuovamente il modello. La guida comparativa di AWS considera il fine-tuning poco adatto a documenti che cambiano spesso e osserva che un modello ottimizzato, da solo, non fornisce nelle risposte un riferimento alla fonte. L’addestramento resta una possibilità per compiti circoscritti e relativamente stabili, ma non sostituisce un percorso di recupero quando occorre attribuire ogni fatto a un documento.
La disponibilità di dati etichettati cambia la convenienza della scelta. Se mancano esempi affidabili degli errori da correggere e delle risposte attese, il costo non è soltanto quello dell’addestramento: occorre definire le categorie, controllare gli esempi e conservare casi separati per valutare il risultato. Un formato semplice, invece, può già essere ottenuto con istruzioni ed esempi nella richiesta, senza modificare il modello.
Quando RAG e fine-tuning lavorano insieme
La soluzione ibrida ha senso quando lo stesso servizio deve consultare informazioni variabili e rispettare regole di risposta che il prompt da solo non rende abbastanza stabili. Il recupero porta nel contesto i passaggi pertinenti; un modello ottimizzato può imparare a usare quel contesto, a seguire il formato richiesto e ad astenersi quando i passaggi non bastano. Le citazioni devono continuare a riferirsi ai contenuti recuperati, non a informazioni che il modello potrebbe aver assimilato durante l’addestramento.
Nel caso di studio su dati agricoli, gli autori riportano un aumento di accuratezza superiore a 6 punti percentuali con il fine-tuning e un ulteriore aumento di 5 punti percentuali aggiungendo il RAG nella configurazione valutata. Il risultato riguarda quella pipeline e quel dataset: mostra una complementarità possibile, senza promettere lo stesso guadagno per ogni archivio aziendale. Se il recupero seleziona i documenti sbagliati, addestrare il generatore non risolve la mancanza del contesto corretto.
La matrice di scelta per i dati aziendali
I vincoli del servizio aiutano a distinguere un problema di conoscenza da uno di comportamento. Le domande seguenti non fissano soglie universali: indicano quale componente deve soddisfare ciascun requisito.
- Quanto spesso cambiano i fatti? Se procedure, cataloghi o condizioni vengono modificati spesso, il RAG permette di aggiornare le fonti consultate. Bisogna includere nel progetto il tempo necessario a pubblicare e indicizzare la nuova versione.
- La risposta deve citare un passaggio? Quando serve una provenienza verificabile, occorre conservare il collegamento tra il contenuto recuperato e il documento autorizzato. Il fine-tuning da solo non produce quel collegamento per ogni affermazione.
- Il problema è il formato o la condotta del modello? Se il contesto giusto è disponibile ma le risposte continuano a violare uno schema o una regola, prima si valutano istruzioni ed esempi nel prompt; il fine-tuning diventa pertinente se gli errori persistono e sono disponibili esempi etichettati rappresentativi.
- Servono fatti aggiornati e comportamento stabile? Un sistema ibrido risponde a entrambe le esigenze. Il suo valore dipende dal miglioramento misurato rispetto al RAG con il modello di partenza, perché aggiunge anche preparazione dei dati e manutenzione.
- Quante richieste arriveranno? Il volume cambia il peso dei costi: con molto traffico contano il recupero e i passaggi aggiunti a ogni richiesta; con poco traffico può pesare maggiormente la preparazione iniziale di un dataset per l’addestramento. La qualità richiesta resta il vincolo principale.
Quali costi e risultati confrontare
Per il RAG, il costo comprende preparazione dei documenti, gestione delle versioni, indicizzazione, ricerca e generazione con i passaggi recuperati. A questi si aggiungono il tempo di risposta e il controllo degli accessi: una ricerca che trova un documento pertinente ma non autorizzato non è un buon risultato. Il numero e la lunghezza dei passaggi inseriti nella richiesta incidono sia sul costo di generazione sia sulla quantità di contesto irrilevante ricevuta dal modello.
Per il fine-tuning, oltre all’addestramento, contano raccolta e revisione degli esempi, valutazione delle nuove versioni e costo delle richieste al modello risultante. Nell’ibrido si sostengono entrambe le attività, anche se un comportamento appreso può ridurre la necessità di istruzioni ripetute nel prompt. La convenienza dipende quindi dal traffico previsto e dalla frequenza con cui cambiano documenti e regole del compito, non da un prezzo isolato per singola chiamata.
Il confronto più utile usa le stesse domande per le alternative considerate e distingue correttezza dei fatti, fedeltà delle citazioni, rispetto del formato, tempo di risposta e costo per richiesta. Deve includere contenuti appena modificati e domande per cui i documenti non autorizzano una risposta. Questa separazione rende visibile dove nasce un errore: nel documento disponibile, nel passaggio recuperato o nel modo in cui il modello lo usa.
Leggi anche:
Articoli correlati


Valutare un RAG: quattro metriche separano recupero e risposta

LangChain o LlamaIndex: nei benchmark il framework non decide da solo

Chunk RAG: più contesto può peggiorare qualità e costi

ChatGPT o Gemini: allo stesso prezzo si comprano ecosistemi diversi

Prompt injection negli agenti IA: il filtro da solo non basta
Iscriviti alla nostra newsletter
Ricevi le ultime notizie su Web3, IA e cripto direttamente nella tua casella di posta.