
Valutare un RAG: quattro metriche separano recupero e risposta

Per capire dove sbaglia un RAG, valuta separatamente i passaggi recuperati e la risposta generata. La guida LearnRAG organizza la prova intorno a quattro metriche di Ragas: precisione e richiamo del contesto per il recupero, fedeltà e rilevanza per la risposta.
Serve un piccolo set stabile di domande, con risposte di riferimento verificate e passaggi salvati nell’ordine in cui sono stati forniti al generatore. Leggere i punteggi insieme permette di distinguere, per esempio, una risposta fedele ma incompleta perché mancava un passaggio decisivo da una risposta che aggiunge fatti non sostenuti pur avendo ricevuto i passaggi giusti.
Costruire casi che rappresentino le domande reali
Parti dalle richieste che il sistema dovrà affrontare, rimuovendo eventuali dati personali. Includi domande risolvibili con un solo passaggio, domande che richiedono informazioni distribuite in più documenti e richieste per le quali il corpus non contiene una risposta. Quest’ultima categoria serve a osservare se il sistema si astiene quando le prove mancano.
Per ogni domanda scrivi una risposta di riferimento che contenga i fatti necessari e indica dove si trovano nel corpus. Il riferimento descrive il contenuto atteso, non una frase che il modello debba ripetere parola per parola. Conserva anche la versione dei documenti: se cambia la base documentale tra due esecuzioni, un calo del richiamo non può essere attribuito con sicurezza al retriever.
- Esegui le domande con una configurazione definita e salva tutti i passaggi effettivamente inviati al generatore, mantenendone l’ordine.
- Associa a ciascun caso domanda, risposta prodotta, risposta di riferimento e identificativi dei documenti. Non correggere a mano l’output prima di valutarlo.
- Tieni distinti i casi senza risposta nel corpus. Per questi verifica l’astensione separatamente, invece di forzare una normale risposta di riferimento e interpretarne il richiamo come negli altri casi.
Un caso ambiguo va chiarito prima del confronto. Se due documenti danno informazioni diverse, stabilisci quale versione sia pertinente alla domanda; altrimenti un giudizio negativo può dipendere dal riferimento scelto e non dal comportamento del RAG.
Che cosa misurano le metriche
Precisione del contesto valuta quanto in alto compaiono i passaggi utili nella lista recuperata. Conta quindi sia la pertinenza sia l’ordine: un passaggio estraneo collocato prima di quello necessario peggiora il ranking. La documentazione di Ragas sulla precisione usa una domanda sulla Torre Eiffel, un passaggio utile su Parigi e uno estraneo sulla Porta di Brandeburgo per mostrare la distinzione.
Richiamo del contesto misura quanta parte dell’informazione necessaria è arrivata al generatore. Nella variante basata su un modello valutatore, le affermazioni della risposta di riferimento vengono confrontate con i passaggi recuperati. Se il riferimento richiede due fatti e i passaggi ne sostengono soltanto uno, il recupero è incompleto anche quando tutto ciò che ha trovato è pertinente.
Fedeltà riguarda le affermazioni presenti nella risposta prodotta: ciascuna deve poter essere sostenuta dai passaggi ricevuti. Un dettaglio plausibile, ma assente dal contesto, abbassa il punteggio. La metrica considera le prove disponibili al generatore; una risposta può dunque essere fedele a passaggi incompleti e lasciare comunque senza risposta una parte della domanda.
Rilevanza della risposta valuta se il testo affronta direttamente la richiesta. Può diminuire quando il modello riassume correttamente documenti vicini al tema, ma trascura il dato chiesto o aggiunge dettagli che distraggono. Non stabilisce da sola se i fatti siano supportati: per quello occorre leggere anche la fedeltà.
Calcolare i punteggi senza perdere i singoli casi
Calcola le metriche sugli stessi casi e conserva il risultato di ogni domanda accanto ai passaggi e alla risposta. Un riepilogo per categoria mostra se il cambiamento riguarda soprattutto le domande con più documenti, quelle semplici o quelle prive di risposta. La sola media complessiva può restare stabile mentre peggiorano proprio le richieste più importanti per il servizio.
Il paper originale di Ragas propone una valutazione delle diverse dimensioni del RAG senza richiedere annotazioni umane complete. Nel percorso descritto qui, una risposta di riferimento verificata rende più interpretabile il richiamo del contesto: consente di vedere quali fatti attesi non erano presenti nei passaggi recuperati. Conservare anche gli identificativi dei documenti permette di risalire al punto in cui cercare quella lacuna.
Leggere le combinazioni e individuare la causa
I punteggi indicano dove iniziare l’indagine; i passaggi del singolo caso mostrano che cosa è successo. Quando una metrica scende, confronta domanda, riferimento, lista recuperata e risposta prima di modificare la configurazione.
- Precisione alta e richiamo basso: i passaggi trovati sono utili, ma manca parte dell’informazione. Controlla la copertura del corpus, la suddivisione dei documenti e quanti passaggi vengono recuperati.
- Richiamo alto e precisione bassa: i fatti necessari sono presenti, ma arrivano insieme a materiale estraneo o troppo in basso. Esamina ranking e selezione dei passaggi.
- Recupero buono e fedeltà bassa: le prove erano disponibili, mentre la risposta contiene affermazioni non sostenute. Esamina le istruzioni date al generatore e confronta ogni affermazione contestata con i passaggi ricevuti.
- Fedeltà alta e rilevanza bassa: la risposta resta vicina ai documenti, ma affronta solo una parte della domanda o un tema collaterale. Controlla come la richiesta è stata presentata al generatore e quali passaggi hanno attirato la sua attenzione.
Se peggiorano sia il recupero sia la risposta, esamina prima le prove che il generatore ha ricevuto. Una modifica al prompt non può rendere disponibile un fatto che il retriever non ha trovato, mentre una nuova selezione dei passaggi può cambiare anche la risposta senza intervenire sul modello.
Fissare una soglia di regressione
Usa un’esecuzione controllata come riferimento e definisci, per ciascuna metrica, quale calo richieda una revisione prima del rilascio. Confronta versioni sullo stesso set di domande, sullo stesso corpus e con gli stessi criteri di aggregazione; registra ogni cambiamento intenzionale. Accanto alle medie, conta i casi critici peggiorati: una media stabile può nascondere una nuova affermazione non supportata su una richiesta importante.
Il valutatore basato su un modello linguistico può interpretare male una negazione, un riferimento o un passaggio ambiguo. Esamina manualmente un campione dei casi peggiori e confronta il giudizio con i passaggi conservati. Se i due giudizi divergono, chiarisci il riferimento o il criterio di valutazione prima di spostare la soglia: così la regressione resta legata alla qualità delle risposte e non soltanto alla variazione di un punteggio automatico.
Leggi anche:
Articoli correlati


RAG o fine-tuning: aggiornare i fatti non richiede sempre addestramento

Un RAG sui documenti non basta: senza citazioni gli errori restano invisibili

LangChain o LlamaIndex: nei benchmark il framework non decide da solo

WordPress 7.1.2 chiude una falla critica già sfruttata negli attacchi

MAI-Transcribe ascolta in 60 lingue: il primato costa più di Grok
Iscriviti alla nostra newsletter
Ricevi le ultime notizie su Web3, IA e cripto direttamente nella tua casella di posta.