
Slik måler du RAG: et troverdig svar kan fortsatt bygge på feil treff

For å finne ut om en feil ligger i gjenfinningen eller i modellsvaret, må du måle dem hver for seg. Lag et fasitsett med spørsmål, nødvendige svarpåstander og tekstene som kan underbygge dem. Undersøk først om søket henter disse tekstene, deretter hva modellen gjør med dem.
Et svar kan være tro mot tekstene modellen fikk og likevel være feil dersom treffene gjelder feil versjon eller feil vilkår. Amazon Bedrocks måleoversikt skiller mellom kontekstrelevans og kontekstdekning for gjenfinning og korrekthet, fullstendighet og trofasthet for genererte svar. Det skillet gir et minimumsoppsett for å se hvor i RAG-kjeden feilen oppstår.
Lag et fasitsett som peker mot årsaken
Hver test bør ha et realistisk spørsmål, et fasitsvar og en angivelse av hvor de nødvendige opplysningene finnes i kunnskapsgrunnlaget. Ta vare på dokumentidentitet, versjon og relevante tekstutdrag. Da kan du skille mellom et riktig dokument som ikke ble hentet, en utdatert versjon som ble hentet, og et treff som bare lignet språklig på spørsmålet.
Skriv fasiten som korte, kontrollerbare påstander. Hvis spørsmålet krever både en betingelse og et unntak, må begge være med; ellers kan et ufullstendig svar se riktig ut i testen. Merk også spørsmål som kunnskapsgrunnlaget ikke gir dekning for, slik at et skråsikkert svar på dem ikke belønnes.
Velg spørsmål fra den faktiske bruken, blant annet alternative formuleringer, norske faguttrykk, dokumenter med nesten likt innhold og spørsmål som krever opplysninger fra flere steder. Hold et fast sett tilbake til regresjonstesting, og registrer endringer i fasiten. Når både testgrunnlag og system endres samtidig, blir det vanskelig å avgjøre hva en ny skår betyr.
Mål hva søket leverer
Dekning viser om de hentede utdragene samlet inneholder det som trengs for å besvare spørsmålet. Relevans viser hvor mye av trefflisten som faktisk bidrar. Lav dekning kan skyldes mangler i dokumentgrunnlaget, indeksering, oppdeling, søkemetode eller antall treff. Lav relevans gjør det vanskeligere å finne de nyttige utdragene blant støyen.
Merk hvilke fasitpåstander hvert hentet utdrag støtter. Tell så andelen fasitpåstander som finnes i konteksten, og andelen utdrag som bidrar med relevant informasjon. Ragas’ mål for context recall deler antallet fasitpåstander som støttes av hentet kontekst, på antallet påstander i fasitsvaret. Målet krever en referanse: Uten fasit vet du ikke hva søket skulle ha funnet.
Undersøk enkelttreffene før du justerer modellen som skriver svaret. Hvis et nødvendig avsnitt aldri nådde konteksten, kan ikke svarmodellen bruke det som grunnlag. For norske dokumenter bør lokale testspørsmål også fange opp bøyninger, sammensatte ord og faguttrykk; valg av embeddingmodell for norsk RAG hører hjemme i den vurderingen.
Vurder svaret mot både fasit og treff
Når de nødvendige opplysningene er tilgjengelige, trenger svaret egne mål. Korrekthet gjelder om svarpåstandene stemmer med fasiten. Fullstendighet gjelder om alle nødvendige deler er med. Trofasthet gjelder om svarpåstandene kan underbygges av den hentede konteksten. En samlet karakter kan skjule hvilken egenskap som sviktet.
Et svar som utelater et avgjørende vilkår, kan være korrekt i det det sier, men ufullstendig. Et svar som legger til en plausibel detalj uten støtte i treffene, kan dekke spørsmålet godt, men ha lav trofasthet. Hvis modellen gjengir et feilaktig treff nøyaktig, kan svaret være trofast mot konteksten samtidig som det er galt mot fasiten. Da bør undersøkelsen begynne med kilden eller treffvalget.
Hold spørsmål og hentet kontekst fast når du vil vurdere en endring i svarmodell eller instruksjoner. Da blir forskjellen i svaret lettere å knytte til genereringen. Hvis søk, dokumentoppdeling og svarinstruksjoner endres samtidig, kan en bedre sluttskår ikke vise hvilken endring som hjalp.
Merk feilen på påstandsnivå
Et svar kan blande riktige og gale opplysninger i samme setning. RAGCheckers veiledning beskriver hvordan svar og fasit deles i enkeltpåstander som sammenlignes med hverandre og med hentet kontekst. Slik kan evalueringen vise både hvilke nødvendige opplysninger søket fant, og hvilke modellen tok med.
Gi hver feil en plass i kjeden. Mangler en fasitpåstand i alle treff, peker det mot gjenfinning eller mangler i kunnskapsgrunnlaget. Finnes påstanden i konteksten, men ikke i svaret, peker det mot genereringen. En svarpåstand uten støtte i verken fasit eller kontekst må undersøkes som et mulig tillegg uten grunnlag. Støttes en gal svarpåstand av et hentet utdrag, bør dokumentets innhold og versjon kontrolleres.
Påstandsmerking gjør særlig forskjell når én dato, betingelse eller avgrensning endrer betydningen av et ellers rimelig svar. Automatiske vurderere kan også ta feil ved tvetydige formuleringer eller ulike definisjoner i dokumentene. La derfor en fagperson kontrollere et utvalg av merkingene før skårene brukes som beslutningsgrunnlag.
Sett en regresjonsgrense for hver endring
Kjør det samme fasitsettet før og etter en endring, og lagre spørsmål, treff, svar og feiletiketter. Følg minst dekning og relevans for gjenfinning samt korrekthet, fullstendighet og trofasthet for svar. Se også på resultatene per spørsmål og dokumenttype: Et fall i en liten, viktig gruppe kan forsvinne i gjennomsnittet.
Bestem på forhånd hva som skal stoppe en utrulling. Det kan være at kritiske fasitpåstander ikke skal forsvinne fra treffene, at svar ikke skal få nye påstander uten støtte, eller at fullstendigheten ikke skal falle for spørsmål med flere vilkår. Grensen må bygge på systemets bruk og egne testdata, ikke på en universell poengsum.
Når en endring bryter grensen, peker feiletiketten mot neste justering: dokumentgrunnlag og søk ved manglende treff, kontekstbruk og svarinstruksjoner ved utelatte fakta, eller kildeversjon ved et overbevisende svar som bygger på feil tekst. Dermed kan en bedre totalskår vurderes sammen med feilene den eventuelt skjuler.
Les også:
Relaterte artikler


Embeddingmodell for norsk RAG: globale topplister kan villede

LangChain eller LlamaIndex: RAG-first kan spare integrasjonsarbeid

Amazon Bedrock eller Microsoft Foundry: modellprisen er bare starten

MongoDB samler agentminne og styring – men Agent Engine er bare i preview

Slik tester du en KI-agent før én vellykket demo blir falsk trygghet
Abonner på nyhetsbrevet vårt
Få de siste nyhetene om Web3, KI og krypto rett i innboksen.