
RAG může znít správně a přesto lhát: měřte vyhledání i odpověď zvlášť

RAG aplikaci před nasazením otestujte na otázkách s ověřenými odpověďmi a známými relevantními pasážemi. U každého dotazu nejprve zjistěte, zda vyhledávání dodalo potřebné podklady. Potom posuďte, zda z nich odpověď správně vychází, projděte sporné výsledky ručně a stejnou sadu spusťte při každé změně systému.
Plynulý text ani připojená citace samy o sobě správnost nedokazují: vyhledávání mohlo minout rozhodující pasáž a generátor mohl přidat tvrzení, které v podkladech není. Původní práce RAGAS rozlišuje relevanci nalezeného kontextu, relevanci odpovědi k otázce a věrnost tvrzení vůči kontextu. Oddělené hodnocení pomáhá určit, kde chyba vznikla.
Sestavte testovací sadu ze skutečných úloh
Otázky vybírejte podle úloh, které má aplikace řešit. Vedle přímého dotazu zařaďte parafrázi, otázku vyžadující spojení informací z více pasáží, dotaz na údaj, který se mohl změnit, a případ, kdy korpus odpověď neobsahuje. U české aplikace ponechte přirozené formulace uživatelů včetně diakritiky; pouze uhlazené otázky mohou potíže při vyhledávání skrýt.
Ke každé otázce uložte ověřenou referenční odpověď a označte dokumenty či pasáže, z nichž ji lze sestavit. Referenci pište jako požadované věcné body, aby test nezávisel na jediné formulaci. U otázky bez dostupného podkladu stanovte očekávané přiznání nejistoty. Pokud se dokumenty mění, zaznamenejte verzi korpusu; jinak později nemusíte poznat, zda výsledek změnil model, nebo samotné podklady.
Minimální hodnoticí záznam pro jeden případ obsahuje:
- otázku, referenční fakta a očekávané chování při nedostatku podkladů;
- identifikátory relevantních dokumentů či pasáží a verzi korpusu;
- skutečně vyhledané pasáže v pořadí, v jakém je systém předal generátoru;
- vygenerovanou odpověď, její citace a verdikt ke každému podstatnému tvrzení;
- latenci vyhledání a generování, spotřebu tokenů nebo jiné údaje potřebné k určení nákladů.
Tyto položky umožňují vrátit se od souhrnného skóre ke konkrétní otázce a zjistit, zda problém vznikl v podkladech, jejich výběru, nebo v odpovědi.
Vyhledávání měřte bez ohledu na výsledný text
U vyhledávání sledujte, zda předané pasáže pokrývají fakta nutná pro referenční odpověď a zda se užitečné úryvky dostaly vysoko v pořadí. Přehled metrik Ragas uvádí pro RAG mimo jiné Context Recall, Context Precision, Noise Sensitivity, Response Relevancy a Faithfulness. Context Recall míří na chybějící potřebné informace; Context Precision hodnotí pořadí relevantních úryvků mezi výsledky.
Pro vlastní test můžete navíc počítat podíl otázek, u nichž se označená relevantní pasáž dostala mezi výsledky předané generátoru. Vždy zaznamenejte, kolik pasáží se předává, protože změna tohoto počtu mění podmínky srovnání. Více úryvků může dodat chybějící fakt, ale také přidat text, který odpovědi nepomůže a zabere místo v kontextu.
Při selhání otevřete nalezené úryvky. Správná pasáž může chybět už ve výsledcích hledání, nebo v nich být a vypadnout až při výběru kontextu pro model. První případ vede k prověření dělení dokumentů, indexace a formulace dotazu; druhý k prověření řazení a omezení předávaného kontextu. Úprava promptu generátoru nenahradí pasáž, kterou nikdy nedostal.
V odpovědi oddělte věrnost od úplnosti
Odpověď porovnejte s předaným kontextem i s ověřenou referencí. Věrnost kontextu znamená, že lze jednotlivá tvrzení z nalezených pasáží odvodit. Shoda s referencí ukazuje, zda odpověď pokrývá požadovaná fakta. Odpověď může být věrná, ale neúplná, pokud vyhledávání nedodalo potřebnou pasáž; správný fakt zase může zaznít bez opory v kontextu, který systém skutečně použil.
U každého podstatného tvrzení zkontrolujte také citaci. Odkaz na tematicky příbuzný dokument nestačí: označená pasáž musí podporovat právě citované tvrzení. Zvláštní pozornost věnujte podmínkám, výjimkám a časové platnosti údajů. U otázky bez dostupných podkladů hodnoťte, zda systém nejistotu přiznal, místo aby chybějící informaci doplnil odhadem.
Do záznamu chyby napište její místo: nenalezená pasáž, vyřazení správného úryvku z kontextu, nepodložené tvrzení, chybějící požadovaný fakt nebo nepřesná citace. Jedna odpověď může obsahovat více typů chyb. Jejich rozlišení je pro opravu užitečnější než jediné souhrnné hodnocení.
Kde musí automatické hodnocení doplnit člověk
Hodnotitel založený na jazykovém modelu urychlí průchod sadou, ale sporný verdikt je nutné ověřit proti označené pasáži. Dvě podobně znějící odpovědi se mohou lišit právě výjimkou nebo podmínkou, na níž uživateli záleží. Automatické skóre také samo neodhalí chybnou referenci: pokud je anotace nepřesná, může být za chybu označena správná odpověď.
Ručně proto projděte závažná selhání, případy s rozpornými metrikami i vzorek výsledků označených za úspěšné. U sporu zaznamenejte pasáž, která rozhodla, a případně opravte referenci. Požadavky na formát výstupu nebo přítomnost citace lze kontrolovat pravidlem v kódu; zda citace skutečně podporuje význam tvrzení, vyžaduje posouzení obsahu.
Předem určete regresní bránu pro vydání
Novou verzi porovnávejte na stejné sadě a stejné verzi korpusu. Předem určete povinné případy, které musí projít, a hranice pro kvalitu vyhledávání, věrnost odpovědí, latenci a náklady. Mezi povinné případy patří zejména důležité podmínky, otázky bez dostupné odpovědi a chyby, které už předchozí verze odhalila. Změnu, která povinný případ rozbije, vraťte k opravě i tehdy, když souhrnné skóre vzrostlo.
Dokumentace LangSmith rozlišuje offline benchmarky a regresní testy před nasazením od online hodnocení v provozu; popisuje také modelové a deterministické hodnotitele. Pro rozhodnutí o vydání použijte uložené otázky, reference a pasáže spolu s předem stanovenou bránou. Potvrzená selhání z provozu pak přidejte do testovací sady, aby se stejná chyba mohla zachytit před dalším vydáním.
Přečtěte si také:
Související články


Pinecone, nebo Weaviate: rychlejší dotaz nemusí znamenat levnější RAG

Gemini, nebo NotebookLM: webový kontext může narušit práci jen se zdroji

ChatGPT, nebo Perplexity: více citací ještě neznamená lepší výzkum

Midjourney, nebo Firefly: kvalita obrazu naráží na licenci a workflow

Cloudflare, nebo Fastly: nulový tarif prohrává, když potřebujete kontrolu
Přihlaste se k odběru newsletteru
Nejnovější zprávy ze světa Web3, AI a kryptoměn přímo do vaší schránky.