RAGAS ці DeepEval: больш метрык не гарантуе надзейнай ацэнкі RAG

|Аўтар: Рэдакцыя QUASA|5 хв чытання| 1
RAGAS ці DeepEval: больш метрык не гарантуе надзейнай ацэнкі RAG

Калі галоўная задача — высветліць, ці губляе RAG патрэбныя фрагменты пры пошуку і ці абапіраецца адказ на знойдзены кантэкст, зручна пачаць з RAGAS. Каталог метрык Ragas уключае context precision, context recall, noise sensitivity, response relevancy і faithfulness, а таксама праверкі выклікаў інструментаў агентамі.

DeepEval падыходзіць, калі разам з RAG трэба тэставаць дыялогі, дзеянні агента і выпускі сістэмы праз CI. У дакументацыі DeepEval пералічаны асобныя метрыкі для пошуку і адказу, ацэнкі паслядоўнасці дзеянняў агента і яго асобных выклікаў інструментаў. Абедзве бібліятэкі могуць даць шмат балаў, але колькасць паказчыкаў не сведчыць, што яны супадаюць з ацэнкай экспертаў у канкрэтнай задачы.

У чым сапраўднае адрозненне

RAGAS дае падрабязную мову для разбору RAG-ланцужка. Context recall паказвае, ці трапіла патрэбная інфармацыя ў выняты кантэкст, а context precision дапамагае ацаніць карыснасць і парадак знойдзеных фрагментаў. Faithfulness правярае падтрымку сцвярджэнняў адказу гэтым кантэкстам; response relevancy разглядае адпаведнасць адказу пытанню. Noise sensitivity патрэбная для выпадкаў, калі ў кантэкст трапляе пабочная інфармацыя.

DeepEval таксама мае contextual precision, contextual recall, contextual relevancy, answer relevancy і faithfulness. Таму для звычайнага RAG пытанне не зводзіцца да таго, у якой бібліятэкі «ёсць faithfulness»: важней параўнаць патрабаваныя ўваходныя даныя, спосаб выстаўлення бала і тое, якую памылку трэба знайсці. Калі сістэма акрамя пошуку плануе дзеянні і выклікае інструменты, DeepEval дазваляе ацэньваць завершанасць задачы, якасць паслядоўнасці крокаў, выбар інструмента і яго аргументы.

RAGAS таксама мае агентныя метрыкі, таму называць яго інструментам выключна для пошуку было б недакладна. Розніца ў выбары акцэнту: для дыягностыкі знойдзенага кантэксту і вернасці адказу можна сабраць кампактны набор у RAGAS; для адзінай серыі праверак RAG, дыялогаў і агентных траекторый зручней разгледзець DeepEval. Назвы падобных метрык не азначаюць, што іх балы ўзаемазаменныя.

Якія праверкі ўзяць у мінімальны набор

Пачатковы набор павінен аддзяляць збой пошуку ад збою генерацыі. Калі адзін агульны бал падае пасля змены індэкса, ён не пакажа, ці знік патрэбны фрагмент, ці мадэль няправільна выкарыстала атрыманы тэкст. Для RAG дастаткова ахапіць наступныя пытанні:

  • Пошук: ці ёсць у вынятым кантэксце звесткі, патрэбныя для адказу, і ці не займаюць яго пераважна пабочныя фрагменты. Тут карысныя context recall разам з context precision або contextual relevancy.
  • Абгрунтаванасць: ці падтрымліваецца кожнае істотнае сцвярджэнне адказу вынятым кантэкстам. Для гэтага служыць faithfulness, але высокі бал не азначае, што адказ поўны або што самі знойдзеныя звесткі праўдзівыя.
  • Карыснасць адказу: ці адказвае ён на пастаўленае пытанне і ці не прапускае неабходную дэталь. Рэлевантнасць і паўнату варта разглядаць асобна ад вернасці кантэксту.

Калі агент выкарыстоўвае інструменты, дадайце праверку выніку задачы і істотных выклікаў. Правільна сфармуляваны канчатковы адказ можа схаваць памылковы выбар інструмента або лішнія крокі, а добрая траекторыя сама па сабе не гарантуе патрэбнага выніку. Для прадукту, які працуе па-беларуску і па-руску, у выбарцы патрэбныя пытанні на абедзвюх мовах: інакш ацэнка апіша толькі пратэставаную мову.

Як праверыць метрыку на чалавечай разметцы

Практычны першы цыкл — сабраць 50–100 выпадкаў з тыповых задач прадукту. Гэта прапанаваны працоўны дыяпазон, а не даказаны мінімум для ўсіх сістэм. Для кожнага выпадку захавайце пытанне, вынятыя фрагменты, адказ і экспертную ацэнку: дзе ёсць патрэбныя звесткі, якія сцвярджэнні падтрыманы і наколькі сур’ёзная памылка. Уключыце пытанні без адказу ў базе ведаў, няпоўны кантэкст і супярэчлівыя фрагменты.

У даследаванні ацэнкі RAG на бізнес-даных метрыкі Ragas, DeepEval, RAGChecker і Opik супаставілі з чалавечымі ацэнкамі адказаў адной RAG-сістэмы на 96 пытаннях; адказы ацэньвалі два спецыялісты. Аўтар паказаў істотную мяжу такога аналізу: метрыка можа карэляваць з ацэнкамі людзей, часткова ўлоўліваючы складанасць пытання, а не толькі якасць адказу. Вынік для адной сістэмы таму не дае гатовага парога для іншай.

Калі ёсць магчымасць, няхай частку выпадкаў незалежна ацэняць два эксперты. Іх разыходжанні дапамогуць удакладніць, што лічыць памылкай, перш чым параўноўваць з імі аўтаматычны бал. Пасля гэтага глядзіце не толькі на карэляцыю і сярэдняе значэнне: асобна праверце, якія сур’ёзныя памылкі метрыка прапусціла і колькі прымальных адказаў памылкова адхіліла. Для параўнання версій сістэмы выкарыстоўвайце аднолькавыя пытанні — тады складанасць розных набораў не будзе падмяняць эфект змены.

Суддзю на аснове моўнай мадэлі варта некалькі разоў запусціць на тых самых выпадках з тымі самымі наладамі. Асабліва важныя адказы каля магчымага парога: калі іх статус мяняецца паміж запускамі, аўтаматычная забарона выпуску будзе нестабільнай. Пасля замены мадэлі-суддзі, яе інструкцыі або крытэрыяў ацэнкі супадзенне з чалавечай разметкай трэба вымераць нанова.

Калі бал можа блакаваць выпуск у CI

Інструкцыя DeepEval для CI/CD апісвае запуск тэстаў праз assert_test() і deepeval test run: вынік ніжэй за зададзены парог можа зрабіць тэст няўдалым. Яна таксама адзначае, што некаторыя ацэнкі вагаюцца каля парога паміж запускамі. Магчымасць спыніць зборку ёсць у інструменце, але надзейнасць такога рашэння залежыць ад праверанай метрыкі і парога.

Метрыка можа блакаваць разгортванне, калі на лакальнай размечанай выбарцы яна стабільна знаходзіць памылку, якую каманда сапраўды лічыць непрымальнай, а яе парог узгоднены з экспертнымі рашэннямі. Пры параўнанні зборак трэба захоўваць аднолькавы набор пытанняў, стан базы ведаў і налады суддзі. Інакш падзенне бала можа тлумачыцца зменай умоў праверкі, а не пагаршэннем праграмы.

Калі метрыка добра паказвае агульную тэндэнцыю, але памыляецца на асобных крытычных выпадках або часта змяняе прысуд каля парога, пакіньце яе сігналам для разбору. Для аўтаматычнай забароны выпуску патрэбна больш вузкая і правераная ўласнай разметкай умова. Менавіта яна вызначае карысць выбранага набору ацэнак незалежна ад таго, у якой бібліятэцы ён запушчаны.

Чытайце таксама:

Падзяліцца:

Падпішыцеся на нашу рассылку

Атрымлівайце свежыя навіны пра Web3, ШІ і крыптавалюты проста на пошту.

0