Ragas eða DeepEval: gagnasafnið og CI-prófið mæla ekki sama hlut

|Höfundur: Ritstjórn QUASA|6 mín. lestur| 1
Ragas eða DeepEval: gagnasafnið og CI-prófið mæla ekki sama hlut

Ragas hentar þegar þróunarteymi vill greina mynstur í svörum RAG-kerfis yfir matsgagnasafn og rekja hvort breyting hafi áhrif á leit eða svarmyndun. Leiðbeiningar Ragas um mat á RAG-kerfi lýsa gagnasafni, mælikvörðum, niðurstöðum fyrir einstök dæmi og samanburði milli tilrauna. Sú leið hjálpar við að finna hvað þarf að laga.

DeepEval hentar þegar valin dæmi eiga að standast skilgreind skilyrði áður en breyting fer í útgáfu. RAG-leiðbeiningar DeepEval sýna hvernig assert_test() tengir mælikvarða við pytest svo fallið próf geti stöðvað keyrslu í þróun eða CI. DeepEval getur líka metið heilt gagnasafn. Raunverulegi munurinn við þetta val er því hvort niðurstaðan eigi fyrst að skýra bilun eða framfylgja útgáfuskilyrði.

Hvaða gögn þarf til að mæla réttan hlut?

Sameiginlegur grunnur er spurningin, svarið sem kerfið myndaði og textabrotin sem það sótti fyrir það svar. Varðveita þarf röð brotanna og tengingu þeirra við heimildirnar; annars verður erfitt að greina hvort rangt svar stafi af því sem leitin fann eða því hvernig svarið var samið. Viðmiðunarsvar eða merktar réttar heimildir bætast við þegar mæla á hvort mikilvæg atriði vanti.

Heimildatryggð svarar afmarkaðri spurningu: fá fullyrðingar í mynduðu svari stoð í sóttu brotunum? Hún getur afhjúpað svar sem gengur lengra en tiltækar heimildir, en hátt gildi segir ekki eitt og sér hvort brotin séu rétt eða hvort svarinu vanti upplýsingar. Fyrir slíkan greinarmun þarf að meta leitarniðurstöðurnar og svarið hvort í sínu lagi.

Röðun sóttra brota er annað viðfangsefni. Skilgreining Ragas á Context Precision metur hvort gagnleg brot komi ofar óviðkomandi brotum. Á sömu síðu er Context Utilization lýst sem leið sem ber brotin saman við myndað svar þegar viðmiðunarsvar vantar. Það getur nýst við könnun, en ef svarið sleppir mikilvægu atriði getur brot sem inniheldur það virst ónýtt í slíkum samanburði.

Til að meta hvort leitin hafi fundið það sem þurfti er viðmið nauðsynlegt. Skilgreining Ragas á Context Recall lýsir samanburði milli fullyrðinga í viðmiðunarsvari og sóttra brota; einnig má bera auðkenni sóttra heimilda við auðkenni réttra heimilda. Hjá DeepEval krefjast Contextual Precision og Contextual Recall viðmiðunarsvars, expected_output, en Faithfulness getur borið myndað svar við sótt brot án þess. Mat án gullsvars á því við um tiltekna mælikvarða, ekki allt mat í öðru hvoru verkfærinu.

Hvað gefur gagnasafnið umfram eina einkunn?

Ragas nýtist best til bilanagreiningar þegar sama safn spurninga er keyrt á eldri og nýrri útgáfu RAG-kerfis. Þá má sjá hvort breyting á leit skilar gagnlegri brotum, hvort svarið styðst betur við þau og hvort það uppfyllir enn viðmið fyrir innihald. Meðaltal yfir safnið getur falið að árangur batni á auðveldum spurningum en versni á þeim sem skipta mestu.

Skrá þarf hvaða útgáfa heimildasafnsins, leitarstillinga og svarfyrirmæla var notuð í hvorri keyrslu. Breytist heimildasafnið um leið og leitaraðferðin er breytt verður erfiðara að rekja orsök munarins. Niðurstöður fyrir einstakar spurningar og varðveitt sótt brot gefa þá meiri upplýsingar en ein samanlögð tala.

Matsgagnasafnið ætti líka að innihalda spurningar sem tiltækar heimildir svara ekki. Þar getur gott svar falist í að viðurkenna skort á upplýsingum. Ef öll dæmi gera ráð fyrir fyrirfram þekktu svari getur matið misst af þeirri hegðun, jafnvel þótt einkunnir fyrir heimildanýtingu líti vel út.

Hvað á CI-prófið að stöðva?

Í DeepEval er hægt að keyra RAG-kerfið fyrir hvert valið prófdæmi, setja spurningu, myndað svar og sótt brot í próftilvik og láta assert_test() meta þau. Fallin mæling verður þá fallið próf. Þannig má verja tiltekna hegðun við hverja breytingu í stað þess að bíða eftir að afturför komi fram í reglulegri yfirferð á stærra safni.

Útgáfuskilyrðið þarf að samsvara biluninni sem á að stöðva. Heimildatryggð á við þegar svarið má ekki setja fram fullyrðingar án stoðar í sóttum texta. Mælikvarði á leitarniðurstöður á við þegar vandinn er röð eða gagnsemi brotanna. Ef markmiðið er að greina trúverðugt en efnislega rangt svar þarf að auki viðmiðunarsvar eða annað sjálfstætt viðmið um rétt svar.

Prófdæmi fyrir CI þurfa ekki að vera jafnmörg og dæmi í rannsóknarsafninu. Vel skilgreind dæmi um mikilvæga hegðun gera fallið próf auðveldara að túlka, en einkunnarmörkin verða að miðast við þá hegðun. Lítil breyting á meðaltali getur skipt minna máli en fall á einni spurningu þar sem röng heimild eða rangt svar hefur skýrar afleiðingar.

Hvernig verður fallið próf kembanlegt?

Fall segir að skilyrði hafi ekki staðist; það segir ekki sjálfkrafa hvaða hluti RAG-kerfisins bilaði. Greina þarf hvort nauðsynlegt brot kom yfirhöfuð í leitarniðurstöðurnar, hvort það var nógu ofarlega og hvort myndaða svarið notaði það rétt. Þegar brotið fannst aldrei er breyting á svarfyrirmælum ein og sér ólíkleg til að leysa leitarmálið.

DeepEval getur sýnt einkunn og rök mælikvarða fyrir próftilvik og tengt þau við rakningu leitar og svarmyndunar þegar slík rakning er sett upp. Ragas gefur færi á að skoða niðurstöður eftir dæmum og mælikvörðum í stærra safni. Í báðum vinnuferlum þarf að geyma sjálf sóttu brotin: skýring frá matslíkani kemur ekki í stað þess að sjá þær heimildir sem kerfið hafði þegar það svaraði.

Mannlegt viðmið áður en dómari fær stöðvunarvald

LLM-dómari þarf sjálfur viðmið áður en einkunn hans ræður útgáfu. Í rannsókn á RAG-mælikvörðum í hagnýtu samhengi voru mælikvarðar úr Ragas, DeepEval, RAGChecker og Opik bornir saman við mat tveggja manna á svörum úr einu RAG-kerfi. Höfundurinn bendir á að fylgni við mannlegt mat í þeirri uppsetningu sýni ekki ein og sér að mælikvarði greini á milli betri og verri útgáfa kerfisins; hann gæti einnig endurspeglað hversu auðveld spurningin er.

Sameiginlegt mannlegt gullsafn gerir samanburðinn gagnlegri fyrir bæði verkfæri. Fyrir hverja spurningu má merkja hvort svarið sé stutt af heimildum, hvort það svari því sem var spurt og hvort mikilvægar upplýsingar vanti. Matsmenn þurfa sameiginlegar skilgreiningar, og ágreiningur þeirra þarf að vera sýnilegur áður en merkin eru notuð sem óumdeilanleg viðmið.

  1. Safnið saman raunverulegum spurningum, sóttum brotum og svörum, þar á meðal dæmum þar sem kerfið á að viðurkenna að heimildir dugi ekki.
  2. Látið fólk merkja dæmin samkvæmt föstum viðmiðum og varðveitið ágreining og úrlausn hans.
  3. Berið sjálfvirka dóma saman við mannlegu merkin. Skoðið sérstaklega röng samþykki, þar sem galli sleppur í gegn, og rangar hafnanir, þar sem nothæft svar fellur.
  4. Berið eldri og nýrri svör við sömu spurningu saman áður en einkunnarmörk fá að stöðva CI-keyrslu.

Þessi síðasti samanburður skiptir máli vegna þess að dómari getur gefið auðveldum spurningum háar einkunnir án þess að taka eftir því þegar svar við sömu spurningu versnar milli útgáfa. Þegar heimildir, gerð spurninga eða matslíkan breytast þarf að endurskoða hversu vel dómarnir falla að mannlega viðmiðinu. Óviss eða umdeild dæmi geta þá farið í mannlega yfirferð í stað þess að ráða sjálfkrafa útgáfu.

Hvenær borgar sig að nota bæði?

Notið Ragas til að rannsaka dreifingu bilana yfir fjölbreytt matsgagnasafn og DeepEval til að verja vel skilgreind, mikilvæg dæmi í CI. Sömu spurningar geta komið fyrir í báðum ferlum, en niðurstöðurnar svara ólíkum ákvörðunum: gagnasafnið sýnir hvar breyting hafði áhrif, prófið segir hvort tiltekið útgáfuskilyrði stóðst.

Sameiginlegt mannlegt viðmið tengir ferlana. Það sýnir hvort sjálfvirk einkunn fylgir þeim gæðum sem teymið vill varðveita og hvort fallið próf stöðvar raunverulega afturför. Þannig verður hægt að nota víðtæka greiningu til að velja ný prófdæmi án þess að rugla saman greiningareinkunn og ákvörðun um útgáfu.

Lestu einnig:

Deila:

Gerstu áskrifandi að fréttabréfinu okkar

Fáðu nýjustu fréttir af Web3, gervigreind og rafmyntum beint í pósthólfið.

0