Tekoälyagentin yksi onnistuminen voi johtaa harhaan – mittaa myös toistettavuutta

|Kirjoittaja: QUASAn toimitus|4 min lukuaika
Tekoälyagentin yksi onnistuminen voi johtaa harhaan – mittaa myös toistettavuutta

Yksi onnistunut tekoälyagentin ajo ei vielä osoita luotettavuutta: LangChainin arviointiohje kuvaa, miten oikea loppuvastaus voi peittää epävakaan työkalupolun. Määritä siksi tehtävälle tarkistettava lopputulos, arvioi työkalujen käyttö ja suoritusjälki erikseen sekä toista tehtävä puhtaasta lähtötilasta.

Kun vertaat agentin versioita, käytä samoja tehtäviä, hyväksymisehtoja ja toistomääriä. Kirjaa jokaisesta ajosta hyväksyntä tai hylkäys sekä hylkäyksen syy. Näin yksittäinen hyvä vastaus ei peitä sitä, että sama tehtävä epäonnistuu seuraavalla kerralla tai että muutos rikkoo toisen tehtäväryhmän.

Määritä tehtävä ja hyväksymisehdot etukäteen

Valitse testiin tehtäviä, joita agentin todella odotetaan hoitavan. Ota mukaan tavallisia pyyntöjä ja rajatilanteita: esimerkiksi sallittu tietojen muutos sekä samankaltainen pyyntö, jossa oikea ratkaisu on pysähtyä tai siirtää asia ihmiselle. Kirjoita onnistumisen ehdot ennen suoritusta, jotta vakuuttava vastaus ei muuta arviointiperustetta jälkikäteen.

Seuraava pohja kuvaa yhden tehtävän. Täytä se niin täsmällisesti, että toinen arvioija voi tehdä samoista havainnoista saman hyväksymispäätöksen:

  • Tehtävä: käyttäjän pyyntö ja tavoiteltu vastaus tai muutos.
  • Lähtötila: agentille näkyvät tiedot, käytettävissä olevat työkalut, oikeudet ja testijärjestelmän tila.
  • Hyväksytty lopputulos: tarkistettava vastaus, syntynyt artefakti tai toteutunut muutos.
  • Työkalujen rajat: tarpeellinen kutsu sekä toiminnot, joita agentti ei saa tehdä.
  • Arviointi: koneelliset ehdot ja asiantuntijan harkintaa vaativat kohdat.
  • Toistot: riippumattomien ajojen määrä, lähtötilan palautus ja kunkin ajon tulos.

Varmista ennen testiä, että tehtävä on ratkaistavissa annetuilla tiedoilla ja oikeuksilla. Jos hyväksymisehto edellyttää tietoa, jota tehtävässä ei ole, hylätty ajo voi johtua testin epäselvyydestä. Säilytä testikortin ja lähdeaineiston versio, jotta myöhempi vertailu käyttää samoja ehtoja.

Arvioi lopputulos, työkalut ja suoritusjälki erikseen

Aloita lopputilasta. Jos agentti ilmoittaa muuttaneensa tilausta, tarkista muutos testijärjestelmästä; loppuviesti ei yksin todista, että muutos tapahtui. Tiedonhakutehtävässä arvioi, kattaako vastaus ennalta sovitut asiat ja tukeeko käytetty aineisto keskeisiä väitteitä.

Tarkista seuraavaksi työkalukutsut: valitsiko agentti tarkoituksenmukaisen työkalun, käyttikö se oikeaa kohdetta ja välttikö se kielletyn toiminnon? Koko suoritusjälki auttaa paikantamaan, missä vaiheessa näkyvä virhe syntyi ja korjasiko agentti sen myöhemmin. OpenAI:n agenttityönkulkujen arviointiohje kuvaa jäljen mallikutsujen, työkalukutsujen, suojarajojen ja siirtojen tallenteena sekä suosittaa toistettavaa testiaineistoa muutosten vertailuun.

Hyväksy useampi järkevä etenemistapa, jos ne täyttävät saman tehtävän ehdot. Täsmällinen kutsujärjestys kannattaa lukita vain silloin, kun järjestys ratkaisee oikeellisuuden tai turvallisuuden, esimerkiksi kun käyttäjän lupa on tarkistettava ennen muutosta. Erota myös hyödyllinen lisäselvitys turhasta kiertelystä: pelkkä kutsujen määrä ei kerro, oliko suoritus hyvä.

Toista sama tehtävä puhtaasta lähtötilasta

Anthropicin agenttiarvioinnin ohje suosittaa aloittamaan jokaisen testiajon eristetystä, puhtaasta ympäristöstä ja erottaa toisistaan vähintään yhden onnistumisen sekä kaikkien toistojen onnistumisen. Palauta testitiedot, poista edellisten ajojen jättämät muutokset ja pidä agentin käytettävissä sama lähdeaineisto. Muuten esimerkiksi välimuisti tai vanha tiedosto voi muuttaa tulosta ilman, että agentti on parantunut.

Kirjaa jokaisesta ajosta onnistuminen tai epäonnistuminen ja laske sitten kaksi eri mittaria. pass@k kuvaa todennäköisyyttä, että vähintään yksi k yrityksestä onnistuu; testijoukossa sen voi raportoida niiden tehtävien osuutena, joille löytyi vähintään yksi onnistunut ajo. pass^k kuvaa todennäköisyyttä, että kaikki k yritystä onnistuvat; havaituissa testeissä se näkyy niiden tehtävien osuutena, joiden jokainen toisto läpäisi ehdot.

Ehdollisessa esimerkissä agentti onnistuu yhdessä saman tehtävän viidestä puhtaasta ajosta. Tehtävä täyttää silloin pass@5-ehdon mutta ei pass^5-ehtoa. Ensimmäinen mittari auttaa, jos toimiva ehdotus voidaan valita useasta yrityksestä; jälkimmäinen on olennaisempi, jos käyttäjä odottaa jokaisen pyynnön onnistuvan. Raportoi myös yksittäisten ajojen onnistumisosuus ja käytä vertailussa samaa k-arvoa.

Riippumattomat toistot paljastavat vaihtelua saman tehtävän sisällä, mutta testijoukon on katettava myös erilaisia tehtäviä. Ryhmittele tulokset esimerkiksi tavallisiin pyyntöihin, rajatapauksiin ja ihmisen apua vaativiin tilanteisiin. Muuten korkea kokonaisluku voi peittää heikkouden juuri niissä tilanteissa, joissa virheellä on suurin seuraus.

Sovita mittarit agentin työhön

Ehdollisessa puhelinasiakaspalvelun testissä käyttäjä pyytää palautuksen käsittelyä testitilaukselle. Lopputuloksesta tarkistetaan, vastaako päätös annettuja ehtoja ja onko tilauksen tila muuttunut oikein. Työkalujäljestä katsotaan, hakiko agentti oikean tilauksen, tarkistiko se palautuksen edellytykset ja tekikö muutoksen vain silloin, kun se oli sallittu. Epäselvän pyynnön kohdalla hyväksytty toiminta voi olla asian siirto ihmiselle.

Ehdolliselle tutkimusagentille tehtävä voi olla rajatun kysymyksen selvittäminen annetusta lähdeaineistosta. Arvioi erikseen, löytyvätkö sovitut olennaiset havainnot, tukeeko aineisto johtopäätöksiä ja merkitseekö agentti epävarman kohdan epävarmaksi. Jäljestä selviää, mitä aineistoa se käytti ja jäikö jokin keskeinen lähde käsittelemättä. Samat aineistoversiot on pidettävä käytössä jokaisessa toistossa ja vertailtavassa agenttiversiossa.

Koneellinen tarkistus sopii esimerkiksi testijärjestelmän tilaan, työkalun nimeen ja kutsun kohteeseen. Mallipohjainen arvio voi auttaa vastausten kattavuuden arvioinnissa, mutta epäselvät tai vaikutuksiltaan suuret tapaukset kannattaa antaa myös asiantuntijalle. Kirjaa erimielisyydet arviointiehtoon; muuten arvioijan vaihtuminen voi näyttää agentin muutokselta.

Vertaa versioita koko testijoukossa

Aja vanha ja uusi versio samoilla testikorteilla, samoilla oikeuksilla ja samalla toistomäärällä. Esitä lopputulos, työkalujen käyttö ja toistettavuus erikseen kullekin tehtäväryhmälle. Kokonaiskeskiarvon nousu ei riitä parannuksen merkiksi, jos esimerkiksi palautuspyynnöt tai lähteisiin perustuvat vastaukset heikkenevät.

Jos versioiden ero on pieni ja toistot vaihtelevat paljon, lisää tehtäviä tai ajoja ennen johtopäätöstä. Säilytä epäonnistuneiden ajojen jäljet: niistä voi erottaa väärän työkalun, puuttuvan tiedon, arviointiehdon epäselvyyden ja aidosti vaihtelevan toiminnan. Päätös perustuu näin sekä mitattuun tulokseen että siihen, mistä muutos syntyi.

Jaa:

Tilaa uutiskirjeemme

Saat tuoreimmat Web3-, tekoäly- ja kryptouutiset suoraan sähköpostiisi.

0