Test AI-agenter før drift: Et godt svar kan skjule forkert værktøjsvalg

|Forfatter: QUASA's redaktion|5 min. læsning| 1
Test AI-agenter før drift: Et godt svar kan skjule forkert værktøjsvalg

Test en AI-agent ved at give den faste opgaver, gemme hele forløbet og sammenholde hvert spor med krav, der er skrevet før testen. Bedøm værktøjsvalg, argumenter, overdragelser og instruktionsefterlevelse særskilt fra slutsvaret. Agenten kan nå frem til et brugbart svar efter at have kaldt et forkert værktøj eller udført en handling, den ikke havde lov til.

Start med et lille referencesæt, som kan køres igen, når model, prompt eller værktøjer ændres. Angiv for hver opgave, hvad der skal ske, hvilke alternative forløb der er acceptable, og hvilke fejl der blokerer for drift. Brug senere stikprøver fra produktionen til at finde tilfælde, som det faste sæt ikke dækkede.

Kortlæg de beslutninger, sporet skal afsløre

Et testspor skal vise de trin, agenten faktisk udførte. OpenAI’s vejledning om agentevaluering beskriver spor med modelkald, værktøjskald, sikkerhedskontroller og overdragelser og fremhæver værktøjsvalg, overdragelse og regelbrud som forhold, der kan bedømmes undervejs. Det gør det muligt at skelne mellem et korrekt resultat og en korrekt fremgangsmåde.

Tegn først agentens vigtigste beslutningspunkter op. Hvornår må den svare uden opslag, og hvornår skal den hente oplysninger? Hvilket værktøj må ændre en ordre eller en konto? Hvornår skal en anden agent eller en medarbejder overtage? Notér også, hvilke oplysninger der skal følge med hvert kald. Det rette værktøjsnavn er ikke nok, hvis kaldet indeholder en forkert kunde eller ordre.

Prioritér forløb, hvor en fejl har en konkret følge: opslag i en anden kundes data, ændring uden krævet tilladelse eller en overdragelse, som udebliver. For disse forløb bør sporet også vise rækkefølgen. En kontrol udført efter en ændring opfylder ikke et krav om kontrol før ændringen, selv om slutsvaret ser forsvarligt ud.

Byg et lille referencesæt med kendte forventninger

Hver testopgave skal have et brugerinput, den relevante starttilstand, forventede værktøjsresultater og en beskrivelse af tilladte handlinger. OpenAI’s anbefalinger til evaluering skelner mellem slutsvar, værktøjsvalg, præcise argumenter og overdragelser og anbefaler både almindelige tilfælde, grænsetilfælde og menneskelig kalibrering af bedømmelser. Sættet skal derfor rumme mere end forespørgsler, hvor den rigtige vej er åbenlys.

Som tænkt eksempel kan en kundeserviceagent både slå ordrestatus op og starte en retur. Giv den en entydig forespørgsel om levering, en forespørgsel uden ordrenummer, et ønske om retur og en samtale, hvor kunden skifter emne. Ved manglende ordrenummer kan den forventede handling være at spørge kunden først. Ved et spørgsmål om levering kan et kald til returværktøjet være en fejl, selv hvis agenten til sidst giver kunden den rigtige status.

Skriv forventningerne, så testen ikke afviser uskyldige variationer. Agenten kan formulere et opklarende spørgsmål på flere måder, mens ordrenummeret i et opslag skal svare til det nummer, kunden gav. Gem opgaver, forventninger og værktøjssvar med en versionsangivelse. Faste eller simulerede værktøjssvar gør det lettere at sammenligne agentens beslutninger på tværs af versioner; den virkelige integration bør også prøves særskilt, så fejl i et eksternt system bliver synlige. Fjern eller erstat personoplysninger, når opgaver bygger på faktiske samtaler.

Gør kritiske kriterier binære

Bedøm observerbare hændelser i stedet for et samlet indtryk af samtalen. For den tænkte ordrestatusopgave kan testen kræve et opslag med det korrekte ordrenummer og fravær af kald til returværktøjet. Et brugbart svar kan vurderes ved siden af disse krav, men bør ikke opveje et brud på dem.

  • Værktøjsvalg: Blev et påkrævet værktøj kaldt, og blev forbudte kald undgået?
  • Argumenter: Svarede identifikatorer og påkrævede felter til de oplysninger, agenten havde fået?
  • Overdragelse: Skete den ved den aftalte grænse, og fulgte den nødvendige kontekst med?
  • Instruktioner: Blev en krævet tilladelse eller kontrol indhentet før handlingen?
  • Slutsvar: Stemmer svaret med værktøjets resultat, og siger det tydeligt, hvis opgaven ikke blev fuldført?

De første kriterier kan ofte kontrolleres direkte i sporet. Når bedømmelsen kræver sprogligt skøn, kan en fagperson eller en model bruge en kort beskrivelse af, hvad der tæller som bestået. Gennemgå et udsnit af de automatiske bedømmelser manuelt. Ellers kan en bedømmer komme til at belønne en overbevisende formulering, selv om det dokumenterede forløb var forkert.

Kør regressionstest, før agenten ændres i drift

Kør hele referencesættet med samme input og værktøjssvar, når prompt, model, værktøjsbeskrivelser eller regler for overdragelse ændres. Sammenlign både kriterierne og de konkrete spor med den tidligere version. Kør udvalgte vanskelige opgaver flere gange, hvis agenten kan vælge forskellige veje fra samme udgangspunkt; en enkelt vellykket kørsel viser kun, at opgaven kan lykkes.

Fastlæg en grænse for idriftsættelse på forhånd. En mulig regel er, at fejl med handlinger uden tilladelse, forkerte identifikatorer eller manglende påkrævede overdragelser altid stopper ændringen. Mindre alvorlige fejl kan vurderes efter særskilte, på forhånd aftalte kriterier. Grænsen afhænger af, hvad agentens værktøjer kan gøre, og hvilke følger en fejl har; den er ikke en universel kvalitetsprocent.

Brug stikprøver fra drift til nye testtilfælde

Produktionsspor kan vise situationer, referencesættet overså. LangSmiths dokumentation for online evaluering beskriver, hvordan evaluering kan afgrænses til forløb med bestemte værktøjskald eller metadata og anvendes på en valgt andel af dem. Det er nyttigt, når særligt følsomme forløb skal følges uden at bedømme alle kald.

Undersøg en afvigelse i det fulde spor, før den bliver til en ny testopgave. Hvis fejlen skyldes agentens valg, kan input, starttilstand og forventet adfærd føjes til referencesættet og afprøves ved næste ændring. En stikprøve kan opdage fejl, der allerede er sket; adgangskontrol og godkendelse omkring værktøjer skal derfor håndhæves, når en handling udføres.

Læs også:

Del:

Tilmeld dig vores nyhedsbrev

Få de seneste nyheder om Web3, AI og krypto direkte i din indbakke.

0