
Kako testirati AI agenta prije produkcije: izlaz nije isto što i ishod

AI agenta prije produkcije testirajte na stvarnim zadacima s unaprijed određenim ishodom. Svaki zadatak ponovite u kontroliranoj okolini, provjerite završno stanje sustava te zabilježite trag radnji, trošak, trajanje i kršenja pravila. Rečenica „rezervacija je potvrđena” nije dokaz uspjeha ako rezervacija ne postoji.
Za početni paket odaberite 20 do 30 zadataka: to je izvediv podskup raspona od 20 do 50 jednostavnih zadataka iz stvarnih neuspjeha koji predlaže Anthropicov vodič za evaluaciju agenata. Zadatak, pojedini pokušaj, trag radnji i konačni ishod bilježite odvojeno. Uspjeh u jednom pokušaju ne pokazuje koliko će agent biti pouzdan u sljedećem.
Sastavite zadatke prema stvarnoj uporabi
Krenite od zahtjeva koje korisnici često postavljaju, provjera koje tim već obavlja ručno i prijavljenih neuspjeha. Uključite jednostavne poslove, rubne slučajeve i situacije u kojima agent treba zatražiti potvrdu ili odbiti radnju. Ako može mijenjati podatke ili pokretati transakcije, testirajte upravo te ovlasti.
Za svaki zadatak spremite specifikaciju koju drugi član tima može pokrenuti bez dodatnog tumačenja:
- početni zahtjev, dostupne podatke i dopuštene alate;
- početno stanje testne okoline i očekivano završno stanje;
- radnje koje su zabranjene te uvjet za ljudsku potvrdu;
- provjeru uspjeha, prihvatljive varijante odgovora i razlog za neuspjeh.
U uvjetnom primjeru agenta za rezervaciju leta očekivani ishod nije poruka putniku, nego valjana rezervacija u testnoj bazi. U uparenom zadatku agent mora zatražiti potvrdu prije rezervacije: tada je ispravan ishod nepromijenjena baza i jasan zahtjev za potvrdu. Par provjerava zna li agent obaviti dopuštenu radnju i suzdržati se od prerane radnje.
Prije pokretanja provjerite može li stručnjak riješiti svaki zadatak i prepoznati prihvatljiv ishod. Ako dvije razumne interpretacije vode različitim ocjenama, pojasnite zahtjev ili kriterij. Inače će rezultat mjeriti nejasnoću testa zajedno s ponašanjem agenta.
Ponovite pokušaje bez promjene uvjeta
Svaki pokušaj pokrenite iz čistog početnog stanja. Vratite testnu bazu, datoteke i dozvole na zadane vrijednosti kako prethodni pokušaj ne bi utjecao na sljedeći. Zabilježite verziju modela, uputa, alata i testnih podataka; bez toga je teško ustanoviti što je uzrokovalo promjenu rezultata.
Za svaki zadatak provedite više pokušaja i prikažite koliko ih je završilo uspjehom. Zasebno označite zadatke koji su uspjeli u svakom pokušaju. Ako agent jednom uspije, a zatim dvaput pogriješi, taj zadatak još nije stabilno riješen. Za korisnički proces koji treba raditi pri svakom zahtjevu dosljednost je važnija od podatka da je agent barem jednom pronašao rješenje.
Rezultate razdvojite po vrsti zadatka. Ukupan prosjek može prikriti pouzdan rad na jednostavnim upitima i česte pogreške pri izmjeni narudžbe. Mali početni skup koristan je za očite probleme i regresije, ali rijetke pogreške zahtijevaju širi skup i više pokušaja prije nego što se njihova učestalost može procijeniti.
Ocijenite ishod, a tragom pronađite uzrok
Najprije automatizirajte provjere s jednoznačnim odgovorom: postoji li traženi zapis, je li promijenjeno pravo polje, nalazi li se datoteka na očekivanom mjestu i je li zabranjena radnja izostala. Slobodan tekst ocjenjujte prema rubrici koja dopušta različite ispravne formulacije. Modelski ocjenjivač može procijeniti jasnoću ili potpunost odgovora, ali provjeru stanja koje se može očitati kodom prepustite kodnoj provjeri.
OpenAI-jeve upute za evaluaciju agenata povezuju tragove, ocjenjivače, skupove podataka i ponovljiva evaluacijska pokretanja. Uz ocjenu ishoda sačuvajte pozive alata, njihove argumente i odgovore te mjesto na kojem je pokušaj skrenuo. Tako možete razlikovati pogrešan izbor alata od ispravnog alata kojemu su predani pogrešni podaci. Nemojte ipak zahtijevati točno isti slijed koraka ako različiti dopušteni putovi vode istom ispravnom ishodu.
Za agenta koji iznosi činjenične tvrdnje provjerite podupire li dokaz tvrdnju, izostavlja li odgovor važan kontekst i je li dokaz dostatan za zaključak. NIST-ov projekt evaluacijskih provjera ispituje upravo vjernost, potpunost i dostatnost potkrepe te rezultate sprema u strojno čitljiv revizijski trag. Takva provjera posebno pomaže kad agent sastavlja odgovor iz pronađenih dokumenata.
Prije oslanjanja na modelski ocjenjivač neka stručnjak neovisno ocijeni uzorak uspješnih, neuspješnih i graničnih pokušaja. Usporedite ocjene, doradite rubriku ondje gdje se razilaze i ponovite provjeru. Čovjek pritom provjerava i sam zadatak: ako očekivani ishod nije jasan stručnjacima, automatska ocjena neće riješiti tu nejasnoću.
Mjerite trošak, trajanje i rizične radnje
Uz svaki pokušaj spremite potrošnju modela i alata, ukupno trajanje, broj poziva te ponavljanja izazvana pogreškom. Prikažite trošak svih pokušaja u odnosu na broj dovršenih zadataka, uz broj neuspjeha. Jeftin pojedinačni pokušaj može postati skup način rješavanja zadatka ako agent često mora pokušavati ponovno.
Za trajanje prikažite tipičan pokušaj i sporiji dio raspodjele, odvojeno za uspješne i neuspješne pokušaje. Korisnik može dugo čekati odgovor koji na kraju ipak ne obavi posao. Latenciju zato uspoređujte s granicom prihvatljivom za konkretni proces, a ne samo s brzinom kojom agent ispiše prvu poruku.
Sigurnost ocjenjujte zasebno od kvalitete odgovora. Označite neovlašteno pisanje, otkrivanje podataka, uporabu alata izvan dopuštenih ovlasti i preskakanje obvezne potvrde. Dobar odgovor na drugim zadacima ne poništava takav propust. Radnje s posljedicama ispitujte u izoliranoj testnoj okolini, uz iste granice ovlasti koje agent treba imati nakon uvođenja.
Unaprijed odredite što zaustavlja izdanje
Pragove dogovorite prije evaluacije: najmanju prihvatljivu uspješnost za svaku važnu skupinu zadataka, granice troška i trajanja po dovršenom zadatku te sigurnosne uvjete koji moraju proći bez iznimke. Kao praktično pravilo, zaustavite izdanje ako agent izvede neovlaštenu rizičnu radnju ili ako kritičan zadatak izgubi već potvrđenu funkciju. Brojčane granice za kvalitetu, cijenu i latenciju odredite prema vlastitom procesu i posljedicama pogreške.
Svaki stvarni neuspjeh koji otkrijete pretvorite u regresijski zadatak: sačuvajte početno stanje, trag, pogrešan ishod i kriterij prolaza. Nakon popravka pokrenite cijeli skup, uključujući zadatke koje agent prije nije griješio. Tako promjena modela, uputa ili alata ponovno prolazi iste provjere ishoda, pouzdanosti, troška, trajanja i ovlasti.
Pročitajte i:
Povezani članci


NVIDIA ograđuje AI agente: Sentry obećava reakciju u milisekundama

CrewAI ili LangGraph: brži početak plaća se manjom kontrolom tijeka

LangChain ili LlamaIndex: orkestracija i RAG nisu isti problem

AI koristi 62% hrvatskih tvrtki, ali samo 16% ima ili gradi strategiju

Googleov PageBreak našao je 500+ XSS propusta, uz provjeru svakog napada
Pretplatite se na naš newsletter
Primajte najnovije vijesti o Web3-u, AI-ju i kriptovalutama izravno u svoj sandučić.