AI агентын demo-д бүү итгэ: 20 бодит алдаанаас eval эхлүүл

|Зохиогч: QUASA редакцын баг|5 мин уншина
AI агентын demo-д бүү итгэ: 20 бодит алдаанаас eval эхлүүл

AI агентыг production-д оруулахаас өмнө бодит алдааг давтагдах даалгавар болгож, хариунаас нь гадна tool call, үйлдлийн мөр болон орчны эцсийн төлөвийг шалга. Anthropic-ийн агентын үнэлгээний зөвлөмжид бодит алдаанаас авсан 20–50 энгийн даалгаврыг эхний eval багцын сайн эхлэл гэж үзсэн. Эхний 20 алдаанаас нэг нэг даалгавар гаргаж болно; энэ хэмжээ production-д бэлэн болсны баталгаа бус, өөрчлөлтүүдийг харьцуулах суурь юм.

Даалгавар бүрд зөвшөөрөгдөх үр дүн, хориглох үйлдэл, шалгах аргаа урьдчилан бич. Дараа нь ижил эхний төлөвөөс хэд хэдэн удаа ажиллуулаад амжилт, аюулгүй байдал, нэг ажилд зарцуулсан өртөг, хугацааг өмнөх хувилбартай харьцуул. Ингэснээр нэг удаагийн үзүүлбэрт амжилттай харагдсан агент бодит нөхцөлийг давтан давж чадаж байгаа эсэхийг хэмжинэ.

Бодит алдааг даалгавар болго

Эхний жагсаалтыг хэрэглэгчийн гомдол, дэмжлэгийн хүсэлт, хөгжүүлэлтийн үеэр гараар шалгадаг тохиолдол, алдааны бүртгэлээс ав. Тохиолдол бүрд хэрэглэгч юу хүссэн, агент хаана алдсан, алдаа ямар үр дагавартай байсныг тэмдэглэ. Хувийн мэдээллийг арилгаж, шаардлагатай өгөгдөл болон эрхийг тусгаарласан туршилтын орчинд сэргээ.

Нэг төрлийн алдааг олон янзаар хуулж тоог өсгөх хэрэггүй. Зөв tool сонгох, параметр дамжуулах, зөвшөөрөл авах, олон алхмын дараа төлөв хадгалах, боломжгүй хүсэлтийг зогсоох зэрэг өөр эрсдэлийг багтаа. Үйлдэл хийх ёстой болон хийх ёсгүй хувилбаруудыг хамтад нь оруулбал агент хэрэгтэй ажлаас татгалзаж байна уу, эсвэл зөвшөөрөлгүй үйлдэл хийж байна уу гэдэг нь харагдана.

Туршилтын мөр нь хэрэглэгчийн хүсэлтийн хамт агентын ашиглаж болох хэрэгсэл, эрх, эхний өгөгдлийг хадгалах ёстой. Хүсэлт ижил байсан ч эрх эсвэл орчны төлөв өөр бол зөв үйлдэл өөрчлөгдөнө. Ийм ялгааг даалгаврын тайлбарт үлдээхгүй бол дараагийн run-ийн оноог өмнөхтэй нь шударгаар харьцуулахад бэрх.

Шалгах нөхцөл, баталсан шийдлээ нэг мөрөнд хадгал

Жижиг баг хүснэгтийн нэг мөрийг нэг даалгавар болгож болно. Багана бүр тодорхой утгатай байвал туршилтыг өөр хүн дахин ажиллуулахдаа зөв хариуг таамаглах шаардлагагүй.

  • Оролт ба эхний төлөв: хэрэглэгчийн хүсэлт, агентын эрх, ашиглаж болох tool, орчинд урьдчилан байгаа өгөгдөл.
  • Хүлээгдэх үр дүн: ямар бичлэг, файл эсвэл төлөв өөрчлөгдөх ёстой; аль нь хэвээр үлдэх ёстой.
  • Зайлшгүй ба хориглох нөхцөл: зөвшөөрөл авах цэг, хүрч болохгүй өгөгдөл, tool-ийн зөвшөөрөгдөх параметр.
  • Шалгагч ба төсөв: кодон шалгалт эсвэл хүний рубрик, нэг оролдлогын хугацаа ба зардлын хязгаар.
  • Гарал ба хувилбар: даалгаврыг үүсгэсэн алдааны бүртгэл, хариуцах хүн, шалгуурын хувилбар.

Хүргэлтийн хаяг солих агентын нөхцөлт жишээнд хэрэглэгч өөрийн баталгаажсан захиалгын хаягийг солихыг хүснэ. «Сольсон» гэсэн хариу дангаараа тэнцэхгүй: зөв захиалгын хаяг шинэчлэгдсэн, бусад захиалга өөрчлөгдөөгүй, шаардлагатай зөвшөөрөл авсан байх ёстой. Хүчингүй захиалгатай хувилбарт өөрчлөлт хийхгүй байх нь зөв үр дүн болно.

Даалгавар бүрд бүх шалгагчийг давдаг нэг баталсан шийдэл хадгал. Ингэснээр даалгавар биелэх боломжтой, шалгуур хоорондоо зөрчилгүйг шалгана. Олон зөв замтай ажилд tool call-ийн ганц дарааллыг албадах нь үндэслэлтэй өөр шийдлийг унагаж болзошгүй; зайлшгүй үйлдэл болон эцсийн төлөвийг тусад нь тогтоо.

Хариу, trace, бодит үр дүнг тус тусад нь үнэл

OpenAI-ийн agent workflow үнэлэх заавар tool call, handoff болон бодлогын зөрчлийг эхлээд trace дээр шалгаж, шалгуур тодорхой болмогц dataset ба давтагдах eval run ашиглахыг зөвлөдөг. Trace нь алдаа ямар үйлдлийн үеэр гарсныг харуулна; орчны эцсийн төлөв нь хүссэн ажил үнэхээр хийгдсэнийг харуулна. Сайн бичсэн эцсийн хариу эдгээрийн аль нэгийг орлож чадахгүй.

Шалгагчийг хэмжих зүйлээр нь сонго. Кодоор өгөгдлийн төлөв, tool ба параметр, хүсээгүй өөрчлөлт, хугацаа, хэрэглэсэн токен болон төлбөрийг шалгаж болно. Чөлөөт хэлбэрийн хариултад загварын шалгагчийг тодорхой рубриктэй ашиглаж, баримт хүрэлцэхгүй үед «тодорхойгүй» гэж буцаах боломж өг. Маргаантай болон өндөр эрсдэлтэй түүврийг хүн үзэж, загварын үнэлгээ хүний шийдвэрээс тогтмол зөрж байгаа эсэхийг тогтоо.

Рубрикт «давсан» гэдгийг ажиглаж болох нөхцөлөөр бич: зөв бүртгэл өөрчлөгдсөн, шаардлагатай зөвшөөрөл trace-д байгаа, хориглосон tool дуудагдаагүй гэх мэт. Хэсэгчилсэн оноо нь алдааг оношлоход тустай ч зайлшгүй нөхцөлийг орлохгүй. Аюулгүй байдлын даалгаварт хориглосон үйлдэл хийгдсэн бол эелдэг тайлбар эсвэл зөв хариу тухайн оролдлогыг тэнцүүлэх ёсгүй.

Олон оролдлогын дүнг тусад нь хар

Ижил даалгаврыг давтах бүрд орчны анхны төлөвийг сэргээ. Өмнөх оролдлогын файл, кэш эсвэл өөрчилсөн бүртгэл үлдвэл дараагийн амжилт, алдаа хоёулаа төөрөгдүүлнэ. Run бүрт агентын хувилбар, prompt, tool-ийн тохиргоо, даалгаврын хувилбар, эцсийн төлөв, trace, хугацаа, зардлыг хамт хадгал.

Нийт амжилтын хувь ганцаараа шийдвэр гаргахад хангалтгүй. Даалгаврын бүлэг бүрийн давсан хувь, аюулгүй байдлын ноцтой зөрчил, орчны төлөв зөрсөн тохиолдол, амжилттай ажилд ногдох зардал, удаан оролдлогуудын хугацааг тусад нь хар. Зардал буурч, зөв гүйцэтгэл мөн буурсан бол хэмнэлтийн хажууд чанарын алдагдлыг ил тод тавих хэрэгтэй.

AlphaEval судалгаа долоон компанийн ажлаас авсан 94 production даалгаварт бүрэн агент бүтээгдэхүүнийг үнэлж, рубрик, формал шалгалт, UI тест зэрэг аргыг хослуулсан. Энэ жишээ нэг оноо олон төрлийн ажлын үр дүнг бүрэн илэрхийлэхгүйг харуулна. Харин танай release босгыг өөрийн орчин, эрх, хэрэглэгчийн хүсэлт, эрсдэлд тулгуурлан тогтоох шаардлагатай.

Release gate-ийг үр дүн харахаас өмнө тогтоо

Дараагийн хувилбарыг гаргах нөхцөлийг тест ажиллуулахаас өмнө бич. Нөхцөлт gate-ийн жишээ: зайлшгүй даалгавар бүр гурван оролдлогоос гуравт нь тэнцэх, аюулгүй байдлын ноцтой зөрчил тэг байх, бүлэг бүрийн амжилт баталсан хувилбараас буурахгүй байх, хугацаа ба зардал багийн тогтоосон хязгаарт багтах. Эдгээр тоо нь нийтлэг стандарт бус; үйлчилгээний эрсдэл болон хэрэглэгчийн хүлээлтэд тохируулан урьдчилан бөглөх загвар юм.

Gate унавал тухайн оролдлогын trace, бодит орчны төлөв, шалгагчийн тайлбарыг зэрэг үз. Агент буруу үйлдсэн байж болно; мөн даалгавар хоёрдмол эсвэл шалгагч зөв шийдлийг хэт хатуу унагасан байж болно. Шалтгааныг тогтоосны дараа шаардлагатай засварыг хийж, бодит алдаанаас үүссэн даалгаврыг багцад үлдээ. Дараагийн хувилбар дээр тэр даалгаврыг дахин ажиллуулах нь засвар давтагдах нөхцөлд тогтвортой эсэхийг хэмжинэ.

Мөн уншаарай:

Хуваалцах:

Мэдээллийн товхимолд бүртгүүлэх

Web3, AI болон криптоны шинэ мэдээг шууд имэйл хайрцагтаа аваарай.

0