Αξιολόγηση AI agent: ένα καλό demo δεν προβλέπει την παραγωγή

|Συντάκτης: Συντακτική ομάδα QUASA|5 λεπτά ανάγνωσης| 1
Αξιολόγηση AI agent: ένα καλό demo δεν προβλέπει την παραγωγή

Για να αξιολογήσετε έναν AI agent πριν από την παραγωγή, δοκιμάστε τον σε αντιπροσωπευτικές εργασίες περισσότερες από μία φορές και ελέγξτε την τελική κατάσταση μαζί με τις ενέργειες που οδήγησαν σε αυτήν. Ο οδηγός της OpenAI για agent evals συνδυάζει καταγραφές εκτέλεσης, graders, σύνολα δοκιμών και επαναλαμβανόμενα eval runs για τον εντοπισμό αστοχιών και regressions.

Μια επιτυχημένη επίδειξη δείχνει ότι ο agent ολοκλήρωσε μία συγκεκριμένη εκτέλεση, όχι πόσο συχνά θα πετυχαίνει σε παρόμοιες συνθήκες. Η ανάλυση της Anthropic εξηγεί ότι τα αποτελέσματα μεταβάλλονται μεταξύ προσπαθειών, ορίζει το trace ως πλήρη καταγραφή μιας εκτέλεσης και προτείνει 20–50 απλές εργασίες ως αφετηρία για ένα σύνολο αξιολόγησης.

Ξεκινήστε με εργασίες που αντιπροσωπεύουν τη χρήση

Για μια μικρή ομάδα, οι 20 εργασίες είναι ένα διαχειρίσιμο πρώτο σύνολο δοκιμών, όχι μέγεθος δείγματος που αποδεικνύει στατιστικά την αξιοπιστία. Πάρτε αιτήματα από τις λειτουργίες που πρόκειται να αναλάβει ο agent και από αστοχίες που έχουν ήδη παρατηρηθεί. Μοιράστε τις περιπτώσεις σε συνηθισμένες εργασίες, οριακά αιτήματα και καταστάσεις όπου πρέπει να ζητηθεί διευκρίνιση ή να σταματήσει μια ενέργεια.

Κάθε εργασία χρειάζεται το αρχικό αίτημα, τα δεδομένα που επιτρέπεται να χρησιμοποιηθούν, τα διαθέσιμα εργαλεία, το αναμενόμενο αποτέλεσμα και την επιτρεπόμενη αλλαγή στο σύστημα. Γράψτε επίσης ποια συμπεριφορά συνιστά αποτυχία. Αν, για παράδειγμα, ο agent αναλαμβάνει αλλαγές κρατήσεων, δεν αρκεί να απαντήσει ότι η αλλαγή έγινε: πρέπει να υπάρχει η σωστή κράτηση στην τελική κατάσταση.

Προσθέστε ελλιπή αιτήματα, αντικρουόμενα στοιχεία, κενές αποκρίσεις εργαλείων και προβλεπόμενες προσωρινές αποτυχίες. Για κάθε περίπτωση ορίστε ποια ανάκαμψη είναι αποδεκτή: νέα προσπάθεια, αίτημα για τα στοιχεία που λείπουν ή σαφής ενημέρωση ότι η εργασία δεν ολοκληρώθηκε. Αν ένα δοκιμαστικό αίτημα προέρχεται από πραγματική χρήση, αφαιρέστε προσωπικά δεδομένα χωρίς να χάσετε τις συνθήκες που επηρεάζουν την απόφαση.

Καταγράψτε το trace και ταξινομήστε την αστοχία

Κρατήστε για κάθε εκτέλεση το αίτημα, τις κλήσεις εργαλείων και τις παραμέτρους τους, τις αποκρίσεις, τα σφάλματα, την τελική απάντηση και την τελική κατάσταση του περιβάλλοντος. Αν ο agent παραδίδει μέρος της εργασίας σε άλλον agent, καταγράψτε και αυτή τη μετάβαση. Αρκούν τα παρατηρήσιμα βήματα του συστήματος· η αξιολόγηση δεν απαιτεί πρόσβαση στην εσωτερική συλλογιστική του μοντέλου.

Ορίστε από πριν μια μικρή ταξινομία: λάθος εργαλείο ή παράμετρος, ισχυρισμός χωρίς αντίστοιχο αποτέλεσμα, μη εξουσιοδοτημένη ενέργεια, κακός χειρισμός σφάλματος και υπέρβαση ορίου χρόνου ή κόστους. Στο trace σημειώστε το πρώτο βήμα όπου εμφανίστηκε το πρόβλημα. Μια ασαφής τελική απάντηση και μια λανθασμένη εγγραφή στο σύστημα μπορεί να μοιάζουν με μία αποτυχία στον χρήστη, αλλά απαιτούν διαφορετική διόρθωση.

Το trace εξηγεί γιατί απέτυχε μια εκτέλεση και επιτρέπει ελέγχους σε κρίσιμα βήματα, όπως μια ενέργεια χωρίς άδεια. Μην απορρίπτετε όμως κάθε διαδρομή που διαφέρει από την αναμενόμενη σειρά κλήσεων, αν φτάνει σε σωστό αποτέλεσμα χωρίς να παραβιάζει κανόνα. Ένας υπερβολικά άκαμπτος έλεγχος μπορεί να χαρακτηρίσει λανθασμένα μια έγκυρη λύση ως αποτυχία.

Χρησιμοποιήστε διαφορετικό grader για κάθε είδος ελέγχου

Οι σαφείς κανόνες προσφέρονται για ντετερμινιστικούς ελέγχους: αν έγινε η επιτρεπόμενη κλήση, αν οι παράμετροι είχαν σωστή μορφή, αν δημιουργήθηκε η απαιτούμενη εγγραφή και αν έμεινε ανέπαφη μια κατάσταση που ο agent δεν είχε δικαίωμα να αλλάξει. Ελέγξτε το trace ή την πραγματική τελική κατάσταση, όχι μόνο τη διαβεβαίωση που έδωσε ο agent στον χρήστη.

Για ποιοτικά κριτήρια, όπως η επάρκεια μιας διευκρινιστικής ερώτησης, μπορείτε να χρησιμοποιήσετε grader βασισμένο σε γλωσσικό μοντέλο. Δώστε του το αίτημα, τα σχετικά βήματα και συγκεκριμένη κλίμακα για επιτυχία, μερική επιτυχία και αποτυχία. Προσθέστε επιλογή «ανεπαρκή στοιχεία», ώστε να μη βαθμολογεί ως βέβαιο ένα αποτέλεσμα που δεν φαίνεται στα δεδομένα του.

Πριν βασιστείτε σε αυτόν τον grader, ζητήστε ανθρώπινη κρίση για δείγμα επιτυχημένων, αποτυχημένων και οριακών εκτελέσεων, χωρίς ο αξιολογητής να βλέπει πρώτα την αυτόματη βαθμολογία. Οι διαφωνίες δείχνουν πού η κλίμακα είναι ασαφής ή λείπει ένα στοιχείο από το trace. Κρατήστε τις αμφίσημες περιπτώσεις που επηρεάζουν την έκδοση για ανθρώπινη απόφαση.

Ορίστε όριο έκδοσης πριν δείτε τα αποτελέσματα

Ως αρχικό πρωτόκολλο, εκτελέστε καθεμία από τις 20 εργασίες τρεις φορές. Ξεκινήστε κάθε προσπάθεια από καθαρή κατάσταση και κρατήστε σταθερά το μοντέλο, τα εργαλεία, τις οδηγίες και τις συνθήκες δοκιμής, εκτός αν η ίδια η εργασία ελέγχει μια βλάβη εργαλείου. Έτσι οι προηγούμενες προσπάθειες δεν αφήνουν δεδομένα που θα επηρεάσουν τις επόμενες.

Ένα ενδεικτικό όριο για την πρώτη έκδοση είναι επιτυχία σε τουλάχιστον 18 από τις 20 εργασίες σε δύο από τις τρεις εκτελέσεις καθεμιάς, με μηδενικές μη εξουσιοδοτημένες ενέργειες. Καταγράψτε χωριστά τη σωστή τελική κατάσταση, τις κρίσιμες παραβάσεις, τον χρόνο και το κόστος. Το όριο είναι πρόταση λειτουργίας για μικρό αρχικό suite, όχι εγγύηση συμπεριφοράς στην παραγωγή· εργασίες με σοβαρές συνέπειες χρειάζονται αυστηρότερα κριτήρια και μεγαλύτερη κάλυψη.

Μετά από αλλαγή, τρέξτε το ίδιο σύνολο στις ίδιες συνθήκες και συγκρίνετε με την τελευταία αποδεκτή έκδοση. Ένας σαφής κανόνας regression είναι να μη δεχτείτε νέα κρίσιμη αστοχία ή νέο αποτυχημένο ντετερμινιστικό έλεγχο, να διατηρείται το αρχικό όριο εργασιών και να επιτρέπεται το πολύ μία επιπλέον μη κρίσιμη αποτυχημένη εκτέλεση στο σύνολο. Αν η διαφορά προέρχεται από βλάβη του περιβάλλοντος ή ασαφές κριτήριο, διορθώστε τη δοκιμή και επαναλάβετε τη σύγκριση αντί να αλλάξετε εκ των υστέρων το όριο.

Προσθέστε τις αστοχίες της παραγωγής στο suite

Μετά το deployment, τα πραγματικά traces και τα αναφερόμενα περιστατικά δείχνουν συμπεριφορές που δεν περιλάμβανε το αρχικό σύνολο. Μετατρέψτε κάθε σοβαρή ή επαναλαμβανόμενη αστοχία σε νέα εργασία με σαφές αναμενόμενο αποτέλεσμα και κατηγορία αποτυχίας. Κρατήστε παράλληλα το αρχικό σύνολο σταθερό για συγκρίσεις μεταξύ εκδόσεων, ώστε μια μεταβολή στη βαθμολογία να μην οφείλεται απλώς στην αλλαγή των ίδιων των δοκιμών.

Διαβάστε επίσης:

Κοινοποίηση:

Εγγραφείτε στο newsletter μας

Λάβετε τα τελευταία νέα για Web3, AI και κρυπτονομίσματα απευθείας στα εισερχόμενά σας.

0