
Το RCP-nDCG βρίσκει σχετικά έγγραφα που τα κλασικά benchmarks χάνουν

Στις 30 Σεπτεμβρίου 2026 η Cohere παρουσίασε το RCP-nDCG@10, μια μέθοδο αξιολόγησης της κατάταξης αποτελεσμάτων αναζήτησης. Ένας βαθμονομημένος κριτής τεχνητής νοημοσύνης αποτιμά και έγγραφα που δεν είχαν λάβει ετικέτα συνάφειας στο αρχικό benchmark. Στην τυφλή μελέτη της εταιρείας, όταν το RCP-nDCG και το συμβατικό nDCG επέλεγαν διαφορετικό νικητή, οι ανθρώπινοι αξιολογητές προτιμούσαν την επιλογή του RCP-nDCG στο 70% των περιπτώσεων.
Η διαφορά έχει σημασία για την εταιρική αναζήτηση: ένα νέο σύστημα μπορεί να φέρει ψηλά μια χρήσιμη απάντηση που δεν είχε εμφανιστεί κατά τη δημιουργία του συνόλου αξιολόγησης. Αν η απάντηση δεν έχει εξεταστεί από άνθρωπο, η βαθμολογία με τις παλιές ετικέτες δεν της δίνει πίστωση. Το RCP-nDCG επιχειρεί να καλύψει αυτό το κενό, διατηρώντας τη μεγαλύτερη βαρύτητα των αποτελεσμάτων στις πρώτες θέσεις. Η δημοσιευμένη επικύρωση αφορά συγκεκριμένα σύνολα δεδομένων και κρίσεις συνάφειας, όχι κάθε εταιρικό αρχείο ή γλώσσα.
Πώς ένα χρήσιμο έγγραφο μένει χωρίς πίστωση
Το nDCG συνδυάζει δύο στοιχεία: πόσο σχετικό θεωρείται ένα έγγραφο και πόσο ψηλά εμφανίζεται. Στα συνήθη benchmarks η συνάφεια προέρχεται από υπάρχουσες ανθρώπινες κρίσεις, τις λεγόμενες qrels. Οι αξιολογητές δεν μπορούν να εξετάσουν κάθε πιθανό ζεύγος ερωτήματος και εγγράφου, οπότε οι ετικέτες καλύπτουν ένα μέρος του αρχείου. Στην αξιολόγηση με αυτές τις ετικέτες, ένα αποτέλεσμα που δεν κρίθηκε μπορεί να λάβει μηδενική πίστωση ακόμη κι αν απαντά σωστά στο ερώτημα.
Σε ένα υποθετικό ελληνικό παράδειγμα, εργαζόμενος αναζητά τον ισχύοντα κανόνα τηλεργασίας. Το σύνολο αξιολόγησης έχει χαρακτηρίσει σχετική μια παλαιότερη γενική οδηγία, ενώ μια νεότερη πολιτική με σαφή απάντηση δεν είχε εξεταστεί. Το πρώτο σύστημα εμφανίζει ψηλά τη νεότερη πολιτική· το δεύτερο εμφανίζει ψηλά την ήδη επισημασμένη οδηγία. Η βαθμολογία που στηρίζεται μόνο στις παλιές ετικέτες μπορεί να ευνοήσει το δεύτερο σύστημα, παρότι ένας άνθρωπος θα προτιμούσε το πρώτο αποτέλεσμα.
Ο κριτής του RCP-nDCG μπορεί να αποδώσει συνάφεια και στη νεότερη πολιτική, εφόσον αξιολογήσει σωστά το περιεχόμενό της. Η διόρθωση αφορά όμως τα έγγραφα που περιλαμβάνονται στο εξεταζόμενο σύνολο υποψήφιων αποτελεσμάτων. Αν η αρχική ανάκτηση δεν φέρει καθόλου τη νεότερη πολιτική, η μετρική δεν μπορεί να τη βρει μέσα στην κατάταξη. Έτσι, μια υψηλότερη βαθμολογία ανακατάταξης δεν περιγράφει από μόνη της την κάλυψη ολόκληρου του εταιρικού αρχείου.
Τι προσθέτει ο βαθμονομημένος κριτής
Το RCP συνδυάζει απόλυτες κρίσεις συνάφειας με συγκρίσεις μεταξύ εγγράφων. Ο κριτής απαντά στα ίδια ερωτήματα ναι ή όχι για κάθε υποψήφιο αποτέλεσμα και συγκρίνει αποτελέσματα μέσα στο ίδιο ερώτημα. Οι συγκρίσεις βοηθούν να ξεχωρίσουν έγγραφα με κοντινή χρησιμότητα. Τα κοινά κριτήρια λειτουργούν ως σημείο αναφοράς, ώστε οι βαθμοί από διαφορετικά ερωτήματα να τοποθετούνται σε συγκρίσιμη κλίμακα.
Αυτή η βαθμονόμηση παράγει συνεχείς βαθμούς συνάφειας αντί για τις διακριτές ετικέτες του αρχικού συνόλου. Έπειτα εφαρμόζεται η λογική του nDCG: ένα χρήσιμο έγγραφο συμβάλλει περισσότερο όταν βρίσκεται ψηλά. Αλλάζει επομένως το σήμα συνάφειας που μπαίνει στον υπολογισμό, ενώ η θέση στην κατάταξη εξακολουθεί να μετρά. Η διαφορά είναι ουσιαστική όταν το αρχικό σύνολο ετικετών έχει παραλείψει απαντήσεις που νεότερα συστήματα καταφέρνουν να ανακτήσουν.
Η καταγραφή της παρουσίασης του Embed 5 αναφέρει ότι η Cohere χρησιμοποίησε το RCP-nDCG@10 στην αξιολόγηση του μοντέλου. Αυτό δίνει πρακτική βαρύτητα στην επιλογή μετρικής: δύο πίνακες κατάταξης μοντέλων μπορεί να διαφέρουν επειδή πιστώνουν διαφορετικά τα έγγραφα χωρίς αρχική ετικέτα. Η βαθμολογία αφορά την εξεταζόμενη συλλογή και τη συγκεκριμένη διαδικασία ανάκτησης και ανακατάταξης.
Τι έδειξαν οι ανθρώπινες κρίσεις
Η προδημοσίευση της 28ης Σεπτεμβρίου 2026 περιγράφει τυφλές κρίσεις από 46 εξωτερικούς αξιολογητές. Η βαθμονόμηση αύξησε τη συσχέτιση ανάμεσα στη μέση βαθμολογία ενός ερωτήματος και τη μέση ανθρώπινη βαθμολογία από 0,538 σε 0,795. Σε μια στενότερη ανάλυση 185 συγκρίσεων, όπου ακριβώς μία από τις δύο μετρικές συμφωνούσε με την ανθρώπινη επιλογή, αυτή ήταν το RCP-nDCG στο 72,4% των περιπτώσεων. Ο παρονομαστής αυτής της ανάλυσης διαφέρει από εκείνον του ποσοστού που αφορά τις διαφωνίες μεταξύ των μετρικών.
Το μέγεθος της διαφοράς βαθμολογίας επηρεάζει την ερμηνεία. Στη διαδικασία της μελέτης, μικρά προβαδίσματα του RCP-nDCG δεν προέβλεπαν αξιόπιστα την ανθρώπινη προτίμηση, ενώ μεγαλύτερα περιθώρια συνδέονταν συχνότερα με αυτήν. Οι συγγραφείς αντιμετωπίζουν διαφορές κάτω από 0,02 μεταξύ δύο λιστών του ίδιου ερωτήματος ως ισοπαλία. Πρόκειται για όριο που προέκυψε από το συγκεκριμένο δείγμα και τη συγκεκριμένη κλίμακα βαθμολογίας· σε άλλη συλλογή χρειάζεται νέα ανθρώπινη επικύρωση.
Η μελέτη εξετάζει επίσης μια αδυναμία της αξιολόγησης ανά έγγραφο: δύο αποτελέσματα μπορεί να είναι χωριστά σχετικά αλλά να επαναλαμβάνουν την ίδια πληροφορία, αφήνοντας αναπάντητο άλλο μέρος του ερωτήματος. Η κρίση συνάφειας δεν πιστοποιεί ούτε την πραγματική ορθότητα του περιεχομένου. Επιπλέον, οι ερωτήσεις προς τους ανθρώπινους αξιολογητές μοιάζουν σκόπιμα με τα κριτήρια του κριτή ΤΝ, ενώ ένας τέτοιος κριτής μπορεί να μοιράζεται προτιμήσεις με τα μοντέλα που βαθμολογεί.
Τι σημαίνει για ελληνικά εταιρικά αρχεία
Για αναζήτηση ή RAG στην Ελλάδα και την Κύπρο, το κρίσιμο ερώτημα είναι αν ο κριτής αναγνωρίζει χρήσιμα ελληνικά έγγραφα που έμειναν χωρίς ετικέτα. Η ανθρώπινη μελέτη άντλησε τις συγκρίσεις της από αγγλόφωνα σύνολα κειμένων. Ελληνικές πολιτικές, αναθεωρημένες οδηγίες και ερωτήματα με ειδική ορολογία μπορούν να δημιουργήσουν διαφορετικές ασάφειες από εκείνες του δημοσιευμένου δείγματος.
Ένας ανθρώπινος έλεγχος της τοπικής αξιολόγησης θα έβαζε ανθρώπους να κρίνουν τυφλά πραγματικά ερωτήματα και αποτελέσματα, με ιδιαίτερη προσοχή στα έγγραφα χωρίς αρχική ετικέτα και στις περιπτώσεις όπου οι δύο μετρικές διαφωνούν. Οι αποκλίσεις μπορούν τότε να εξεταστούν ανά γλώσσα, τύπο εγγράφου και είδος ερωτήματος: αν, για παράδειγμα, ο κριτής προτιμά μια εκτενή παλιά οδηγία από μια σύντομη ισχύουσα πολιτική, η νέα βαθμολογία θα κληρονομήσει αυτή την προτίμηση. Για εταιρική χρήση, η αξία της μετρικής κρίνεται τελικά από το αν οι πρόσθετες απαντήσεις που πιστώνει είναι πράγματι οι απαντήσεις που χρειάζονται οι χρήστες του συγκεκριμένου αρχείου.
Διαβάστε επίσης:
Σχετικά άρθρα


DeepL ή Google Translate στα ελληνικά: το ύφος αλλάζει τον νικητή

Pinecone ή Weaviate: η ταχύτητα δεν αρκεί χωρίς κόστος κλιμάκωσης

Firebase ή Supabase: το δωρεάν backend μπορεί να γεννήσει απρόβλεπτο λογαριασμό

Νέα ετικέτα για data centers: πάνω από 500 kW μπαίνουν σε αξιολόγηση

LangChain ή LlamaIndex: ο RAG κρίνεται πριν από το μοντέλο
Εγγραφείτε στο newsletter μας
Λάβετε τα τελευταία νέα για Web3, AI και κρυπτονομίσματα απευθείας στα εισερχόμενά σας.