Απομαγνητοφώνηση ελληνικών: το χαμηλό WER κρύβει το πρόβλημα των διαλέκτων

|Συντάκτης: Συντακτική ομάδα QUASA|6 λεπτά ανάγνωσης| 1
Απομαγνητοφώνηση ελληνικών: το χαμηλό WER κρύβει το πρόβλημα των διαλέκτων

Για ηχογραφήσεις στην κοινή ελληνική, το Speechmatics Enhanced αξίζει να μπει πρώτο στη σύγκριση με το Whisper Large v3: ο πίνακας ελληνικών της Speechmatics καταγράφει WER 6,58% έναντι 12,32% στο FLEURS. Η μέτρηση προέρχεται από τον πάροχο και αφορά το συγκεκριμένο σύνολο δεδομένων. Δεν αποτελεί κατάταξη για κάθε συνέντευξη, συνάντηση ή διαλεκτική ηχογράφηση.

Όταν το υλικό περιλαμβάνει κυπριακά, προτεραιότητα έχει η επίδοση σε ομιλία σαν τη δική σας. Σε μελέτη κυπριακής ομιλίας, το Whisper Large v3 έδωσε WER 58,33% πριν και 33,93% μετά από προσαρμογή στη διάλεκτο, με εξομαλυμένες απομαγνητοφωνήσεις. Πρόκειται για άλλο ηχητικό υλικό και άλλη διαδικασία αξιολόγησης από το FLEURS, επομένως τα ποσοστά δεν συνιστούν απευθείας σύγκριση του προσαρμοσμένου Whisper με το Speechmatics.

Τι μετρά το WER στην πράξη

Το WER είναι το ποσοστό σφάλματος λέξεων σε σχέση με μια απομαγνητοφώνηση αναφοράς. Συνυπολογίζει λέξεις που αντικαταστάθηκαν, παραλείφθηκαν ή προστέθηκαν και διαιρεί το άθροισμά τους με τις λέξεις της αναφοράς. Ένα χαμηλότερο ποσοστό σημαίνει λιγότερες τέτοιες αποκλίσεις στο συγκεκριμένο τεστ, αρκεί τα συστήματα να αξιολογήθηκαν με το ίδιο υλικό και τους ίδιους κανόνες γραπτής απόδοσης.

Η αναφορά αυτή έχει όρια για όποιον χρειάζεται δημοσιεύσιμο κείμενο. Το WER δεν μετρά αν ο υπότιτλος εμφανίζεται την κατάλληλη στιγμή, αν ξεχωρίζουν σωστά οι ομιλητές ή πόση επιμέλεια απαιτείται για να διαβαστεί μια αυθόρμητη συζήτηση. Μια διαλεκτική λέξη μπορεί επίσης να αντικατασταθεί από οικεία λέξη της κοινής ελληνικής: το αποτέλεσμα ίσως φαίνεται ομαλό, αλλά δεν αποδίδει πιστά όσα ειπώθηκαν. Για συνέντευξη και γλωσσική τεκμηρίωση, αυτό το σφάλμα έχει άλλη βαρύτητα από ένα σημείο στίξης.

Τι αλλάζει έξω από την κοινή ελληνική

Τα διαλεκτικά σώματα δείχνουν πόσο περιορισμένη είναι η πρόβλεψη από ένα γενικό σκορ για τα ελληνικά. Η αξιολόγηση νεοελληνικών διαλέκτων μέτρησε το μη προσαρμοσμένο Whisper Large v3 με WER 70,24% στα κρητικά, 80,87% στη λεσβιακή ποικιλία και 96,65% στα καππαδοκικά. Τα ευρήματα προέρχονται από χωριστά σώματα φυσικής ομιλίας και δεν δείχνουν ποια επίδοση θα είχε το Speechmatics στις ίδιες ηχογραφήσεις.

Η διαφορά δεν εξηγείται μόνο από την προφορά. Τοπικές λέξεις, μορφολογικοί τύποι και συμβάσεις γραφής επηρεάζουν τη σύγκριση ανάμεσα στην έξοδο του μοντέλου και το κείμενο αναφοράς. Στη διαλεκτική αξιολόγηση, οι απομαγνητοφωνήσεις διατήρησαν τους τοπικούς τύπους, ενώ για τον υπολογισμό των σφαλμάτων αφαιρέθηκε η στίξη και έγινε εξομάλυνση του κειμένου. Έτσι, τα υψηλά ποσοστά περιγράφουν δυσκολία αναγνώρισης λέξεων υπό σαφείς συνθήκες, όχι απλώς διαφορετική χρήση κόμματος ή κεφαλαίων.

Τα ίδια αποτελέσματα δείχνουν ότι η προσαρμογή σε διαλεκτικό υλικό μπορεί να αλλάξει την εικόνα, αλλά όχι ομοιόμορφα για όλες τις ποικιλίες. Η κρητική ομιλία, η λεσβιακή ποικιλία και τα καππαδοκικά διαφέρουν μεταξύ τους τόσο γλωσσικά όσο και ως προς τις διαθέσιμες ηχογραφήσεις. Συνεπώς, ούτε ένα ενιαίο «διαλεκτικό WER» θα περιέγραφε αξιόπιστα όλο το υλικό που μπορεί να συναντήσει μια υπηρεσία στην Ελλάδα και την Κύπρο.

Γιατί τα κυπριακά χρειάζονται δική τους δοκιμή

Στην κυπριακή περίπτωση, η αρχική απόδοση του Whisper ήταν παρόμοια είτε χρησιμοποιήθηκαν οι πρωτότυπες είτε οι εξομαλυμένες απομαγνητοφωνήσεις. Αυτό έχει σημασία: τα πολλά σφάλματα πριν από την προσαρμογή δεν αποδίδονται απλώς σε ασυνήθιστους χαρακτήρες ή παραλλαγές ορθογραφίας. Μετά την εκπαίδευση σε κυπριακή ομιλία, η εξομάλυνση βοήθησε περισσότερο, επειδή μείωσε την ασυνέπεια στον τρόπο γραφής χωρίς να αφαιρέσει τη διαλεκτική ταυτότητα.

Το όριο της δοκιμής είναι εξίσου συγκεκριμένο. Το ερευνητικό σώμα είχε λίγους ομιλητές και ο διαχωρισμός ανάμεσα σε δεδομένα εκπαίδευσης και αξιολόγησης δεν έγινε ανεξάρτητα ανά ομιλητή. Μια βελτίωση σε αυτό το σώμα δεν εγγυάται την ίδια απόδοση σε άγνωστες φωνές, τηλεφωνικό ήχο ή συνομιλία με ταυτόχρονες παρεμβάσεις. Για μια υπηρεσία που προορίζεται για κυπριακές συνεντεύξεις, το ουσιαστικό ερώτημα είναι πόσες διαλεκτικές λέξεις θα χρειαστούν διόρθωση σε αντιπροσωπευτικά, μη δημοσιευμένα δείγματα.

Τοπική εκτέλεση, ζωντανή ροή και χρόνος παράδοσης

Το Whisper προσφέρει επιλογή τοπικής εκτέλεσης για όποιον θέλει να επεξεργάζεται αρχεία στη δική του υποδομή. Το επίσημο αποθετήριο του Whisper διαθέτει κώδικα και μοντέλα, περιγράφει διαφορετικές απαιτήσεις μνήμης ανά μέγεθος και δίνει εντολές για απομαγνητοφώνηση αρχείων. Οι ενδεικτικές ταχύτητές του έχουν μετρηθεί σε συγκεκριμένο υλικό και μπορεί να διαφέρουν ουσιαστικά σε άλλο μηχάνημα ή γλώσσα. Η εγκατάσταση στον δικό σας υπολογιστή, επομένως, απαντά στο ερώτημα του τρόπου εκτέλεσης· δεν απαντά από μόνη της στο ερώτημα της καθυστέρησης.

Για ζωντανούς υπότιτλους ή πρακτικά συνάντησης, μετρά ο χρόνος από τη φωνή μέχρι την εμφάνιση σταθερού κειμένου. Σε μια ήδη ηχογραφημένη συνέντευξη, μετρά περισσότερο ο συνολικός χρόνος επεξεργασίας μαζί με τη χειροκίνητη διόρθωση. Το Speechmatics προσφέρει ροή ήχου και επεξεργασία αρχείων, καθώς και επιλογές εγκατάστασης σε υποδομή πελάτη, αλλά ο δημοσιευμένος πίνακας FLEURS δεν μετρά την καθυστέρηση της δικής σας συνάντησης. Για ισότιμη επιλογή χρειάζονται χωριστές μετρήσεις ποιότητας και χρόνου στο προβλεπόμενο περιβάλλον.

Μικτή ομιλία και υπότιτλοι

Οι ελληνικές συναντήσεις περιλαμβάνουν συχνά αγγλικούς τεχνικούς όρους, ονόματα και σύντομες φράσεις. Ένα συνολικό WER μπορεί να είναι ικανοποιητικό ενώ τα σφάλματα συγκεντρώνονται ακριβώς σε αυτά τα σημεία. Η κάρτα μοντέλου του Whisper περιγράφει πολυγλωσσική αναγνώριση, άνιση απόδοση ανά γλώσσα και διάλεκτο και συνιστά αξιολόγηση στο συγκεκριμένο πεδίο πριν από παραγωγική χρήση. Η πολυγλωσσική δυνατότητα δεν αποτελεί μέτρηση για εναλλαγές ελληνικών και αγγλικών μέσα στην ίδια συζήτηση.

Για υπότιτλους, η πιστότητα των λέξεων είναι μόνο μέρος της ποιότητας. Χρειάζεται να παραμένουν σωστά τα ονόματα, να μην εξαφανίζονται οι αγγλικές παρεμβολές και να συμπίπτει το κείμενο με τον χρόνο εκφοράς. Για πρακτικά συνάντησης προστίθεται η ανάγκη να ξεχωρίζει ποιος μίλησε, ιδίως όταν οι φωνές επικαλύπτονται. Αυτές οι απαιτήσεις πρέπει να εξετάζονται στο τελικό προϊόν που παραδίδει κάθε λύση, όχι να συναγάγονται από έναν πίνακα αναγνώρισης λέξεων.

Ποια επιλογή ταιριάζει σε κάθε χρήση

Για καθαρή κοινή ελληνική και έτοιμο API, η δημοσιευμένη μέτρηση δίνει λόγο να δοκιμάσετε το Speechmatics Enhanced. Για επεξεργασία στη δική σας υποδομή, το Whisper είναι συγκεκριμένη εναλλακτική, με κόστος σε υπολογιστικούς πόρους και χρόνο που εξαρτάται από το μοντέλο και το μηχάνημα. Καμία από τις δύο αυτές αφετηρίες δεν καθορίζει μόνη της το αποτέλεσμα σε κυπριακά, κρητικά ή άλλη ποικιλία.

Η χρήσιμη σύγκριση βασίζεται σε ίδια αρχεία και ίδιο ζητούμενο κείμενο για κάθε υποψήφια λύση: χωριστά δείγματα κοινής ελληνικής, της διαλέκτου που πράγματι ακούγεται και του δυσκολότερου ηχητικού περιβάλλοντος της εργασίας. Αν ζητείται πιστή απομαγνητοφώνηση, οι τοπικοί τύποι πρέπει να παραμείνουν στην αναφορά· αν ζητείται κείμενο στην κοινή ελληνική, η γλωσσική μετατροπή είναι ξεχωριστή εργασία. Η τελική επιλογή προκύπτει από τα σφάλματα που χρειάζονται ανθρώπινη διόρθωση, την απαιτούμενη καθυστέρηση και τον επιτρεπτό τρόπο εκτέλεσης.

Κοινοποίηση:

Εγγραφείτε στο newsletter μας

Λάβετε τα τελευταία νέα για Web3, AI και κρυπτονομίσματα απευθείας στα εισερχόμενά σας.

0