
Eesti kõnetuvastus: üldine Whisper eksis laste kõnes üle 35%

Tartu Ülikooli teadlaste 2023. aasta Eesti laste kõne katses oli kohandamata Whisper-large-v2 sõnaviga 36,01% ehk üle 35%, ent esmalt eesti ja seejärel laste kõnega kohandatud variandil 16,02% ehk ligikaudu 16%. Kui süsteem peab transkribeerima laste kõnet, on kohandatud mudel seetõttu põhjendatud kandidaat. Täiskasvanute dikteerimise või koosoleku jaoks tuleb valik teha nende salvestuste põhjal.
Mudeli nimi, suurus ja eesti keele tugi ei ütle üksi, milline transkriptsioon kasutaja helist sünnib. Avaldatud katsed annavad lähtekoha, kuid laste salvestusi ning FLEURS-i ja Common Voice'i testosi ei saa panna ühte täpsuse edetabelisse. Otsustav küsimus on, kui hästi hindamiseks kasutatud kõne sarnaneb kavandatud kasutusega.
Mida laste kõne katses võrreldi?
Laste korpuses oli nii ette loetud muinasjutte ja luuletusi kui ka vastuseid küsimustele, piltide kirjeldusi ning vaba juttu. See vaheldus on oluline: ettelugemisel on sõnad ette antud, spontaanses vastuses peab tuvastaja toime tulema ka kõhkluste ja ootamatu sõnastusega. Treeningu, mudeli arendamise ja lõpliku testi osades ei kattunud kõnelejad ega tekstid, mis vähendas ohtu mõõta tuttavate näidete äratundmist.
Katse hõlmas kohandamata Whisperit, ainult laste kõnega edasi treenitud variante, eestikeelse täiskasvanute kõnega kohandatud variante ning mudeleid, mida treeniti järjest mõlemat liiki kõnega. Laste kõnega treenimine parandas tulemust; eestikeelne lähteõpe koos sellele järgnenud laste kõnega andis uuritud suure Whisperi variandi puhul veel parema tulemuse. See eristab keele kohandamise mõju sihtrühma kõne kohandamisest.
Ka väiksema mudeli nimi ei tähendanud automaatselt kehvemat tulemust: varem rohke eestikeelse kõnega treenitud Whisper-medium oli laste katses tugev konkurent suuremale mudelile. Seetõttu tasub mudeli suuruse kõrval uurida, millisel kõnel konkreetne versioon on õppinud. Kooli ettelugemise, lapse vabavastuse ja täiskasvanu diktaadi helipilt ning sõnavara võivad erineda isegi siis, kui kõik kõnelejad räägivad eesti keelt.
Mida näitab teine, eestikeelne test?
Ükskeelse, Whisper-large-v3 põhjal kohandatud mudeli BuzzASR-i mudelikaardis on FLEURS-i sõnaviga 13,87%, Common Voice 25 sõnaviga 0,52% ja ühendatud testi sõnaviga 5,55%; ühendatud testi märgiviga 1,4% on kohandamata Whisper-large-v3 näitajast 6,19% ligikaudu 4,4 korda väiksem. Need on mudelikaardi normaliseeritud mõõdikud, mitte laste kõne katse tulemused.
Sama mudeli kahe testiosa sõnavea vahe näitab, kui palju võib tulemus sõltuda salvestuste valikust. Ühendatud näit võtab need osad kokku, kuid ei kirjelda eraldi koosolekut, erialast dikteerimist ega laste spontaanset kõnet. Eestikeelse töövoo jaoks on BuzzASR seega mõistlik võrdluskandidaat; avaldatud koondprotsent ei ennusta selle vigu igas uues olukorras.
Mudelikaardi paranemisväide puudutab märgiviga võrreldes kohandamata suurema Whisperi teise versiooniga. Laste katses kasutati teisi Whisperi versioone ja teisi helisid ning põhimeetrik oli sõnaviga. Erinevust ei saa tõlgendada nii, nagu oleks BuzzASR laste salvestustel juba kohandatud laste mudelit edestanud.
Mida WER ja CER tegelikult mõõdavad?
Hugging Face'i kõnetuvastuse mõõdikute selgituse järgi loendab WER asendatud, ära jäänud ja juurde tulnud sõnu etalonteksti sõnade suhtes; CER teeb samalaadse võrdluse märkide tasandil. Väiksem veamäär tähendab, et tuvastatud tekst on valitud hindamisreeglite järgi etalonile lähemal. See ei ole tõenäosus, et terve lause on veatu, ega hinda iseseisvalt lause tähendust.
Eesti keeles võib eksimus ühes käändelõpus anda WER-is terve vale sõna, kuigi CER-is erinevad vaid mõned märgid. Väike märgierinevus võib siiski muuta, kellest või millest lauses räägitakse. Samuti võib eituse, nime või arvu kadumine olla kasutuses palju tõsisem kui mitu ebaolulist kirjaviga. Seepärast on veamäära kõrval vaja teada, millised sõnad valesti läksid.
Etalontekst ja selle puhastus muudavad protsenti. Laste katses teisendati tekst väiketähtedeks ja eemaldati kirjavahemärgid, ent erinevaid kirjapilte ei ühtlustatud. Etalon püüdis edasi anda laste tegelikku hääldust, sealhulgas eksimusi; ebaselge häälduse korral võib ka inimese transkriptsioon olla vaieldav. Madal WER pärast kirjavahemärkide eemaldamist ei ütle veel, kas valmis protokoll või subtiiter on ilma toimetamiseta loetav.
Kuidas teha mudelivalik?
OpenAI kõnetuvastuse dokumentatsiooni järgi toetab Whisper 98 keelt, kuid täpsus erineb keeliti. Keeletugi on seega kandidaatide leidmise tingimus, mitte eestikeelse kvaliteedi mõõtmine. API mudelit whisper-1 tuleb samuti eristada avalikes katsetes nimetatud avatud Whisperi variantidest: ühe versiooni mõõtmist ei saa teisele üle kanda.
- Kui kõne on mitmekeelne, sobib üldine Whisper lähtevariandiks. Selle eestikeelne WER tuleb mõõta kavandatud salvestustes, sest laste katse tulemust ei saa kasutada koosoleku või diktaadi prognoosina.
- Kui põhitöö on eestikeelne täiskasvanu kõne, lisa võrdlusse eestikeelsele kõnele kohandatud mudel, näiteks BuzzASR. Hoia dikteerimise ja koosoleku helid hindamises lahus: eri kõnelejad, katkestused ning kattuv kõne võivad anda erineva vigade jaotuse.
- Kui kõnelejad on lapsed, lisa laste kõnega edasi treenitud variant ja testi seda laste endi salvestustel. Ettelugemine ning vabad vastused väärivad eraldi tulemusi; hindamise kõnelejad ja tekstid peavad jääma treeningandmetest välja.
Võrreldavaks valikuks vajavad kandidaadid sama eraldi hoitud heli, sama etalonteksti ning samu tekstipuhastuse ja veaarvutuse reegleid. Kui transkriptsiooni kasutatakse näiteks lapse vastuse hindamiseks või koosoleku otsuste talletamiseks, vaata koguprotsendi kõrval üle just need laused, kus nimed, eitused või sisuliselt määravad sõnad võivad muuta tähendust.
Loe ka:
Seotud artiklid


Zoom AI Companion või Otter: kokkuvõte sõltub koosolekuplatvormist

AI-koosolekumärkmed Eestis: ekraanihoiatusest üksi ei piisa

DeepL või Google Translate eesti keeles: mõõdikud ei anna üht võitjat

Gemini Live Avatar jõudis EL-i, kuid oma nägu vajab eriluba

NVIDIA pani AI-agentidele riistvaralise valvekoera — karantiin võtab millisekundeid
Telli meie uudiskiri
Saa värskeimad Web3, AI ja krüptouudised otse oma postkasti.