
Microsofti otsetranskriptsioon teeb 2,5% vigu, kuid maksab rivaalist rohkem

Microsofti 1. oktoobri 2026 teate järgi on MAI-Transcribe-2-Streaming Microsoft Foundry kaudu kättesaadav 60 keeles, väljastab esialgse teksti veidi enam kui 100 millisekundit pärast heli saabumist ning maksab 2026. aasta lõpuni 0,54 dollarit helitunni eest. Microsofti Realtime API juhend nimetab teenust avalikuks eelvaateks ja loetleb eesti keele toetatud keelte seas.
2. oktoobril avaldatud BitShoveli võrdluse järgi oli Artificial Analysise voogedastustestis Microsofti mudeli lõpliku transkriptsiooni sõnavigade määr 2,5% ja kõne lõpu järgne viivitus 0,13 sekundit; Grok Voice Transcribe 2.0 voogrežiimil olid need näitajad 2,7% ja 0,49 sekundit ning hinnad vastavalt 9 ja 3,33 dollarit 1000 heliminuti kohta. Eesti arendaja jaoks tähendab see mõõdetud täpsuseelist kõrgema mahuarvega, kuid avaldatud koondtulemus ei näita eraldi eestikeelse kõne täpsust.
Mida 2,5% sõnavigade määr näitab
Sõnavigade määr ehk WER võrdleb mudeli väljastatud teksti kontrollitud üleskirjutusega. Arvesse lähevad asendatud, puuduvad ja juurde lisatud sõnad; vigade koguarv jagatakse kontrollteksti sõnade arvuga. Seepärast ei tähenda testi 2,5%, et igas vestluses oleks just selline osa sõnu vale. Mõni kõnelõik võib olla hõlpsam, teine mürarikkam või sisaldada nimesid, mida mudel harva kohtab.
Voogedastuse koondtest sisaldab ligikaudu kaheksa tundi heli. Pool tulemusest pärineb häälassistentide kasutusele suunatud AA-AgentTalki andmestikust, veerand Euroopa Parlamendi kõnega VoxPopulist ja veerand ettevõtete tulemuskõnesid sisaldavast Earnings22st. Kaalumine on oluline: ühe andmestiku hea tulemus võib koondnäitajat rohkem mõjutada kui teise oma. Samuti kirjeldab WER sõnade vastavust kontrolltekstile, mitte üksinda seda, kas kuulaja mõistis lause tähendust õigesti.
Microsofti väiksem veamäär kehtib just selles katses võrreldud voogmudelite ja lõpliku teksti kohta. Kõne ajal ilmuv esialgne tekst on eraldi väljund: lisanduv kontekst võib varasemat sõna muuta, enne kui kõnelõik kinnitatakse. Reaalajas subtiitrite puhul on see nähtav vahe esimesena kuvatud sõna ja püsima jääva teksti vahel. Avaldatud koondtabelist ei saa tuletada eestikeelse koosoleku või eesti ja inglise keele vahel vahelduva vestluse WERi.
0,13 sekundit algab tuvastatud kõnelõpust
Viivituse mõõtmine algab siis, kui testis kasutatud kõnetuvastus tuvastab kõne lõpu, ja lõpeb kinnitatud transkriptsiooni saabumisega. See on ühe kõnelõigu lõppteksti ooteaeg. Näitaja ei hõlma aega kõne esimesest sõnast selle lõpetamiseni ega ütle, millal ilmus ekraanile esimene esialgne sõna. Need mõõdud vastavad eri küsimustele, kuigi kõik mõjutavad seda, kui kiire teenus kasutajale tundub.
Microsofti mudel saadab kõne kestel muudetavaid tekstihüpoteese ning kinnitab seejärel lõpliku lõigu. Nii võib subtiiter juba nähtav olla, kui lõpliku teksti viivituse mõõtmine pole veel alanud. Rakendus võib esialgset teksti kohe näidata või oodata kinnitatud tulemust; sellest valikust sõltub, kas kasutaja näeb kiiret, ent muutuvat teksti või peab kauem ootama. Võrdlustesti viivitus kirjeldab ainult mõõdetud kinnitamist, mitte kõiki neid kuvamisotsuseid.
Häälassistendi vastus nõuab lisaks transkriptsioonile kasutaja kavatsuse mõistmist, vastuse koostamist ja sageli ka kõnesünteesi. Iga etapp lisab ooteaega ning rakendus peab otsustama, millal kasutaja on rääkimise lõpetanud. Seega on lühike kõnelõpujärgne viivitus kasulik ühe etapi tulemus, kuid sellest üksi ei saa arvutada, kui kiiresti inimene valmis vastust kuuleb.
Hinnavahe 100 ja 1000 helitunni juures
Kui arvestada võrdlustabeli minutihindu, maksaks 100 helitunni ehk 6000 minuti transkribeerimine Microsofti mudeliga 54 dollarit. Groki voogrežiimi arvestuslik kulu oleks ligikaudu 19,98 dollarit. Vahe oleks umbes 34,02 dollarit sama helimahu eest. Tegemist on tingliku mahuarvutusega: see hõlmab kõne tekstiks muutmist, mitte näiteks häälassistendi vastuse koostamist või kõnesünteesi.
1000 helitunni ehk 60 000 minuti puhul oleksid vastavad kulud 540 ja ligikaudu 199,80 dollarit ning hinnavahe umbes 340,20 dollarit. Groki summa on arvutatud võrdlustabeli ümardatud hinnast 1000 minuti kohta, nii et tegelik arve võib sentide võrra erineda. Suurema mahu juures kasvab absoluutne hinnavahe ka siis, kui mudelite mõõdetud sõnavigade määra erinevus jääb samaks.
Microsofti tariif on sissejuhatav ja kehtib aasta lõpuni. Sellest hilisema mahu puhul ei saa sama tunnitasu kindla pikaajalise kuluna käsitada. Hinnavõrdluses on ühtlasi oluline hoida lahus voogedastus ja valmis helifaili hilisem töötlemine: neil võivad olla erinevad tariifid ning teistsugune ajakulu. Siinne arvutus puudutab reaalajas saadetud heli.
Eesti keele tugi ja avaliku eelvaate piir
Eesti keel on voogmudeli juhendi keelte loetelus, kuid avaldatud võrdlustabel ei anna sellele keelele oma täpsusnäitajat. Loetellu kuulumine ütleb, et keelt saab mudelile ette anda või lasta automaatselt tuvastada; see ei ütle, kui hästi õnnestub näiteks eestikeelsete nimede, aktsentide või keelevahetusega kõne üleskirjutamine. Just see erinevus piirab koondtesti esikoha tähendust Eesti rakenduse jaoks.
Avalik eelvaade tähendab ka teenuse kasutamisel teistsugust kindlust kui väljakujunenud tootmisteenuse puhul: juhend ei anna sellele teenustaseme lepet ega soovita seda tootmiskoormuseks. Arendajale on seega praegu teada voogmudeli ligipääs, keelte loetelu, sissejuhatav hind ja võrdlustesti tulemus. Eestikeelse kasutuse kulude ja kvaliteedi suhe selgub alles siis, kui lisandub eraldi eestikeelse kõne mõõtmine; pärast sissejuhatava hinnaperioodi lõppu sõltub sama arvutus ka uuest tariifist.
Loe ka:
Seotud artiklid


Zoom AI Companion või Otter: kokkuvõte sõltub koosolekuplatvormist

DeepL või Google Translate eesti keeles: mõõdikud ei anna üht võitjat

AI-koosolekumärkmed Eestis: ekraanihoiatusest üksi ei piisa

Google Drive või OneDrive: kiirus ei pruugi valikut üldse otsustada

AI-teksti detektor: 1% valehäirete juures langes tabamus nulli
Telli meie uudiskiri
Saa värskeimad Web3, AI ja krüptouudised otse oma postkasti.