Whisper eða Google fyrir íslenskt tal: stuðningur tryggir ekki nákvæmni

|Höfundur: Ritstjórn QUASA|6 mín. lestur
Whisper eða Google fyrir íslenskt tal: stuðningur tryggir ekki nákvæmni

Bæði Whisper og Google bjóða leið til að umrita íslenskt tal, en skráður tungumálastuðningur segir ekki hvort kerfið skilar nákvæmum texta úr upptökum fyrirtækis. Tungumálaskrá Google Cloud Speech-to-Text tilgreinir íslensku sem is-IS fyrir chirp og chirp_2, meðal annars á staðsetningunni europe-west4. Það staðfestir hvaða líkön má velja þar, ekki hvernig þau standa sig í íslenskum fundi eða símtali.

Whisper er einnig raunhæfur kostur, en opinberu gögnin skera ekki úr um hvort það sé nákvæmara en Google á íslensku. Í rannsóknargrein OpenAI um Whisper eru 16 klukkustundir af íslensku talgreiningarefni og 84 klukkustundir af íslensku tali með enskri þýðingu skráðar í þjálfunargögnum; orðvilluhlutfall large-v2 fyrir íslensku í Fleurs-prófinu er 38,2%. Þjálfunarmagnið og niðurstaða á einu prófunarsafni segja ekki fyrir um árangur á eigin upptökum.

Hvað felst í valinu á milli kerfanna?

Google Cloud Speech-to-Text er skýjaþjónusta þar sem tungumál, líkan og staðsetning eru hluti af uppsetningunni. Whisper er líkan sem má keyra í eigin umhverfi; opinber kóðaútgáfa Whisper lýsir uppsetningu, fjöltyngdum líkönum og ólíkum kröfum þeirra til vinnsluminnis. Ef Whisper er fengið í gegnum aðra þjónustu verða rekstur og meðferð upptaka jafnframt háð þeirri þjónustu.

Heitin tvö ein og sér lýsa því ekki sem fyrirtæki er að kaupa eða reka. Til að bera niðurstöður saman þarf að skrá nákvæmt Chirp-líkan, staðsetningu og stillingar Google, ásamt Whisper-líkani, keyrsluumhverfi og allri eftirvinnslu. Sjálfvirk tungumálagreining, skipting langra upptaka og leiðrétting texta geta breytt því sem birtist að lokum. Samanburðurinn á því að ná yfir þær vinnsluleiðir sem raunverulega verða notaðar.

Af hverju ræður USM-samanburður ekki úrslitum?

Í USM-samanburði Google Research mældist að meðaltali 32,7% lægra orðvilluhlutfall fyrir USM en Whisper large-v2 á þeim 18 tungumálum þar sem Whisper náði undir 40% orðvilluhlutfalli. Þetta er niðurstaða fyrir tiltekið líkan, val tungumála og prófunargögn. Hún er ekki mæling á íslensku í þeirri Chirp-uppsetningu sem fyrirtæki velur í Cloud Speech-to-Text.

Meðaltal yfir tungumál getur heldur ekki sagt til um nöfn, tölur eða tal sem skarast í íslenskum fundi. Upplestur úr prófunarsafni og símtal með misjöfnum hljóðgæðum leggja ólíkt álag á talgreiningu. Opinber viðmið hjálpa við að afmarka möguleika, en þau koma ekki í stað samanburðar á því hljóði sem þjónustan á að vinna.

Hvað sýnir óháður samanburður?

Í rannsókn á spænskum svörum í vefkönnun fengust umritanir fyrir 74,0% svara með prófaðri Google-uppsetningu og 99,8% með Whisper; við mat á þeim textum sem fengust voru eitt eða fleiri sýnilega viðbætt orð eða endurtekningar skráð í 6,6% Google-svara og 28,5% Whisper-svara. Rannsakendur höfðu ekki aðgang að frumhljóðinu og gátu því ekki mælt nákvæmt orðvilluhlutfall gagnvart því sem fólk sagði. Niðurstöðurnar eiga við spænsk könnunarsvör og þær uppsetningar sem voru prófaðar.

Munurinn sýnir hvers vegna tvær spurningar þurfa að fá sitt hvort svarið: Skilar kerfið yfirleitt texta, og hversu réttur er sá texti? Kerfi sem skilar oft niðurstöðu getur jafnframt sett óviðeigandi orð inn í hana. Í fyrirtækjaprófi þarf því að telja tómar eða ónothæfar niðurstöður sérstaklega og bera þá texta sem fást saman við hlustaða upptöku.

Lítið próf á fundum, símtölum og upplestri

Veljið úrtak sem líkist fyrirhugaðri notkun. Ef fyrirtækið ætlar að umrita fundi, símtöl og upplestur á hver flokkur að fá sérstaka niðurstöðu, því gott meðaltal getur falið slakan árangur í einum þeirra. Til dæmis mætti byrja á tíu upptökum úr hverjum flokki, með leyfi til að nota þær í prófinu. Úrtakið þarf að innihalda ólíkar raddir og hljóðaðstæður, ekki eingöngu skýrustu upptökurnar.

  1. Veljið skrár áður en niðurstöður kerfanna sjást. Takið með dæmi þar sem mannanöfn, staðarnöfn, fagorð og tölur skipta máli, ásamt hljóði þar sem fólk talar hratt eða hvert ofan í annað.
  2. Látið hlustendur útbúa viðmiðunartexta úr hljóðinu. Ákveðið fyrirfram hvernig hikorð, brotin orð, óskýrir kaflar og tal sem skarast eru skráð. Beitið sömu reglum á allar upptökur.
  3. Sendið sömu hljóðskrár í báðar vinnsluleiðir. Skráið líkansútgáfu, tungumálsstillingu, hljóðsnið, skiptingu skráa og alla eftirvinnslu. Breytið ekki stillingum eftir að niðurstöður prófsins liggja fyrir.
  4. Reiknið niðurstöður fyrir hvern upptökuflokk og varðveitið villudæmi með viðeigandi hljóðbútum. Ef stilling er síðar löguð að tilteknum skrám, metið hana aftur á öðrum skrám sem réðu ekki þeirri breytingu.

Viðmiðunartextinn þarf sjálfur að vera áreiðanlegur. Ef hlustendur greina ekki sama orð í óskýrum kafla er réttara að merkja óvissuna en að láta eina ágiskun teljast óumdeilanlegur sannleikur. Einnig þarf að ákveða samræmda ritun nafna og talna áður en vélrænu textarnir eru bornir saman.

Mælið villur og áhrif þeirra aðskilið

Orðvilluhlutfall er fjöldi orða sem vantar, er skipt út eða bætast við, deilt með orðafjölda viðmiðunartextans. Samræmið fyrst hástafi, greinarmerki og talnaritun eftir föstum reglum. Annars getur sami talniðurstaða talist rétt í einni umritun en villa í annarri vegna þess eins hvernig hún er skrifuð.

Þessi mælikvarði segir þó ekki allur til um notagildi textans. Rangt mannsnafn getur torveldað leit í fundargerð þótt aðeins eitt orð sé rangt. Rangt símanúmer eða fjárhæð getur haft meiri afleiðingar en nokkur röng smáorð. Skráið því rétt skráð nöfn og tölur sérstaklega, ásamt heilum setningum sem vantar og efni sem birtist þar sem ekkert viðeigandi tal heyrist.

Setjið niðurstöðurnar fram fyrir fundi, símtöl og upplestur hver í sínu lagi: orðvilluhlutfall, villur í nöfnum og tölum og hlutfall skráa án nothæfrar niðurstöðu. Þannig sést hvort munur á heildartölu stafar af dreifðum smávillum eða fáum alvarlegum tilvikum. Kerfið sem hentar til leitar í fundum þarf ekki að vera best til nákvæmrar skráningar talna úr símtölum.

Kostnaður og meðferð upptaka

Berið kostnað saman fyrir sama magn innsendra hljóðklukkustunda og sömu gæðakröfur. Í skýjaþjónustu þarf að telja þjónustugjöld, undirbúning skráa, geymslu og mannlega yfirferð. Eigin keyrsla Whisper bætir við vélbúnaði, uppsetningu, viðhaldi og umsjón. Ódýrari sjálfvirk umritun getur orðið dýrari vinnsluleið ef yfirferð og leiðréttingar taka lengri tíma.

Persónuvernd þarf sjálfstætt mat samhliða nákvæmni og verði. Skráið hvar frumupptökur og texti fara í vinnslu, hver hefur aðgang, hversu lengi gögnin eru varðveitt og hvernig þeim er eytt. Staðsetning á tungumálalista Google leysir ekki ein og sér úr öllum spurningum um gagnaflæði eða samningsskilmála; eigin keyrsla Whisper krefst sömuleiðis öruggrar geymslu og aðgangsstýringar. Valið ræðst af því hvaða uppsetning uppfyllir þessar kröfur og skilar nægilega góðum texta í þeim upptökuflokkum sem fyrirtækið notar.

Lestu einnig:

Deila:

Gerstu áskrifandi að fréttabréfinu okkar

Fáðu nýjustu fréttir af Web3, gervigreind og rafmyntum beint í pósthólfið.

0