Whisper ili Deepgram za hrvatski: brzina gubi kad pogriješi svako šesto ime

|Autor: Urednički tim QUASA|5 min čitanja
Whisper ili Deepgram za hrvatski: brzina gubi kad pogriješi svako šesto ime

Za završeni prijepis hrvatskog podcasta prednost ima lokalno pokrenuti Whisper-large-v3, dok je Deepgramov streaming smisleniji kad riječi trebaju stizati tijekom razgovora. U lokalnom testu prvih pet minuta triju hrvatskih podcasta Whisper-large-v3 bilježi WER od 1,85 %, 5,28 % i 12,48 %, a Deepgram Nova-2 od 4,2 %, 8,7 % i 17,3 %; posljednji rezultat znači približno jednu pogrešku na šest referentnih riječi, ali ne dokazuje da je pogrešno svako šesto ime.

Ta je razlika bitna redakciji koja mora ispraviti ime gosta prije objave, ali pozivnom centru tekst može trebati prije završetka poziva. Izbor stoga ovisi o tome je li važniji gotov prijepis ili rani djelomični tekst, a zatim o cijeni i mjestu obrade. Podcastni rezultat ne opisuje automatski kvalitetu telefonskog zvuka niti cijenu izvedbe u vlastitoj infrastrukturi.

Što hrvatski uzorak govori o točnosti

Uspoređeni su isječci podcasta Superhuman Life, Lider Lab i Netokracija s ručno provjerenim prijepisima. Oba su sustava imala najmanje pogrešaka na čistom govoru, a najviše na razgovoru s engleskim izrazima i imenima. To je koristan lokalni signal, ali riječ je o kratkim isječcima koje je odabrao sam pružatelj usluge titlova, bez objavljenih pojedinačnih izlaznih prijepisa ili intervala pouzdanosti.

WER je omjer zamjena, izostavljanja i umetanja prema broju riječi u referentnom tekstu. Na Netokracijinu isječku viši WER prati razgovor s engleskim izrazima i imenima, no metrika ne otkriva koliko je upravo imena pogrešno. Čak i kada je većina rečenice čitljiva, pogrešno napisano prezime gosta ili naziv tvrtke ostaje vidljivo u titlu i može otežati pretraživanje arhive.

Ispitana izvedba uključuje naknadnu obradu Whisperova izlaza vlastitim rječnikom imena i pojmova. Zato rezultat treba pripisati ispitanoj konfiguraciji, a prednost nad Deepgramom ne proglašavati univerzalnim svojstvom samog modela. Ako bi se isti zvuk provukao kroz drugi način segmentacije, drugi rječnik ili noviju verziju konkurentskog modela, to bi bila nova usporedba.

Brzina ovisi o zadatku i verziji modela

Deepgram može slati djelomični prijepis dok govor još traje, što je stvarna prednost za titlove uživo i pomoć agentu tijekom poziva. Za unaprijed snimljenu epizodu korisnija je druga mjera: vrijeme do konačnog prijepisa koji se može urediti. Rana pojava prve riječi i završetak obrade cijele snimke ne mjere istu vrstu kašnjenja.

Važna je i promjena u ponudi modela. Deepgramov aktualni popis modela i jezika navodi hrvatski za Nova-3, ali ga ne navodi za standardni Nova-2; opcija višejezičnog prepoznavanja unutar Nova-3 također ne uključuje hrvatski među jezicima navedenima za miješani govor. Lokalna usporedba označena kao Nova-2 zato nije jednostavan recept za današnju implementaciju: prije narudžbe treba potvrditi dostupnu kombinaciju modela, jezika i načina prijenosa zvuka.

Za hrvatski razgovor prošaran engleskim izrazima ta je razlika posebno važna. Podrška za hrvatski uz postavljen jezični kod ne znači nužno da isti model automatski prepoznaje stalno prebacivanje između hrvatskog i engleskog. Urednički ili razvojni tim koji treba upravo takav govor mora usporediti stvarni izlaz podržane konfiguracije, a ne osloniti se na oznaku „multilingual” u cjeniku.

Minutna cijena i trošak lokalnog pokretanja

OpenAI-jeva cijena za whisper-1 iznosi 0,006 USD po minuti transkripcije, a model podržava višejezično prepoznavanje govora. Ta API cijena nije cijena Whisper-large-v3 pokrenutog na vlastitom računalu u hrvatskom testu. Lokalni rad traži računalni kapacitet, pohranu, nadzor i održavanje; kod malog ili promjenjivog opsega fiksni trošak može biti važniji od cijene po minuti.

Deepgramov javni cjenik navodi 0,0043 USD po minuti za snimke na tarifi prema potrošnji uz Nova-3 Monolingual te oglašava poseban EU endpoint za obradu unutar Unije. Taj iznos nije cijena konfiguracije označene kao Nova-2 u lokalnom testu; za prijenos uživo vrijedi drugi redak cjenika. Dodatne funkcije i komercijalni uvjeti mogu promijeniti ukupan račun.

Trošak odluke uključuje i uređivanje izlaza. Uvjetno, ako je minuta prijepisa nešto jeftinija, ali zahtijeva više ručnog popravljanja imena, ušteda na API-ju može nestati prije objave titlova. Za kontaktni centar isti se račun mijenja jer zakašnjeli tekst može izgubiti vrijednost tijekom aktivnog poziva. Zbog toga cijenu po minuti treba računati zajedno s vremenom ljudi i korisnošću trenutka u kojem tekst stiže.

Gdje se obrađuju snimke i prijepisi

Samostalno pokretanje Whispera dopušta timu da zvuk i prijepis zadrži u infrastrukturi koju sam odabere. To olakšava kontrolu mjesta obrade, ali podrazumijeva vlastitu zaštitu pristupa, pohrane i brisanja. API uklanja dio operativnog tereta, uz ugovor i postavke koji određuju kretanje podataka.

Ponuđena EU regija konkretna je opcija za organizaciju kojoj je mjesto obrade važno. Ipak, oznaka spremnosti za GDPR ne zamjenjuje provjeru ugovornih uloga, rokova čuvanja i podataka koje aplikacija stvarno šalje. Kod snimljenih poziva dodatno je važno razlikovati lokaciju samog zvuka od lokacije metapodataka, zapisnika i kopija koje stvara vlastita aplikacija.

Kako usporediti sustave na stvarnom hrvatskom zvuku

Neovisni repozitorij za mjerenje WER-a koristi iste audiodatoteke za različite sustave, objavljuje izlazne prijepise i računa intervale pouzdanosti te upareni bootstrap. Njegovi skupovi obuhvaćaju čitani govor, financijske pozive i sastanke, pa ne predstavljaju ljestvicu točnosti za hrvatski podcast. Koristan je njegov postupak: isti ulaz, isti referentni tekst i jasno imenovana konfiguracija svakog kandidata.

Za redakciju referentni uzorak treba obuhvatiti prezimena, nazive tvrtki i prijelaze na engleski; za kontaktni centar stvarnu kvalitetu telefonskog zvuka, prekide i govor više sudionika. Uz ukupni WER vrijedi zasebno brojiti ispravno zapisana imena, vrijeme do prvog upotrebljivog teksta i vrijeme do konačnog prijepisa. Tek ta kombinacija pokazuje nadoknađuje li brzina dodatni urednički posao ili je manji broj pogrešaka vredniji od streaminga.

Ako se objavljuju titlovi nakon snimanja, dostupni hrvatski rezultat opravdava prednost Whisper-large-v3 u početnom izboru. Ako tekst treba služiti agentu dok sugovornik još govori, Deepgramovu streaming izvedbu valja ocijeniti na podržanom hrvatskom modelu. U oba slučaja odluka pripada konkretnoj snimci, načinu implementacije i uvjetima obrade podataka, a ne općem poretku sustava na engleskom govoru.

Pročitajte i:

Podijeli:

Pretplatite se na naš newsletter

Primajte najnovije vijesti o Web3-u, AI-ju i kriptovalutama izravno u svoj sandučić.

0