Transkriptimi në shqip: 6,98% gabime s’krahasohet pa të njëjtin test

|Autori: Ekipi editorial i QUASA|5 min lexim
Transkriptimi në shqip: 6,98% gabime s’krahasohet pa të njëjtin test

Për të kthyer audio shqip në tekst, modeli Whisper i përshtatur nga Flutra dhe shërbimi Harmar janë kandidatë që mund të provohen. Karta e modelit Flutra raporton WER 6,98% në një grup vlerësimi të veçuar. Kjo është matje për atë model dhe atë grup audioje; nuk tregon sa korrigjime do të kërkojë një intervistë apo video e caktuar.

Në provën e Harmar, shërbimi i tij arrin WER 8,8%, kurse Whisper large-v3 arrin 56,0% mbi të njëjtat 60 klipe shqip. Këto rezultate krahasohen brenda asaj prove. Flutra përdor një variant tjetër të Whisper dhe raporton një vlerësim tjetër, ndaj 6,98% dhe 8,8% nuk krijojnë renditje mes dy mjeteve. Për të zgjedhur mjetin për regjistrimet tuaja, kandidatët duhet të marrin të njëjtën audio dhe të maten kundrejt të njëjtit transkript reference.

Tri rezultate, dy prova të ndryshme

Fushat më të dobishme për t’i lexuar shifrat së bashku janë sistemi, varianti i modelit, numri i klipeve, grupi i provës dhe WER-i. Aty ku një fushë nuk jepet, mungesa e saj kufizon riprodhimin e matjes; nuk duhet plotësuar me hamendësim.

  • Flutra: Whisper Large v3 Turbo i përshtatur për shqipen, versioni v2; numri i klipeve të vlerësimit nuk jepet; grup vlerësimi i veçuar; WER 6,98%. Karta identifikon Common Voice 19 si burim të audios së trajnimit, por nuk jep identifikuesit e klipeve të vlerësimit.
  • Harmar: shërbimi i vet, pa variant Whisper; 60 klipe shqip që botuesi i përshkruan si FLEURS; WER 8,8%.
  • Baza e krahasimit në provën e Harmar: Whisper large-v3, jo varianti Turbo i përshtatur nga Flutra; të njëjtat 60 klipe shqip; WER 56,0%.

Dy rreshtat e fundit kanë të përbashkëta audiot dhe, sipas metodës së publikuar, rregullat e përpunimit të tekstit para llogaritjes. Rreshti i parë ndryshon si nga modeli i krahasuar, ashtu edhe nga grupi i vlerësimit. Për këtë arsye, rezultati i dobët i Whisper large-v3 në provën e Harmar nuk mund t’i vishet modelit Turbo të përshtatur nga Flutra. Po ashtu, shifra më e ulët e Flutra nuk provon se ai do ta kalonte Harmar mbi klipet e tij.

Ka edhe një paqartësi për prejardhjen e audios në provën e Harmar: lista publike e gjuhëve të FLEURS nuk përfshin shqipen. Pa identifikuesit e klipeve ose një shpjegim të botuesit për atë nëngrup, një palë tjetër nuk mund ta gjejë me siguri të njëjtën audio shqip për ta përsëritur provën.

Çfarë mat WER-i dhe çfarë lë jashtë

Shpjegimi i WER-it nga Hugging Face e llogarit normën e gabimit duke mbledhur fjalët e zëvendësuara, të shtuara dhe të hequra, pastaj duke e pjesëtuar shumën me numrin e fjalëve në transkriptin e saktë të referencës. Sa më e ulët vlera, aq më pak gabime numërohen sipas kësaj metrike. Edhe një ndryshim i vogël drejtshkrimor mund të numërohet si zëvendësim i një fjale të plotë.

WER-i nuk tregon vetë sa kohë do të marrë redaktimi. Në një intervistë, një emër personi ose vendi mund të kërkojë verifikim edhe kur fjalia lexohet lehtë. Në një leksion, heqja e një mohimi mund të ndryshojë kuptimin më shumë se disa gabime drejtshkrimore. Këto janë arsye për të ruajtur, krahas përqindjes, edhe shembujt e gabimeve që ndikojnë te përdorimi i transkriptit.

Edhe forma e tekstit ndikon te rezultati. Një numër i shkruar me shifra në dalje dhe me fjalë në referencë mund të krijojë gabim gjatë krahasimit mekanik. Harmar thotë se, në provën e vet, i ktheu të dy transkriptet në shkronja të vogla, hoqi pikësimin dhe njësoi shkrimin e numrave para vlerësimit. Ky rregull është pjesë e rezultatit të raportuar: një provë tjetër duhet ta përcaktojë normalizimin përpara llogaritjes dhe ta zbatojë njësoj për çdo kandidat.

Si të ndërtohet një provë që i përgjigjet përdorimit tuaj

Një grup prove i dobishëm duhet t’i ngjajë audios që do të transkriptohet më pas. Për Shqipërinë dhe Kosovën, ai mund të përfshijë shqipe standarde të lexuar qartë, të folur spontan nga Shqipëria dhe nga Kosova, si edhe regjistrime me zhurmën ose ndërprerjet që hasen në punën tuaj. Kjo është një mënyrë e propozuar për të zgjedhur mjetin, jo matje e re e Flutra apo Harmar.

Mos i shkrini të gjitha kushtet në një përqindje të vetme që në fillim. Një klip i lexuar nga një folës, një bisedë me ndërprerje dhe një video me muzikë në sfond i kërkojnë sistemit gjëra të ndryshme. Shënimi i llojit të audios për çdo klip lejon të shihet nëse një kandidat ecën mirë vetëm në regjistrimet e qarta. Kjo ka më shumë vlerë për zgjedhjen sesa një mesatare që fsheh pikërisht llojin e audios që përdorni më shpesh.

  1. Përgatitni një transkript reference për çdo klip duke dëgjuar regjistrimin. Ruani skedarin origjinal, një identifikues të qëndrueshëm dhe shënimin nëse përmban lexim, të folur spontan, zhurmë, emra të përveçëm ose më shumë se një folës.
  2. Dërgoni të njëjtin skedar te secili kandidat. Regjistroni emrin e saktë të shërbimit ose modelit, variantin, versionin kur jepet dhe cilësimet e gjuhës. Sigurohuni që detyra e zgjedhur është transkriptim në shqip, jo përkthim, dhe ruani daljen para çdo korrigjimi.
  3. Përcaktoni më parë si do të trajtohen shkronjat e mëdha, pikësimi, numrat dhe ndarja e fjalëve. Zbatoni të njëjtat rregulla mbi referencën dhe mbi çdo dalje, pastaj numëroni zëvendësimet, shtesat dhe heqjet kundrejt fjalëve të referencës.
  4. Raportoni WER-in veçmas për secilin lloj audioje. Për një rezultat të përgjithshëm, mblidhni gabimet e të gjitha klipeve dhe pjesëtojini me numrin e përgjithshëm të fjalëve të referencës; ruani veçmas gabimet te emrat, mohimet dhe termat që kërkojnë korrigjim.

Nëse puna juaj përbëhet kryesisht nga intervista, pesha vendimtare i takon rezultatit dhe kohës së korrigjimit për intervistat, jo rezultatit në lexim të qartë. Prova e njëjtë për të gjithë kandidatët tregon cilin mjet ia vlen të përdorni për atë audio konkrete; përqindjet e publikuara shërbejnë për të zgjedhur kandidatët që do të hynë në provë.

Ndaj:

Abonohuni në buletinin tonë

Merrni lajmet më të fundit për Web3, AI dhe kripto direkt në kutinë tuaj postare.

0