
Whisper czy Scribe po polsku? Na trudnym audio różnica szybko rośnie

Jeśli najważniejsza jest dokładność polskiej transkrypcji, Scribe ma przewagę w dwóch istotnych testach. W polskim badaniu ASR osiągnął 3,29 proc. WER na Common Voice wobec 6,3 proc. dla Whisper Large w konfiguracji badania; w wywiadach medycznych znormalizowany WER wyniósł 10,58 proc. dla Scribe i 42,26 proc. dla badanego toru Whisper z korektą modelem językowym. Wynik kliniczny opisuje tę konkretną konfigurację, a nie każde możliwe wdrożenie Whisper.
Whisper jest lepszym punktem wyjścia, gdy nagranie musi być przetwarzane na własnej infrastrukturze. Scribe ułatwia pracę z rozmowami wielu osób, bo oferuje oznaczanie mówców i znaczniki czasu. Przy wyborze trzeba więc zestawić błędy w nagraniach podobnych do własnych z wymaganiami dotyczącymi danych oraz z kosztem całego procesu, łącznie z poprawianiem transkryptu.
Co mówią wyniki dla polskich nagrań
WER to odsetek błędów słownych względem transkrypcji wzorcowej: obejmuje słowa zastąpione, pominięte i dodane. Niższy WER oznacza mniej takich błędów w ocenianym zbiorze, lecz nie opisuje wprost jakości przypisania wypowiedzi do mówców. Nie pokazuje też, czy pomyłka dotyczy spójnika, nazwiska, dawki leku albo kwoty. W zastosowaniu medycznym lub przy publikowaniu cytatów te błędy mają różne konsekwencje mimo takiego samego udziału w metryce.
Common Voice i wywiady medyczne sprawdzają różne warunki. W badaniu rozmowy lekarzy z pacjentami pochodziły z placówek w Polsce; występowały w nich przerwania, nierówna głośność, nakładanie się głosów i słownictwo specjalistyczne. Różnica między systemami była tam znacznie wyraźniejsza niż na Common Voice. Trzeba jednak pamiętać, że wyniki pochodzą z różnych zbiorów, a dla rozmów klinicznych podano WER po normalizacji tekstu. Nie jest to pomiar stopniowego pogarszania tego samego nagrania.
Badanie zawiera również ważną przeciwwagę: na polskiej części Multilingual LibriSpeech Whisper Large uzyskał niższy WER niż Scribe. Materiał do odsłuchu i sposób mówienia mogą więc zmienić kolejność narzędzi. Z tego powodu przewagi Scribe w rozmowach klinicznych nie należy przenosić automatycznie na dyktowane notatki, audiobooki czy czyste nagrania studyjne. Wybór dla konkretnego zastosowania wymaga próbek odpowiadających jego słownictwu, liczbie rozmówców i jakości dźwięku.
Diarizacja i znaczniki czasu zmieniają zakres pracy
Przy wywiadzie lub rozmowie grupowej sam poprawny tekst nie wystarcza: trzeba jeszcze wiedzieć, kto wypowiedział dane słowa i gdzie znaleźć je w nagraniu. Dokumentacja ElevenLabs wymienia polski wśród języków Scribe v2 oraz opisuje znaczniki czasu na poziomie słów i diarizację do 32 mówców. Odpowiedź może zatem łączyć słowa z czasem ich wypowiedzenia i etykietą rozpoznanego głosu. Przy nakładających się wypowiedziach przypisanie głosu nadal warto odsłuchać.
Własne wdrożenie Whisper można rozbudować o podobne elementy, ale wymaga to dodatkowych narzędzi i oceny całego zestawu. Karta modelu Whisper wskazuje rozpoznawanie i tłumaczenie mowy jako główne zadania; diarizacja nie została w niej solidnie oceniona. Gdy gotowy transkrypt ma rozdzielać uczestników rozmowy, koszt wdrożenia obejmuje zatem nie tylko uruchomienie rozpoznawania słów, lecz także przypisywanie mówców, znaczniki czasu i korektę pomyłek w tych warstwach.
To rozróżnienie jest szczególnie ważne przy wywiadzie medycznym. Poprawnie zapisane zdanie przypisane niewłaściwej osobie może zmienić sens notatki, choć WER pozostanie bez zmian. Z kolei dokładny znacznik czasu skraca drogę do odsłuchania spornego fragmentu. W rozmowie z kilkoma głosami warto więc oceniać tekst, etykiety mówców i możliwość odnalezienia wypowiedzi jako odrębne cechy wyniku.
Co daje lokalne wdrożenie Whisper
Whisper można uruchomić w środowisku kontrolowanym przez organizację, bez przesyłania nagrania do zewnętrznego API. Repozytorium OpenAI udostępnia kod i wagi na licencji MIT; orientacyjne wymagania pamięci GPU sięgają około 1 GB dla najmniejszych wariantów, 6 GB dla turbo i 10 GB dla large. To zakres pozwalający dobrać model do dostępnego sprzętu, ale wynik Whisper Large z badania nie opisuje dokładności mniejszych wariantów.
Lokalne przetwarzanie może ułatwić utrzymanie poufnego audio we własnym środowisku. Nadal trzeba ustalić dostęp do plików, miejsce zapisu transkryptów, kopie zapasowe i czas przechowywania. Przy usłudze Scribe podobne pytania dotyczą warunków przekazania nagrania dostawcy oraz ustawień wybranego konta. Dla dokumentacji medycznej decyzja o wysłaniu pliku wymaga sprawdzenia zasad przetwarzania właściwych dla danej organizacji, zanim zacznie się liczyć oszczędność czasu.
Sprzęt to tylko jedna część lokalnego wdrożenia. Potrzebne są również obsługa plików wejściowych, miejsce na wyniki, aktualizacje środowiska i sposób poprawiania tekstu. Przy wielu nagraniach dochodzi kolejka zadań oraz pytanie, czy dostępne urządzenie będzie stale zajęte. Porównania szybkości podane przy modelach Whisper oparto na angielskiej mowie i określonym sprzęcie, dlatego nie stanowią gotowej prognozy czasu dla polskich rozmów w innej konfiguracji.
Ile kosztuje godzina nagrania
Cennik API ElevenLabs podaje 0,22 USD za godzinę audio dla Scribe v2 i Scribe v2 Medical oraz 0,39 USD dla Scribe v2 Realtime; podpowiedzi terminów są naliczane dodatkowo. Są to stawki usługi, nie cena modelu użytego w polskim badaniu, którego dokładnej wersji publikacja nie wskazuje. W praktycznym rachunku znaczenie mają też warunki planu i liczba godzin objętych abonamentem.
Lokalny Whisper nie nalicza opłaty za godzinę wywołania własnego modelu, ale komputer albo wynajęta moc obliczeniowa, utrzymanie środowiska i czas człowieka kosztują. Przy okazjonalnych plikach opłata za API może być łatwiejsza do przewidzenia. Przy regularnym obciążeniu własna infrastruktura może rozłożyć koszt na większą liczbę nagrań, o ile jest rzeczywiście wykorzystywana. Porównanie lokalnego modelu i API ma sens dopiero po uwzględnieniu wykorzystania sprzętu.
Najłatwiej przeoczyć koszt korekty. Transkrypt z większą liczbą błędów może wymagać dłuższego odsłuchu, zwłaszcza gdy pomyłki dotyczą nazw leków, liczb lub przypisania wypowiedzi do osoby. Z drugiej strony nawet niski WER nie zwalnia z kontroli tekstu, który ma trafić do dokumentacji lub zostać opublikowany jako cytat. Cena przetworzenia audio jest więc użytecznym składnikiem porównania, lecz nie pełnym kosztem gotowego zapisu.
Lista kontrolna dla rozmów medycznych i wielu mówców
Najbardziej miarodajne są reprezentatywne nagrania z własnego zastosowania, ręcznie spisane jako punkt odniesienia. Tę samą próbkę warto przepuścić przez obie rozważane konfiguracje, zachowując ustawienia i sposób normalizacji tekstu. Przy rozmowach medycznych oraz wieloosobowych porównanie powinno objąć:
- Treść: nazwy leków, skróty, liczby, nazwiska i urwane wypowiedzi; osobno błędy zmieniające znaczenie.
- Mówców: przypisanie głosu przy przerwaniu rozmówcy i przy jednoczesnej mowie, nie tylko wygląd etykiet.
- Czas: możliwość szybkiego odsłuchania słowa lub zdania wymagającego korekty.
- Dane: dopuszczalność wysłania pliku do API, dostęp do wyniku i zasady jego przechowywania.
- Pracę: czas potrzebny na poprawienie transkryptu oraz utrzymanie narzędzi dodanych do Whisper.
Jeśli pliki nie mogą opuścić własnego środowiska, lokalny Whisper daje jasną przewagę organizacyjną. Jeśli najwięcej pracy powodują błędy w trudnych polskich rozmowach i rozdzielanie głosów, wyniki badania oraz funkcje Scribe przemawiają za rozpoczęciem porównania właśnie od niego. O wyborze powinien przesądzić gotowy zapis z nagrań podobnych do tych, które narzędzie będzie przetwarzać na co dzień.
Przeczytaj także:
Powiązane artykuły


YouTube czy Spotify dla wideopodcastu? Odkrywanie zmienia wybór

Metaview zebrał 60 mln dolarów — agent przejmuje żmudną rekrutację

AI Act: kontrola człowieka może zwolnić tekst z etykiety

CapCut czy DaVinci Resolve? Szybki eksport nie rozstrzyga wyboru

Zoom czy Google Meet na słabym łączu? Benchmark nie daje jednego zwycięzcy
Zapisz się do naszego newslettera
Otrzymuj najnowsze wiadomości o Web3, AI i kryptowalutach prosto na swoją skrzynkę.