
MAI-Transcribe začne přepis za 100 ms, produkční provoz ale zatím nedoporučuje

Microsoft AI v oznámení z 1. října 2026 uvedla MAI-Transcribe-2-Streaming pro živý přepis v 60 jazycích, který podle firmy vytváří první průběžnou hypotézu těsně nad 100 ms po přijetí zvuku a vede v přesnosti průběžných i konečných přepisů v hodnocení Artificial Analysis. Zaváděcí cena činí 0,54 USD za hodinu audia do konce roku 2026; první návrh slov se však může ještě změnit.
Podle technické dokumentace Microsoftu je MAI-Transcribe-2-Streaming ve veřejném náhledu bez smluvní záruky úrovně služby (SLA), pro produkční úlohy se nedoporučuje a seznam jazyků pro použití přes SDK zahrnuje češtinu. Přístup je možný přes Realtime API využívající WebSocket a přes Azure Speech SDK; obě cesty poskytují průběžné i konečné výsledky. Rychlost prvního textu tedy přichází se dvěma hranicemi: text se může ještě změnit a dostupnost služby nemá produkční záruku.
Průběžný text předbíhá dokončenou větu
Model zpracovává souvislý proud řeči a během mluvení vrací částečný text. Nový zvuk může změnit předchozí odhad; až konečný výsledek potvrzuje příslušný úsek. Rozdíl je viditelný u živých titulků: divák může číst slova téměř současně s řečníkem, ale část zobrazeného řádku se při pokračování věty opraví. Doba do první hypotézy proto neříká, kdy bude stabilní celý výrok.
Pro hlasového asistenta může raný návrh znamenat, že začne připravovat odpověď ještě před koncem otázky. Pokud by však aplikace podle takového návrhu ihned spustila nevratnou akci, pozdější oprava slov by ji sama nevrátila. Přepis do zápisu či záznamu hovoru potřebuje jiný okamžik rozhodnutí než titulky, které smějí průběžně přepisovat vlastní řádek. To je vlastnost proudu výsledků, nikoli další měření rychlosti modelu.
Automatické průběžné rozpoznávání jazyka pomáhá u vícejazyčné řeči, ale jazykový rozsah nevyjadřuje přesnost každého jazyka zvlášť. Zařazení češtiny do seznamu ještě neříká, jaká bude její chybovost v čistém mikrofonním záznamu a v hovoru se šumem. Zvláště u titulků záleží i na tom, jak často se již zobrazená slova mění; údaj o prvním výstupu tuto stabilitu nepopisuje.
Pořadí v testu používá jiný časový bod
Rozbor BenchLM upozorňuje, že čas první hypotézy po přijetí zvuku se nesmí zaměnit za latenci přepisu měřenou po rozpoznaném konci řeči. Jde o odlišné počátky měření i odlišné fáze výstupu. První hodnota popisuje, jak brzy systém začne posílat text při stále běžícím vstupu; druhá řeší čekání na použitelný výsledek po doznění promluvy. Jediné číslo proto nevystihuje celou odezvu hlasové aplikace.
Přesnost průběžného a konečného výstupu se rovněž nedá sloučit do jedné vlastnosti. Průběžná slova lze během řeči měnit, konečný segment už zůstává potvrzený. Pořadí v žebříčku je srovnáním za podmínek daného testu, nikoli příslibem totožné chybovosti v každém jazyce a akustickém prostředí. U českého nasazení je zvlášť podstatné, že výsledek za různé nahrávky nelze automaticky převést na přesnost konkrétního místního hovoru nebo přednášky.
Stejně snadno se mohou smísit údaje pro dva příbuzné modely. MAI-Transcribe-2 je model pro dávkové zpracování audia, zatímco zde oznámená verze přijímá proud. Její hodnocení průběžných výsledků tak nelze nahradit výsledkem dávkového přepisu, byť produkty nesou podobné jméno. Pro posouzení živého použití mají význam právě výstupy, které přicházejí před koncem řeči, a čas, kdy se potvrdí.
Zaváděcí sazba má časové omezení
Cena audia se vztahuje k délce zpracovaného záznamu, nikoli k počtu slov v textu. Uvedená hodinová sazba znamená při prostém přepočtu 9 USD za 1 000 minut, pokud platí stejné účtování po celé období. Pro aplikaci, která naslouchá souvisle, je proto relevantní čas odesílaného zvuku včetně úseků, z nichž nevznikne mnoho textu. Samotný účet za rozpoznání řeči navíc nezahrnuje případné další služby, které aplikace použije pro odpověď nebo ukládání výsledků.
Zaváděcí období končí s rokem 2026; dlouhodobé náklady proto nelze vyvozovat z této sazby. Vývojář může spočítat cenu určitého objemu audia za nynějších podmínek, ale nemá tím potvrzenou cenu stejného provozu v následujícím roce. To je zvlášť důležité u produktu, jehož jednotkové náklady se násobí délkou hovorů a počtem současných připojení.
Veřejný náhled má konkrétní provozní důsledek
Realtime API a Speech SDK nabízejí dvě integrační cesty k témuž streamovacímu modelu. WebSocketová cesta dává smysl aplikaci, která již používá kompatibilní protokol; klientská knihovna pomáhá se správou připojení a odesíláním audia. Volba rozhraní však nemění význam průběžného textu: ani jeden způsob jej automaticky nepovyšuje na potvrzený segment. Aplikace, která uchovává přepis, musí počítat s tím, že provizorní slova se při další řeči mohou opravit.
Absence SLA se týká závazku provozu, nikoli rychlosti jedné úspěšné odpovědi. V praxi tak veřejný náhled umožňuje ověřit formát výsledků a chování při živém zvuku, ale neposkytuje smluvní dostupnost pro službu, na níž stojí produkční provoz. Dokumentace současně připouští omezené nebo chybějící funkce náhledu. Pro firmy, které přepis potřebují nepřetržitě, je to samostatné rozhodovací kritérium vedle přesnosti a latence.
Po skončení zaváděcí sazby bude rozhodující, jakou cenu Microsoft stanoví pro další období a zda veřejný náhled získá produkční záruky. Právě tyto podmínky určí, zda půjde rychlý přepis použít také jako službu, na které může dlouhodobě stát běžný provoz.
Přečtěte si také:
Související články


Otter.ai, nebo Fireflies.ai: neomezený přepis není totéž co lepší zápis

Riverside, nebo StreamYard: rozhoduje záznam, ne počet hostů

AWS přesouvá studený start před první požadavek — ne vždy zdarma

Cloudflare Clef rozhoduje bez textové odpovědi, pravidla však musí dodat člověk

Cena AI agenta není počet tokenů: smyčky znovu účtují celý kontext
Přihlaste se k odběru newsletteru
Nejnovější zprávy ze světa Web3, AI a kryptoměn přímo do vaší schránky.