
MAI-Transcribe ascolta in 60 lingue: il primato costa più di Grok

Il 1° ottobre 2026 Microsoft AI ha presentato MAI-Transcribe-2-Streaming: il modello trascrive il parlato in tempo reale in 60 lingue, rileva continuamente la lingua e viene offerto a un prezzo introduttivo di 0,54 dollari per ora di audio fino alla fine del 2026. È accessibile agli sviluppatori attraverso Microsoft Foundry, MAI Playground, Vercel e Azure Voice Live.
Nella rilevazione del 2 ottobre 2026, la lettura di BitShovel del confronto streaming di Artificial Analysis riporta per MAI un tasso di errore finale del 2,5% contro il 2,7% di Grok Voice Transcribe 2.0 Streaming, un’attesa di 0,13 contro 0,49 secondi dopo la fine del parlato e un costo di 9 contro 3,33 dollari per mille minuti di audio. Il primato riguarda l’accuratezza nel test: MAI restituisce anche il testo finale prima di Grok, ma a un prezzo superiore.
Che cosa misura il primato di MAI nello streaming
Il benchmark invia l’audio in piccoli segmenti mentre viene riprodotto, come avviene in una trascrizione dal vivo. Confronta il testo ottenuto con una trascrizione di riferimento e calcola il tasso di errore sulle parole, o WER, contando parole sostituite, omesse e aggiunte. Un valore più basso indica meno errori nel materiale esaminato, non una garanzia che ogni registrazione avrà la stessa qualità.
Il risultato aggregato combina conversazioni legate agli agenti vocali, interventi parlamentari e comunicazioni sui risultati societari. Questi insiemi mettono alla prova lessici e condizioni acustiche differenti, ma il punteggio complessivo non separa le registrazioni in italiano. Il supporto della lingua e il primato nella graduatoria rispondono quindi a domande diverse: il primo indica che il modello può trascrivere l’italiano, il secondo descrive la sua prestazione media sul campione del test.
Conta anche quale versione del testo viene valutata. Durante una frase il sistema può mostrare parole provvisorie e modificarle quando riceve altro audio; il testo finale rappresenta il segmento confermato. Per chi segue sottotitoli dal vivo, una correzione visibile può pesare anche quando la frase conclusa è esatta. Per un verbale, invece, incidono soprattutto gli errori che rimangono dopo la conferma.
La latenza parte dalla fine del parlato
Il tempo di finalizzazione non coincide con il tempo necessario a far apparire le prime parole. Nel confronto, il cronometro parte quando il sistema usato per il test rileva la fine del parlato e si ferma all’arrivo della trascrizione finale. Le prime ipotesi possono comparire mentre la persona sta ancora parlando: sono utili per seguire la frase, ma possono cambiare.
Questo chiarisce il vantaggio di MAI rispetto a Grok nella misura pubblicata. Riguarda l’attesa dopo una pausa rilevata, non l’intervallo completo tra una parola pronunciata e la sua comparsa nei sottotitoli. Il momento in cui un’applicazione decide che la frase è terminata influisce a sua volta sull’attesa percepita: una pausa breve può essere trattata come conclusione del segmento oppure come parte dello stesso intervento.
In un agente vocale la trascrizione è soltanto una fase. Dopo aver ricevuto il testo, l’applicazione deve interpretare la richiesta, eventualmente usare altri strumenti e produrre una risposta. Una finalizzazione più rapida può abbreviare il silenzio prima di quelle operazioni, ma il dato del benchmark non misura il tempo totale della conversazione con l’agente.
Accesso dall’Italia e prezzo per durata dell’audio
La documentazione Microsoft della Realtime API include l’italiano tra le lingue supportate e indica l’accesso globale tramite risorse Foundry nelle regioni disponibili. Classifica però la funzione come anteprima pubblica, senza accordo sul livello di servizio, e non la raccomanda per carichi di produzione. Per un servizio destinato a funzionare senza interruzioni, questo stato pesa quanto l’accuratezza misurata.
L’API riceve audio continuo e restituisce testo intermedio, parti già consolidate e una trascrizione completa del segmento. Non rileva automaticamente la fine del parlato per chiudere quel segmento: il client deve inviare una richiesta di conferma, per esempio dopo una pausa individuata dalla propria applicazione. Due integrazioni dello stesso modello possono quindi dare una diversa impressione di velocità se scelgono momenti diversi per chiudere la frase.
La tariffa dipende dalla durata dell’audio inviato, non dal numero di parole prodotte. Il confronto economico premia Grok quando si considera soltanto il costo di trascrizione per la stessa quantità di audio. Il prezzo annunciato per MAI è introduttivo; il costo successivo a quel periodo resta una variabile per chi deve stimare una spesa continuativa.
Tre conseguenze per sottotitoli, verbali e agenti vocali
Nei sottotitoli di un evento italiano, il testo provvisorio permette al pubblico di seguire un intervento ancora in corso. Qui la rapidità del risultato finale conta insieme alla stabilità di ciò che è già apparso: se un cognome o una parola tecnica viene riscritta più volte, il lettore vede quelle correzioni anche quando la versione conclusiva è giusta. La graduatoria offre una misura dell’accuratezza, ma non quantifica da sola quante modifiche vedrebbe il pubblico durante un evento in italiano.
Per il verbale di una riunione cambia la priorità. Cognomi, sigle aziendali, sovrapposizioni tra voci e qualità dei microfoni incidono sul lavoro necessario per rendere utilizzabile il testo confermato. Il punteggio aggregato indica che MAI è un candidato forte nel confronto pubblicato; non dice quante correzioni richiederebbe una specifica riunione con partecipanti e audio italiani. In questo caso, una piccola differenza nell’attesa dopo ogni frase può contare meno degli errori rimasti nel documento.
Per un agente vocale, invece, la pausa dopo una domanda è parte dell’esperienza. Una trascrizione confermata rapidamente può consentire all’applicazione di avviare prima l’elaborazione della richiesta; il vantaggio economico di Grok può diventare rilevante se il servizio gestisce molto audio. Accuratezza, attesa e spesa descrivono dunque aspetti distinti della stessa scelta, mentre la risposta effettiva dell’agente dipende anche dalle fasi successive alla trascrizione.
Per chi opera in Italia, la differenza ancora da osservare è concreta: come cambiano gli errori e le correzioni visibili quando il parlato contiene accenti locali, nomi propri e rumore degli ambienti in cui il servizio verrà usato. È lì che il primato generale può tradursi, oppure no, in meno interventi sul testo e in un dialogo più fluido.
Leggi anche:
Articoli correlati


ElevenLabs o Azure Speech: nell’italiano naturale il prezzo non è tutto

Grammarly o LanguageTool: sull’inglese il prezzo non compra la stessa precisione

Chunk RAG: più contesto può peggiorare qualità e costi

AnyCreator Stream unisce live, sponsor e pagamenti, partendo da YouTube

Claude trova un sistema simile a CRISPR, ma la sua funzione resta ignota
Iscriviti alla nostra newsletter
Ricevi le ultime notizie su Web3, IA e cripto direttamente nella tua casella di posta.