
Microsofts direkteteksting leder testen – men prisen er tre ganger høyere

Microsofts lanseringsmelding fra 1. oktober 2026 introduserte MAI-Transcribe-2-Streaming for direktetranskripsjon på 60 språk, med en introduksjonspris på 0,54 dollar per lydtime ut 2026. Modellen sender foreløpig tekst mens noen snakker, reviderer den etter hvert som mer lyd kommer inn og bekrefter til slutt stabile tekstsegmenter.
BitShovels gjennomgang av Artificial Analysis-målingen fra 2. oktober 2026 oppgir for Microsofts modell og Grok Voice Transcribe 2.0 Streaming henholdsvis rundt 2,5 og 2,7 prosent ordfeil, 0,13 og 0,49 sekunder fra registrert taleslutt til endelig tekst, og 9,00 og 3,33 dollar per 1000 lydminutter – nesten tre ganger så høy pris for Microsoft. Førsteplassen gjelder dermed færre ordfeil i denne testen, samtidig som den billigere rivalen ligger tett på i treffsikkerhet.
Hva førsteplassen faktisk måler
Ordfeilraten sammenligner modellens tekst med en kontrollert transkripsjon og teller ord som er byttet ut, lagt til eller utelatt. Forskjellen mellom modellene i den endelige teksten er 0,2 prosentpoeng i den aktuelle målingen. Det er en reell, men liten forskjell i testmaterialet; den sier ikke hvor mange rettelser en bestemt direktesending eller et norsk møte vil kreve.
Metodebeskrivelsen til Artificial Analysis oppgir omtrent åtte timer lyd, vektet med 50 prosent fra AA-AgentTalk, 25 prosent fra engelskspråklige VoxPopuli og 25 prosent fra Earnings22. Materialet omfatter blant annet tale rettet mot taleagenter, parlamentsinnlegg og resultatpresentasjoner. Testen vurderer strømmet lyd mot referansetekst, ikke ferdige undertekster med linjedeling, plassering på skjermen og skifte mellom talere.
Det finnes heller ingen egen norsk feilrate i den publiserte sammenligningen. Norske dialekter, lokale personnavn og møter med avbrytelser kan gi andre utslag enn det samlede resultatet. Førsteplassen beskriver derfor presisjonen i testens lydutvalg, mens kvaliteten i en norsk tjeneste også avhenger av lyden og ordene tjenesten faktisk skal håndtere.
Ventetiden begynner etter at talen er slutt
Tidsmålet starter når testens taledetektor registrerer slutten på en ytring, og slutter når et endelig tekstsegment kommer tilbake. Nettverksventing inngår. Den kortere tiden for Microsofts modell kan være verdifull når en taleagent venter på bekreftede ord før den tolker en beskjed eller setter i gang en handling.
For publikum begynner opplevelsen av forsinkelse tidligere: Et ord blir sagt, lyd fanges opp og sendes, og en foreløpig tekst kan dukke opp mens taleren fortsetter. Den teksten kan fortsatt endres. Tiden fra registrert taleslutt til endelig tekst måler derfor hvor raskt segmentet blir stabilt etter pausen, ikke hele tiden fra et ord uttales til det står som ferdig undertekst.
Microsoft beskriver også tidlige tekstforslag som kommer kort tid etter at modellen mottar lyd. Det er et annet startpunkt enn målingen etter taleslutt, så de to hastighetstallene kan ikke legges ved siden av hverandre som om de målte samme venting. For en taleagent kommer dessuten forståelse, eventuelle verktøykall og et muntlig svar etter transkripsjonen. En raskere bekreftelse kan korte ned ett ledd uten å fastslå hvor rask hele samtalen oppleves.
Prisen blir tydeligere per lydtime
Omregnet fra samme prisgrunnlag koster Microsofts introduksjonssats 0,009 dollar per lydminutt, mens Groks strømmepris tilsvarer omtrent 0,00333 dollar. For et tenkt forbruk på 100 lydtimer blir transkripsjonsregningen 54 dollar hos Microsoft og omtrent 20 dollar hos Grok. Dette er et regneeksempel for lyd som behandles; utvikling, lagring, andre modeller og øvrig drift kommer i tillegg.
Prisforskjellen følger mengden lyd. En tjeneste som lytter gjennom lange sendinger, betaler for lydvarigheten selv om bare enkelte ytringer er vanskelige å transkribere. I en taleagent med korte, hyppige samtaler kan verdien ligge et annet sted: Dersom raskere bekreftelse faktisk fjerner merkbare pauser, kan hvert kort svar få større betydning enn en liten forskjell i kostnad per samtale.
Færre ordfeil kan også spare manuell retting ved direkteteksting, særlig når navn eller faguttrykk må være riktige med en gang. Testen måler imidlertid ord mot en referansetekst, ikke hvor mye arbeid en redaktør sparer. Det er derfor en mulig gevinst, ikke en dokumentert besparelse for norske tjenester.
Verdien avhenger av norsk lyd
For norske utviklere er de mest aktuelle tilfellene direkteteksting der feil blir synlige umiddelbart, og taleagenter som må reagere når brukeren tar pause. I begge tilfeller er kombinasjonen av presisjon og rask endelig tekst relevant. Automatisk språkgjenkjenning kan dessuten være nyttig når samtaler veksler mellom språk, men den publiserte plasseringen gir ingen egen vurdering av slike norske samtaler.
Valget handler dermed om hvor mye den målte forskjellen betyr i lydmiljøet som skal brukes: En liten fordel i ordfeil kan være viktig når teksten ikke kan rettes før publisering, mens merkostnaden blir mer synlig når mange timer strømmer gjennom tjenesten. Når introduksjonsperioden slutter ved årsskiftet, kan en ny Microsoft-pris også endre dette regnestykket.
Les også:
Relaterte artikler


DeepL eller Google Oversetter: norsk tekst har ingen enkel vinner

Restream eller StreamYard: OBS-valget betyr mer enn månedsprisen

Podbean eller Buzzsprout: opplastingsgrensen avgjør startprisen

Teams eller Zoom: billigste møteplass ga ikke best video i målingene

Backblaze eller IDrive: én PC og mange enheter gir motsatt regnestykke
Abonner på nyhetsbrevet vårt
Få de siste nyhetene om Web3, KI og krypto rett i innboksen.