
Pianissimo transkriberar en timme svenska på en sekund – men inte felfriast

Klang AI släppte den öppna svenska talmodellen Pianissimo den 23 september 2026 och uppgav att den i bolagets test bearbetar en timmes ljud på ungefär en sekund, omkring 3 600 gånger realtid. Modellen är anpassad för svenska och svenska dialekter, och vikterna finns att ladda ned för lokal drift. Hastigheten är uppmätt under särskilda förhållanden; den säger inte hur lång tid varje användares transkribering tar.
Samma dag lanserade Berget AI ett API för svensk transkribering i realtid med Pianissimo som första modell; enligt företaget behandlas ljudet i Sverige utan att vare sig ljud eller transkription lagras hos leverantören. Text kan komma medan någon fortfarande talar. I de publicerade jämförelserna har KB-Whisper Large lägre ordfelsfrekvens på samtliga redovisade testmängder. Siffrorna kommer från Klangs egna tester, och Berget erbjuder själv modellen som tjänst.
Så mättes hastigheten och ordfelen
Enligt Klangs modellkort avser en timmes ljud på en sekund körning på Nvidia H100, medan ett separat genomströmningstest på Nvidia A100 gav 2 500 gånger realtid med 30 sekunder långa klipp och optimerad behandling i omgångar; samma utvärdering anger ordfelsfrekvensen för Pianissimo respektive KB-Whisper Large till 4,46 och 3,91 procent på Common Voice, 6,51 och 5,08 på FLEURS samt 4,85 och 2,30 på Klangs dialektmaterial. Lägre ordfelsfrekvens är bättre. De två hastighetsuppgifterna gäller olika hårdvara och olika mätningar.
Genomströmning beskriver hur mycket ljud som kan bearbetas under en viss tid. Den omfattar inte nödvändigtvis överföring av ljudfilen, väntan på ledig kapacitet eller leverans av texten till användaren. För en pågående ljudström är fördröjningen till de första orden en annan fråga: Bergets tjänst tar emot ljud via WebSocket, skickar delresultat medan talet pågår och levererar en slutlig utskrift när strömmen upphör. Ett snabbt test med färdiga klipp och en användbar direktsänd text mäter därför skilda delar av samma arbete.
Ordfelsfrekvens, ofta förkortat WER, räknar ord som modellen byter ut, hoppar över eller lägger till jämfört med en facittext. Felen sätts i relation till antalet ord i facit. Måttet beskriver den samlade avvikelsen i testmaterialet, inte hur många fel varje enskild mening innehåller. Inför den publicerade beräkningen gjordes texten till gemener, skiljetecken ersattes med mellanslag och extra mellanrum togs bort. Resultaten gäller därmed igenkända ord under just den normaliseringen; namn, interpunktion och formatering kan fortfarande vara avgörande för hur användbar en utskrift blir.
Common Voice och FLEURS är offentliga testmaterial, medan dialektmaterialet har samlats in av Klang. Att modellerna bedömts med samma procedur gör de redovisade skillnaderna begripliga, men testet är ingen oberoende mätning av alla svenska samtalsmiljöer. För en redan färdig inspelning där lägsta möjliga ordfelsfrekvens väger tyngre än löpande text talar dessa resultat för KB-Whisper Large. De visar däremot inte hur lång väntan en användare får med respektive tjänst.
Dialekter ingår i den svenska anpassningen
Pianissimo bygger på Nvidias Parakeet och har vidareutvecklats för svenskt tal. Anpassningen omfattar dialekter, vilket är relevant när modellen möter andra uttal än standardsvenska. Dialektmaterialet ger ett riktat prov vid sidan av de offentliga testmängderna, men dess resultat beskriver de inspelningar som faktiskt ingick. Samma felprocent kan inte föras över direkt till varje dialekt, mikrofon eller typ av samtal.
Modellen kan ge tidsstämplar på ordnivå och hantera både korta och långa inspelningar. Överlappande röster, kraftigt bakgrundsljud, ovanliga namn och facktermer kan ändå försämra igenkänningen; siffror och skiljetecken kan behöva redigeras. För ordagranna citat kan ett enda fel i ett namn eller en negation ändra innebörden trots låg genomsnittlig ordfelsfrekvens. Den redovisade utvärderingen gäller svenska, medan prestanda för andra språk och samtal där språk blandas ännu inte är fastställd.
Öppna vikter ger ett alternativ till API-drift
De nedladdningsbara vikterna gör det möjligt att behandla en inspelning i den egna miljön, även utan nätanslutning, om resten av lösningen också är uppbyggd för lokal drift. Då behöver ljudet inte skickas till en extern transkriberingstjänst. Möjligheten att köra modellen på en vanlig bärbar dator innebär däremot inte att datorn når hastigheten från testet med serverhårdvara. Lokal körning svarar framför allt på frågan var ljudet behandlas.
Med API-varianten skickas ljudet i stället till Bergets driftmiljö för att få text löpande under samtalet. Uppgiften om att inget lagras avser leverantörens tjänst, inte automatiskt programmet som ansluter till den; ett sådant program kan ha egna funktioner för inspelning och lagring. För samtal med personuppgifter eller konfidentiellt innehåll får den skillnaden konkreta följder. Kraven på var ljudet behandlas, när texten behövs och hur noggrann slututskriften måste vara kan leda till olika val även när utgångspunkten är samma svenska inspelning.
Relaterade artiklar


Azure OpenAI eller direkt API: dataplaceringen kan kosta 10 procent

Europas kreatörer pressar EU om AI – upphovsrätt och ersättning står i centrum

Lysa eller global indexfond: 0,1 procentenhet har ett pris

Tailscale eller WireGuard: enkelheten kostar fart på Linux

ChatGPT eller Gemini: arbetsflödet avgör vilket abonnemang som lönar sig
Prenumerera på vårt nyhetsbrev
Få de senaste nyheterna om Web3, AI och krypto direkt i din inkorg.