
Azure Speech eller ElevenLabs på dansk? Latensen fortæller kun halvdelen

Til danske telefonagenter med faste replikker er Azure Speech et oplagt udgangspunkt, fordi pauser, tempo og udtale kan styres med SSML. ElevenLabs er værd at afprøve, når hurtig eller mere udtryksfuld tale vejer tungt. Ingen af valgene kan afgøres med et oplyst latenstal alene: Stemmen skal også udtale manuskriptet korrekt og nå frem til lytteren uden en mærkbar pause.
Til oplæsning betyder en sammenhængende levering af lange passager typisk mere end en hurtig åbning. I en samtale kan ventetiden til det første forståelige ord derimod være afgørende. Derfor bør de samme danske replikker afprøves i den telefon- eller afspilningskæde, som stemmen faktisk skal bruges i.
Dansk findes hos begge, men stemmevalget er forskelligt
Microsofts oversigt over Azure-stemmer navngiver da-DK-ChristelNeural og da-DK-JeppeNeural som danske standardstemmer og angiver dansk som understøttet sprog for personal voice. Der er ikke særskilte stilroller angivet for de to standardstemmer. Det er en vigtig afgrænsning, hvis en løsning kræver en bestemt følelsestil frem for blot en dansk stemme.
ElevenLabs’ modeloversigt angiver dansk for Multilingual v2 og Flash v2.5. Multilingual v2 beskrives som stabil ved lange optagelser og med plads til nuanceret udtryk. Flash v2.5 er udviklet til brug med lav latenstid; de oplyste cirka 75 millisekunder gælder intern modelinferens og udelader applikation og netværk. Et modelnavn fortæller dermed hverken, hvordan et dansk stednavn lyder, eller hvornår en opkalder hører det.
Hos Azure kan prøven begynde med de navngivne danske standardstemmer. Hos ElevenLabs skal både model og konkret stemme vælges. En dansk sprogmarkering er et udgangspunkt for udvælgelsen, mens lytteprøven afgør, om stemmen rammer trykket i sammensatte ord, navne og den tone, tjenesten skal have.
Udtryk skal passe til replikken
En oplæser kan have gavn af variation, mens en telefonagent ofte skal levere den samme besked roligt og genkendeligt. Det gør følelsesudtryk til et spørgsmål om passende betoning, ikke om mest mulig dramatik. En varm velkomst og en oplysning om betaling bør derfor ikke vurderes ud fra det samme ideal for stemmeføring.
ElevenLabs’ forskellige modeller giver flere måder at prioritere udtryk og hastighed på, men de skal høres med det valgte danske manuskript. For ChristelNeural og JeppeNeural bør man tilsvarende skelne mellem almindelig variation i talen og de stilroller, som ikke er angivet for stemmerne. En neutral besked, en venlig åbning og en følsom formulering viser mere om anvendeligheden end et enkelt demonstrationsklip.
SSML giver mest værdi, når ordene ligger fast
Azures SSML-dokumentation beskriver styring af blandt andet pauser, taletempo, tonehøjde og udtale. Det er nyttigt i et telefonflow, hvor en adresse eller et navn skal siges på en bestemt måde, og hvor en pause skal falde samme sted hver gang. Den konkrete instruktion bør stadig afprøves med den valgte danske stemme; en generel SSML-funktion indebærer ikke, at alle stemmer tilbyder de samme udtryksstile.
ElevenLabs’ vejledning om pauser og fonemer angiver, at SSML-pausetags kan bruges med blandt andre Flash v2.5 og Multilingual v2, mens Eleven v3 og v4 er undtaget. Vejledningen begrænser samtidig SSML-fonemer til engelske sprogmodeller. En dansk udtaleregel fra Azure kan derfor ikke blot flyttes over som et tilsvarende fonemtag.
Ved frie svar kan en ændret formulering eller et andet stemmevalg være tilstrækkeligt. Ved gentagne beskeder med navne, beløb eller ordlyd, der skal fastholdes, får dokumenteret kontrol større betydning. Lyt især efter, om en rettelse af ét ord ændrer rytmen i resten af sætningen.
Hurtig modelinferens er ikke et hurtigt svar i telefonen
En publiceret belastningstest fra HolySheep AI beskriver et forløb på 48 timer og opgiver medianlatenser på 312 og 485 millisekunder samt p99-latenser på 890 og 1.240 millisekunder for henholdsvis ElevenLabs og Azure TTS Neural. Den opgiver også en første-byte-latens på 285 mod 410 millisekunder og fejlprocenter på 0,12 mod 0,08. Tallene peger på hurtigere svar for ElevenLabs og færre fejl for Azure i den beskrevne opsætning.
Testen beskriver samme type AWS-maskine og en opvarmningsperiode, men giver ikke en tilsvarende måling med et fælles dansk manuskript, de valgte danske stemmer og første hørbare ord hos en slutbruger. Eksempelkoden bruger engelske stemmer; det er ikke i sig selv dokumentation for, hvilke stemmer der indgik i målingen. Resultaterne er derfor et pejlemærke for testens konfiguration, ikke en rangliste over dansk tale i en telefonløsning.
Modelinferens, første modtagne byte og første hørbare ord beskriver forskellige led i samme forløb. En byte kan ankomme, før der er nok lyd til afspilning, og et afspilleligt klip kan begynde med stilhed. I en stemmeagent kommer talegenkendelse, dannelse af svartekst, netværk og afspilning oveni. Hvis hele kæden venter på tekst, hjælper en hurtigere syntesemodel kun på en del af ventetiden.
En dansk prøve på samme vilkår
Begynd med ét fælles manuskript: korte åbningsreplikker til agenten, længere passager til oplæsning og sætninger med danske stednavne, personnavne og sammensatte ord. Medtag også telefonnumre, beløb og datoer. Flash v2.5 kan kræve særlig opmærksomhed her, fordi modellens standardbehandling af tal kan give en anden oplæsning end forventet. Hvis tal skrives ud med ord før syntesen, skal den tekstbehandling indgå i den samlede løsning og i tidsmålingen.
Kør anmodningerne fra samme applikationsmiljø, registrér den anvendte serverregion, og vælg samme lydformat og samplingsfrekvens, hvor begge tjenester tilbyder det. Mål både nye og genbrugte forbindelser samt den belastning, løsningen er tænkt til. Gem model, stemme, tekstforbehandling og eventuelle pauseinstruktioner med resultaterne; ellers kan en ændring i opsætningen ligne en forskel mellem leverandørerne.
Registrér særskilt tidspunktet for afsendt synteseanmodning, første modtagne byte, første afspillelige lyd og første hørbare ord i telefonen eller afspilleren. Sammenlign typisk svartid, langsomme svar, fejl og gentagne forsøg. For en samtaleagent bør målingen også starte ved afslutningen af brugerens ytring, så ventetid før talesyntesen bliver synlig.
Lad danske lyttere bedømme de samme klip uden leverandørnavn. Bed dem markere misforståelige navne, forkert tryk, uklare tal og en betoning, der ikke passer til beskeden. Det giver en vurdering af det, brugeren faktisk hører, og gør det muligt at vælge en stemme, der både svarer hurtigt nok og leverer den rigtige besked.
Hvilken løsning passer til opgaven?
Til faste danske telefonreplikker med særlige udtalekrav taler Azures SSML-styring for at begynde dér. Til friere dialog eller oplæsning, hvor stemmens udtryk vægter højt, er ElevenLabs’ model- og stemmevalg værd at afprøve. Det endelige valg bør falde på den konkrete stemme, som klarer manuskriptet og belastningen bedst: En hurtig første byte har begrænset værdi, hvis det første hørbare ord kommer sent eller bliver sagt forkert.
Læs også:
Relaterede artikler


Dansk maskinoversættelse: Fagtermer vælter både DeepL og Google

Grammarly eller LanguageTool? Dansk tekst gør standardvalget usikkert

Otter eller Fireflies til danske møder? Sproglisten afgør valget

MongoDB flytter reranking ind i databasen – rerank-2.5 bliver legacy

Nvidia kan sætte AI-agenter i karantæne på millisekunder
Tilmeld dig vores nyhedsbrev
Få de seneste nyheder om Web3, AI og krypto direkte i din indbakke.