Indhold
ElevenLabs has released Eleven v4, en ny generation af sine stemmodeeller. Det lyder som en nyhed for lydbogsbranchen og spilstudier — men den variant, der faktisk påvirker dit firma, hedder Eleven v4 Turbo, og den er bygget til stemmeagenter som besvarer telefonen i realtid.

Her går vi gennem hvad der er nyt, hvad der bare er markedsføring, og hvad du skal spørge før du lader en ny stemmeprofil besvare dine kunder.
Hvad er Eleven v4?
Eleven v4 er en modelfamilie i to varianter, ifølge ElevenLabs egen modeldokumentation:
- Eleven v4 — den som giver højeste lydkvalitet og størst udtryksomfang. Den klarer op til 10 000 tegn per opkald (omkring ti minutter lyd) og er beregnet til lydbøger, speaker-stemmer, spil og dialog med flere stemmer.
- Eleven v4 Turbo — realtidsvarianten. ElevenLabs angiver en median på omkring 100 millisekunder i inferenslatens og anbefaler den udtrykkeligt til sin agentplatform, altså for røstcentraler i kundeservice og AI-assistenter.
Begge understøtter over 90 sprog, røstklon som skal holde samme stemme stabil gennem lange tekster, og Turbo-varianten har såkaldte lydmærker til at styre, hvordan en replik leveres.
v3 mod v4 — side om side
Den tidligere generation, v3, er nu det, ElevenLabs kalder «previous generation». Sådan adskiller realtidsvarianter sig efter dokumentationen:
| v3 Conversational | v4 Turbo | |
|---|---|---|
| Sprog | 70+ | 90+ |
| Latency (angivet) | ca 280 ms | ca. 100 ms (median) |
| Lydtagger | Ja | Ja |
| Dansk | Ja | Ja |
For den ikke-realtidsbaserede model fordobles grænsen pr. opkald: fra 5 000 tegn i v3 til 10 000 i v4. Det betyder noget for den, der laver lydbøger eller lange optagelser — ikke for et telefonsamtale, hvor hver replik er nogle få sætninger lang.
Hvorfor latensen betyder noget i et opkald
I telefonen mærkes stilhed med det samme. En pause på et sekund efter, at kunden er stoppet med at tale, føles som, at ingen lytter; det er da folk siger «hallå?» eller lægger på.
Det er derfor tallet 280 → 100 millisekunder er interessant. Men det skal læses rigtigt: det er stemmemodelens tid til at begynde at generere lyd (latency i stemme-syntesen). Det samlede ventetid i et opkald består også af taleigenkendelse, sprogsmodellen som bestemmer, hvad der skal siges, eventuelle opslagninger i en kalender og selve telefonnettet. En hurtigere stemmmodel forkorter dele af kæden — den gør ikke hele opkaldet tre gange hurtigere.
Kunden måler ikke millisekunder. Kunden bemærker om det føles som et opkald eller som at vente på en maskine.
Vores test: så hurtig er v4 på dansk
Tal fra en modelside er en ting. Vi ville vide, hvordan det ser ud for en svensk samtale, så vi målte selv på lanceringsdagen: samme svenske sætning, samme svenske stemme, tre kørsler pr. model, fra vores egen computer i Sverige.
| Model | Første lyd (median) | Hele sætningen |
|---|---|---|
| v3 Conversational (det vi kører i dag) | 162 ms | 1,7 s |
| v4 Turbo | 332 ms | 1,9 s |
| v4 (almindelige) | 934 ms | 4,0 s |
| Flash v2.5 | 202 ms | 0,4 s |
Resultatet gik altså den anden vej end det, lanceringen lovede:
- v4 Turbo var langsommere end v3 i vores test — cirka dobbelt så lang tid til første lyd. Individuelle kørsler lå mellem 324 og 476 ms, klart over de tal ElevenLabs selv angiver.
- Almindelige v4 passer ikke i telefon. Næsten et sekund før første lyd høres er for længe i et opkald — men det er heller ikke bygget til realtid, men til optaget lyd.
- Flash v2.5 var hurtigst på hele sætningen. Det er en ældre og enklere model, som prioriterer hastighed frem for udtryk.
To forbehold for at være fair over for v4 Turbo: vi målte på lanceringsdagen da trafik til en ny model plejer at være høj, og vi målte via almindelig streamet tekst-til-tale — ikke via samme forbindelse som en stemmebetjent bruger i et opkald. Tallene viser altså hvordan modellerne klarer sig mod hinanden, ikke præcis hvor lang pausen bliver for den der ringer.
Konklusionen for danske opkald lige nu: v3 er stadig hurtigst blandt de udtryksfulde modeller. Nyere betyder ikke automatisk bedre på telefonen.
Og dansk?
Dansk er inkluderet i sproguddannelseslisten for både v3 og v4, og v4 understøtter flere sprog i alt. Men hastighed er bare halvdelen af billedet — at et sprog «understøttes» siger intet om, hvordan det lyder på præcis et dansk telefonsamtale. Det, der normalt adskiller godt fra dårligt, er dagligdags ting:
- Udtaler den gadeadresser og bynamne ret — Mölndal, Hägersten, Järfälla?
- Læser den op telefonnummer, dato og tidspunkt som en dansker ville sige dem?
- Holder den sig til dansk, når kunden blander et engelsk ord ind?
- Lyder den lige så godt gennem telefonnetværkets smallere lyd som i en demo i høretelefoner?
Intet af det fremgår af en modelside. Det skal høres på rigtige opkald — lyt til hvordan Menodi lyder i rigtige opkald.
Hvad det betyder for Menodi
Menodis AI-receptionist køres i dag på ElevenLabs v3-generation for realtidssamtaler, og efter vores test bliver det sådan indtil videre. v4 Turbo er den naturlige efterfølger, og vi måler igen når den nye model har sat sig. Men en ændring af stemmoden er en ændring i hvordan hver kundes telefon lyder, og det behandler vi som enhver anden ændring i agenten:
- Måles og testes på dansk først — fart, men også adresser, numre, tidspunkter og navne, ikke bare en demo-frase.
- Menneske lytter og gennemser før noget går live på et kundenummer.
- Du beholder dit nummer — Menodi arbejder med viderestilling, så en model-opgradering kræver intet fra dig.
Det er pointen med en service i stedet for eget bygge: du skal ikke behøve at læse modelkort for at din telefon skal lyde bedre næste år.
Spørgsmål at stille til din leverandør
- Hvilken stemmmodel besvarer mine kunder med i dag? Et tydeligt svar er et godt tegn.
- Hvordan testes en modelskift på dansk før det bliver slået til?
- Kan jeg høre et rigtigt opkald — med adresse og telefonnummer — i stedet for en optaget demo?
- Hvad sker der, hvis den nye model lyder dårligere for netop min branche? Kan det gå tilbage?
Nye stemmmodeller vil fortsætte med at blive frigivet i hurtig takt. Det, der afgør, om kunden booker, er ikke versionsnummeret, men at nogen svarer — hurtigt, på godt dansk og med de rigtige oplysninger om din virksomhed. Vejer du stadig alternativerne? Sammenlign AI-receptionist, telefonsvarer og besvaringsservice.
Hør hvordan en AI-receptionist lyder på dansk
Menodi besvarer dine opkald døgnet rundt, holder sig til jeres fakta og booker jobbet. Hør selv i en kort demo.
Book demo