De zin “I need you to stay calm” klinkt totaal anders uit de mond van een arts naast een angstige patiënt dan uit die van een soldaat die zijn team toeschreeuwt vlak voor een gevecht. Met dat voorbeeld introduceert ElevenLabs Eleven v4, het nieuwe text to speech model dat op 28 september 2026 werd gelanceerd samen met de snellere variant Eleven v4 Turbo. Je bepaalt veel preciezer hoe een zin klinkt, en het model houdt rekening met de context van een hele scène.
Wat is Eleven v4?
Eleven v4 draait op een volledig nieuwe architectuur. Het model analyseert toon, tempo, emotie, personage en context in de tekst en zet dit om in spraak die dramatisch, teder, dringend, grappig of gewoon conversationeel kan klinken. De identiteit van de spreker blijft daarbij behouden. Ook de audiokwaliteit zelf is beter, met een meer schone en natuurlijke output.
Er zijn twee versies:
- Eleven v4 is het meest expressieve model, gericht op audioboeken, voice-overs, personages, dubbing en narratie.
- Eleven v4 Turbo brengt dezelfde technologie naar toepassingen waar snelheid telt, zoals voice agents en andere realtime gesprekken.
Beide modellen zijn beschikbaar in ElevenAgents, ElevenCreative en via de ElevenAPI. De vorige generatie, Eleven v3, verscheen vorig jaar. Een eerste glimp van v4 toonde ElevenLabs eerder dit jaar op een evenement in Warschau.
Een stem regisseren met audio tags en gewone taal
De meest praktische verbetering zit in de manier waarop je de output stuurt. Je beschrijft in natuurlijke taal hoe een zin gebracht moet worden en het model interpreteert die instructie. Wil je nog meer controle, dan gebruik je inline tags zoals [laughs], [said angrily in French accent], [light rain] of [phone buzzing]. Daarmee stuur je emotie, tempo, reacties en geluidseffecten.
Tags bestonden al in v3, maar v4 volgt ze nauwkeuriger. Volgens TechCrunch kun je nu ook meerdere tags stapelen, waarna het model die in de juiste volgorde uitvoert. Voor wie narratie maakt of dialogen schrijft, betekent dit dat je minder moet regenereren tot een take goed klinkt. De volledige tag syntax en de toepassing via de API staan in de developer documentatie van ElevenLabs.
De ondersteuning voor het International Phonetic Alphabet werkt ook een stuk betrouwbaarder. Merknamen, medische termen of fantasienamen spreekt Eleven consequent uit op de manier die jij vastlegt.
Natuurlijke dialogen met meerdere sprekers
Oudere modellen genereerden dialogen vaak als losse zinnen die achteraf aan elkaar werden geplakt. Eleven v4 begrijpt de context van een volledige scène, waardoor sprekers reageren op wat net gezegd werd. Een gesprek krijgt daardoor ritme.
ElevenLabs gebruikt ook een nieuwe methode om de identiteit van een spreker vast te leggen. Elke stem behoudt haar eigenheid doorheen lange audioboeken, reclamespots of gesprekken met agents. Request stitching, het aan elkaar koppelen van meerdere generaties voor langere content, is volgens het bedrijf ook merkbaar beter geworden. Dat merk je vooral in ElevenLabs Studio en de ElevenLabs Reader App.
Eleven v4 Turbo voor voice agents
Wie een voice agent bouwde, moest tot nu toe vaak kiezen tussen snel en expressief. Veel bedrijven kozen voor snelheid, met agents die efficiënt werken maar monotoon klinken. Voor een gefrustreerde klant die gewoon een probleem opgelost wil zien, komt dat al snel robotachtig over.
Eleven v4 Turbo haalt volgens ElevenLabs een gemiddelde inference latency van ongeveer 100 milliseconden en een gemiddelde time to first speech van ongeveer 150 milliseconden via WebSocket streaming. Dat is sneller dan de gemiddelde pauze tussen twee mensen in een gesprek. Het model kan bovendien al audio genereren zodra het onderliggende LLM begint te antwoorden. TechCrunch meldt ook dat het model confrontaties, escalaties en wachtmomenten anders aanpakt, zodat een gesprek vlotter tot een oplossing komt.
ElevenLabs noemt zelf twee uitersten als voorbeeld: een warme, geruststellende agent in de zorg die medische termen correct uitspreekt, en een snelle, met slang strooiende agent die gamers entertaint. Turbo is ontwikkeld samen met ElevenAgents, het eigen platform voor conversational agents.
Eén stem in meer dan 90 talen
Eleven v3 ondersteunde 70 talen. Beide v4 modellen gaan naar meer dan 90 talen, waaronder Kantonees, Mongools en Odia. De grootste kwaliteitssprong zag ElevenLabs in het Japans, Braziliaans Portugees, Mandarijn en Kantonees.
De verbetering gaat verder dan uitspraak alleen. Het model vangt ritme, emotie en voordracht per taal beter op. Je spreekt een oudere onbekende in Japan immers anders aan dan in Italië. Een stem die in één taal is opgenomen, spreekt nu vloeiend een andere taal met het accent van een moedertaalspreker, terwijl de oorspronkelijke identiteit behouden blijft. Het accent wordt tijdens een lange generatie ook langer behouden. Voor dubbing en lokalisatie betekent dat de stem van een acteur in elke ondersteunde taal overeind blijft.
Voice cloning met 10 seconden audio
Instant Voice Clones leggen volgens ElevenLabs een stem nu met hoge nauwkeurigheid vast op basis van slechts 10 seconden audio, met een duidelijk grotere gelijkenis met de originele stem. Voor projecten die de hoogste kwaliteit vereisen, ondersteunt v4 ook Professional Voice Clones.
De documentatie van ElevenLabs raadde bij lancering nog altijd 1 tot 2 minuten duidelijke audio aan voor Instant Voice Cloning en 30 tot 180 minuten voor Professional Voice Cloning. Test dus zelf hoe ver je met een kort fragment komt. Werk je met een stem die niet van jou is, documenteer dan de bronopname, de toestemming en het beoogde gebruik.
Hoe sterk zijn de claims?
ElevenLabs noemt Eleven v4 het nummer 1 model volgens Artificial Analysis. Op de Speech Arena, waar gebruikers blind stemmen, stond v4 bij lancering op een Elo van 1319. Dat is 43 punten meer dan Cartesia Sonic 3.6 met 1276 en Gemini 3.8 Flash TTS met 1267. Een duidelijke voorsprong, al verschuiven zulke rankings zodra er meer stemmen binnenkomen.
Andere cijfers komen van ElevenLabs zelf. Het bedrijf stelt dat ongeveer 75% van de luisteraars v4 verkoos in blinde vergelijkingen met onder meer Cartesia, Inworld en Google. Ook beide latency cijfers zijn eigen metingen, en voor de gewone v4 werd geen latency gecommuniceerd. Onafhankelijke tests in live agents moeten nog volgen. De concurrentie zit intussen niet stil, met spelers als Cartesia, Deepgram, Fish Audio, WellSaid Labs, Google en OpenAI.
Wat kost Eleven v4?
Tot 12 oktober 2026 geldt een lanceringskorting van 72% op de API:
- Eleven v4 kost $22 per miljoen karakters, tegenover een listprice van $80.
- Eleven v4 Turbo kost $11 per miljoen karakters, tegenover een listprice van $40.
De listprice van v4 is aanzienlijk duurder dan de concurrentie: Sonic 3.6 kost $49 en Gemini 3.8 Flash TTS $16,50 per miljoen karakters.
Een indrukwekkende demo zegt weinig over hoe Eleven v4 in jouw praktijk werkt. Een test:
- Gebruik een script dat je goed kent en dezelfde stem die je nu gebruikt.
- Kies één emotionele zin en vergelijk hoe consequent v4 je instructies volgt tegenover je huidige model.
- Regenereer één zin en luister of de stem afwijkt.
- Laat een passage van meerdere alinea’s genereren om de stabiliteit te checken.
- Test de taal en het accent in andere talen.
Eleven v4 verandert het werk achter de stem
Het verschil zit in de montage. Als je één zin anders kunt laten klinken zonder dat de stem, het tempo of de emotie van de omliggende audio breekt, verschuift je werk van repareren naar regisseren.