ElevenLabs heeft zijn nieuwste tekst-naar-spraakmodel aangekondigd: Eleven v4, plus een realtimevariant genaamd v4 Turbo. Volgens het bedrijf klinken de nieuwe stemmen expressiever en kunnen ze de toon van een personage in lange scripts consistent houden. Beide modellen zijn nu beschikbaar via het ElevenAgents-platform, de ElevenCreative-app en de openbare API.
Wat is er nieuw en wat kost het?
Eleven v4 kan tot 10.000 tekens in één verzoek verwerken — goed voor ongeveer tien minuten audio — en ondersteunt meer dan 90 talen, tegenover ongeveer 70 in het vorige v3-model. De Turbo-versie is ontwikkeld voor spraakagenten en kan na ongeveer 150 ms beginnen met spreken. Dat is aanzienlijk sneller dan de 262 ms die het bedrijf bij een concurrent heeft gemeten.
Voor API-gebruik kost het standaardmodel v4 $0,08 per 1.000 tekens ($80 per miljoen tekens) en v4 Turbo $0,04 per 1.000 tekens ($40 per miljoen). Tot 12 oktober zijn de tarieven verlaagd naar respectievelijk $0,022 en $0,011 per 1.000 tekens.
Waarom dit belangrijk is voor makers
Dankzij de lagere tarieven en snellere reacties van Turbo worden hoogwaardige, expressieve AI-stemmen betaalbaarder voor onafhankelijke podcasters, gameontwikkelaars en kleine bedrijven die realtime spraakagenten nodig hebben. De hogere limiet voor het aantal tekens maakt het bovendien minder vaak nodig om lange scripts op te splitsen, wat tijd bespaart bij het maken van audioboeken of tutorials.
Waarom het ertoe doet
Voor gewone gebruikers betekent de lagere prijs per teken een lagere rekening voor projecten met veel gesproken content. Met het snellere Turbo-model kunnen ontwikkelaars realtime spraakassistenten bouwen die natuurlijk klinken en nauwelijks vertraging hebben.