ElevenLabs muscle la synthèse vocale avec plus d’expression et 90 langues
ElevenLabs lance v4 et v4 Turbo, deux modèles de synthèse vocale pensés pour l’audio de création et les agents en temps réel. L’entreprise promet plus d’expression, moins de latence et une prise en charge de plus de 90 langues.
ElevenLabs a présenté, le 28 septembre 2026, deux nouveaux modèles de synthèse vocale, Eleven v4 et Eleven v4 Turbo, avec une ambition claire : mieux servir à la fois la création audio et les agents vocaux en temps réel. La première version mise sur la qualité et le contrôle de l’expression, la seconde sur la latence réduite pour les appels et les boucles conversationnelles. Le changement compte pour les développeurs, mais aussi pour les entreprises qui veulent des interactions vocales plus fluides, moins robotiques et disponibles dans davantage de langues.
Une architecture pensée pour mieux faire passer l’intention
Avec v4, ElevenLabs dit avoir revu l’architecture du modèle pour mieux gérer l’identité vocale sur les longs textes, le contexte des phrases et les nuances de lecture. Les créateurs peuvent intégrer des indications comme [laughs], [whispers] ou [door slams] directement dans un script, tandis que le modèle suit plus finement la séquence des tags qu’avec v3. En pratique, cela vise les usages où la voix ne doit pas seulement prononcer un texte, mais le jouer un peu. Un détail qui évite au narrateur virtuel de finir en bulletin météo.
Le modèle prend en charge plus de 90 langues, contre 70 pour la génération précédente, avec un gain jugé particulièrement net en japonais, portugais brésilien, mandarin et cantonais selon la société. Chaque génération peut aller jusqu’à 10 000 caractères. ElevenLabs ajoute aussi le retour des Professional Voice Clones, après leur absence dans v3, même si les anciens clones Instant et Professional doivent être réentraînés.
Turbo vise les appels en direct, pas les pauses dramatiques
Eleven v4 Turbo reprend les contrôles expressifs de v4, mais les adapte aux usages temps réel. Le modèle permet un streaming bidirectionnel, ce qui signifie que le texte peut être envoyé pendant qu’un grand modèle de langage continue de produire sa réponse, et que l’audio commence avant la fin de la phrase. ElevenLabs annonce une médiane d’inférence d’environ 100 ms et un temps médian jusqu’au premier son de 150 ms. Dans sa comparaison, Turbo ferait mieux que Cartesia Sonic 3.6, donné à 262 ms, et qu’OpenAI GPT-4o mini TTS, à 814 ms [à vérifier si la méthodologie est identique].
Cette orientation répond à un marché des agents vocaux de plus en plus disputé. ElevenLabs dit que plus de 55 % de son activité passe désormais par de grandes entreprises, alors que des concurrents comme Cartesia, Deepgram, Fish Audio, Boson ou WellSaid Labs poussent aussi des modèles expressifs. De leur côté, Google et OpenAI ont renforcé leurs propres briques vocales. La bataille n’est plus seulement celle de la voix la plus nette, mais celle de la voix la plus utile en conversation.
Ce que les développeurs peuvent en faire, très concrètement
Les deux modèles sont disponibles via les produits ElevenLabs et l’ElevenAPI, avec Turbo également proposé dans ElevenAgents. L’entreprise met en avant la compatibilité avec ses outils de clonage vocal, de conception de voix, de dictionnaires de prononciation et de sortie MP3, WAV, PCM ou téléphonie µ-law. Les développeurs peuvent passer par des points d’accès en streaming ou non, en REST, TypeScript et Python, puis changer de modèle avec un simple identifiant. Là encore, le but est simple : faire parler des applications sans leur faire perdre leur souffle.
Le cadre commercial reste large. ElevenLabs dit inclure les deux modèles sur tous les plans, y compris une offre gratuite avec 10 000 crédits mensuels, tandis que les abonnements payants démarrent à 6 dollars par mois. L’entreprise précise aussi que chaque voix clonée nécessite le consentement vérifié de son propriétaire et que les contenus générés sont couverts par son AI Speech Classifier. Une précaution devenue presque banale dans l’IA vocale, mais loin d’être accessoire quand la frontière entre synthèse et imitation reste sensible.
Une croissance rapide, des ambitions qui montent
La sortie de v4 intervient alors qu’ElevenLabs a levé 500 millions de dollars au premier semestre 2026, dans un tour mené par Sequoia qui valorisait l’entreprise 11 milliards de dollars. Des rumeurs évoquent déjà une nouvelle levée à 22 milliards de dollars [à vérifier]. Son chiffre d’affaires annualisé est passé d’environ 330 millions de dollars au début de l’année à plus de 600 millions, selon les éléments communiqués, et l’effectif a dépassé 800 personnes avec des recrutements en Inde, en Europe et au Brésil. Lors d’un récent entretien avec TechCrunch, le cofondateur et directeur général Mati Staniszewski a dit viser une introduction en Bourse “in the next years”, sans calendrier précis.
La marche à franchir reste toutefois technique autant que commerciale. Plus l’IA vocale se diffuse dans les centres d’appels, les assistants et la création de contenus, plus la qualité perçue dépend de détails minuscules : respiration, rythme, tension, reprise de souffle. ElevenLabs essaie précisément de vendre ce niveau de finesse, avec une promesse de contrôle accru et de latence réduite. Le marché, lui, attend de voir si la voix synthétique peut devenir vraiment naturelle sans perdre sa fiabilité.
Points clés
- 28 septembre 2026 : lancement de Eleven v4 et v4 Turbo.
- Plus de 90 langues, contre 70 auparavant selon ElevenLabs.
- Turbo affiche 100 ms de latence médiane annoncée.
- Plus de 55 % du business vient de grandes entreprises.
- ElevenLabs a levé 500 millions de dollars en 2026.
- Mati Staniszewski vise une IPO “in the next years”.
En chiffres
- 10 secondes — audio nécessaire pour cloner une voix avec v4, selon ElevenLabs.
- 10 000 caractères — limite par génération, annoncée pour v4.
- 150 ms — temps médian jusqu’au premier son pour v4 Turbo.
- 11 milliards de dollars — valorisation du tour mené par Sequoia, premier semestre 2026.
- 800+ salariés — effectif annoncé par l’entreprise en 2026.