L’IA créative te passionne ?
Image, vidéo, son, design génératif : le meilleur chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
ElevenLabs déploie v4 et sa déclinaison Turbo pour la synthèse vocale. L’éditeur met en avant des gains d’expressivité, de prononciation et de cohérence sur de longues durées, tout en visant la latence temps réel. Des prix promotionnels et des choix de localisation des données accompagnent l’ouverture générale.
v4 dépasse Cartesia et Gemini sur un classement tiers
Sur le classement Provider Voice Arena d’Artificial Analysis, Eleven v4 se place devant Cartesia Sonic 3.6 et Google’s Gemini 3.8 Flash TTS. Il enregistre un score de 91,7 % sur un benchmark de prononciation, contre 85,6 % pour v3. Dans des tests à l’aveugle menés par ElevenLabs, environ trois quarts des auditeurs ont préféré v4 aux modèles de Cartesia, Inworld et Google. Dans ces mêmes tests, v4 a été jugé plus expressif dans 65 à 81 % des comparaisons selon le concurrent. Côté latence, ElevenLabs rapporte que Turbo commence à parler en 150 millisecondes, contre 262 millisecondes pour Cartesia Sonic 3.6, et 814 millisecondes pour GPT-4o mini TTS d’OpenAI. Selon les benchmarks internes d’ElevenLabs, v4 Turbo démarre la parole beaucoup plus rapidement que les autres modèles testés.
Capacités : 10 000 caractères, 90+ langues et clonage relancé
Avec la version 4, ElevenLabs annonce une exécution plus fidèle des consignes ainsi qu’une voix plus stable lors de la génération de contenus longs. Cette itération couvre désormais plus de 90 langues et propose une amélioration du clonage vocal. Elle permet de traiter jusqu’à 10 000 caractères par demande et offre une gestion plus précise des rires, chuchotements et effets sonores par rapport à la v3, qui intégrait déjà ces balises mais avec une exactitude moindre. La société décrit une architecture analysant ton, rythme et contexte, avec des instructions possibles via balises, phrases simples et orthographe phonétique, et des contrôles de prononciation annoncés comme plus fiables. Les voix de narrateurs et personnages sont censées rester cohérentes même après plusieurs régénérations de répliques. Selon ElevenLabs, 10 000 caractères correspondent à environ dix minutes d’audio et les œuvres longues s’assemblent en segments dont le rythme doit demeurer constant. En dialogue, les locuteurs IA tiennent compte du contexte de scène. Par rapport aux quelque 70 langues de v3, v4 dépasse désormais 90. Les clones devraient parler d’autres langues avec des accents natifs sans dérive temporelle. Les clones professionnels redeviennent disponibles et le Clone Vocal Instantané ne requiert que dix secondes d’audio.
Turbo vise les usages en direct avec une nouvelle architecture
La variante v4 Turbo cible les agents vocaux et répond, selon ElevenLabs, en 150 millisecondes, une valeur annoncée comme supérieure à la concurrence. L’éditeur indique avoir conçu une nouvelle architecture pour permettre l’usage en temps réel, et observe un démarrage de la parole autour de 150 millisecondes. Cette déclinaison est destinée aux appels de service client ou aux personnages de jeux, avec l’objectif de ne plus choisir entre vitesse et expressivité. ElevenLabs précise avoir optimisé Turbo en lien avec sa plateforme ElevenAgents.
Voix sous licence et monétisation pour les acteurs
ElevenLabs présente des clones de voix de haute qualité comme adaptés au doublage, y compris l’usage d’une même voix d’acteur dans toutes les langues supportées. La société détient des licences pour les voix des personnes qui les enregistrent. Les acteurs vocaux peuvent proposer un clone largement entraîné de leur voix dans la bibliothèque d’ElevenLabs et recevoir des revenus lorsqu’il est utilisé par des clients payants. Un marché dédié donne déjà accès à des voix de célébrités, comme celle de Michael Caine.
Tarifs en baisse jusqu’au 12 octobre et accès immédiat
L’API est facturée 80 $ par million de caractères pour v4 et 40 $ pour Turbo, avec une réduction temporaire à 22 $ et 11 $ jusqu’au 12 octobre. Les abonnés au plan Creator à 22 $ par mois ou plus peuvent utiliser v4 dans ElevenCreative sans coût additionnel pendant deux semaines, dans la limite du double de leurs crédits mensuels, d’après ElevenLabs. À titre de comparaison, Artificial Analysis référence Sonic 3.6 à 49 $ par million de caractères et Gemini 3.8 Flash TTS à 16,49 $. Les modèles v4 et v4 Turbo sont accessibles dès maintenant dans ElevenAgents, ElevenCreative et via l’API.
Résidence des données et autre lancement en audio génératif
Par défaut, ElevenLabs stocke les données clients aux États-Unis. Les entreprises peuvent opter pour des environnements isolés dans l’UE, en Inde ou à Singapour, avec la possibilité que certains traitements se déroulent hors de la région choisie. Dans l’UE, un mode sans conservation des données permet de maintenir le traitement API au sein de la région. Parallèlement, l’éditeur a lancé Music 2.5 à la mi-septembre, un modèle conçu pour produire des chansons plus denses et au rendu plus naturel.


