Gemini 3.8 TTS s’étend à 2 000 voix, l’Europe privée du clonage

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Google ajoute deux modèles de synthèse vocale à Gemini et promet plus de 2 000 voix dans plus de 100 langues, avec une direction en langage naturel. La réplication de voix reste toutefois bloquée dans de larges zones, dont l’Espace économique européen. Le groupe met parallèlement en avant des classements où ses modèles dominent.
Clonage de voix indisponible en Europe et scores publiés
La duplication de voix n’est pas disponible dans l’Espace économique européen, au Royaume-Uni, en Suisse, en Inde, ainsi que dans les États américains de l’Illinois et du Texas, en raison de réglementations sur les données biométriques. Google a aussi retiré cette fonction en Europe, sans indiquer ce qu’il en est pour la France. Pour les performances, Gemini 3.8 Flash TTS se classe premier au classement général du Voice Design Benchmark de Hume AI avec un score de 71,4, et occupe également la première position pour la modélisation des accents avec 60,8. Selon l’indice de qualité globale de Hume AI, les deux modèles de Google prennent les deux premières places. Dans le classement Voice Arena, Google arrive en tête pour six langues, dont le japonais et l’hindi, mais le français n’est pas mentionné dans ce palmarès. Les résultats mis en avant proviennent du Voice Design Benchmark de Hume AI.
Ce qui change pour les développeurs avec Gemini 3.8 TTS
Le catalogue de voix passe de 30 à plus de 2 000 et couvre plus de 100 langues. Les développeurs peuvent diriger chaque réplique en langage naturel, préciser ton et rythme, et insérer des balises non verbales comme <laughs> et <sigh> ainsi que des interjections telles que « mhm ». Google annonce des progrès sur les contenus longs et les dialogues à deux voix par rapport à Gemini 3.1 Flash TTS. Les scènes à deux interlocuteurs peuvent être gérées au sein d’une seule génération audio, et la stabilité de timbre est maintenue pendant des heures d’enregistrement avec une dérive minimale du locuteur. Les deux modèles sont accessibles via l’API Gemini et dans Google AI Studio.
Produits concernés et disponibilité pour les entreprises
Pour le grand public, Flash TTS est intégré à Gemini Notebook pour générer des résumés audio de documents. Flash-Lite TTS est disponible dans Google Vids, l’outil de création vidéo de Google Workspace. Les entreprises attendent l’arrivée des deux modèles dans l’API Gemini Enterprise. Gemini 3.8 Flash TTS est destiné à la direction artistique et à la création de personnages, tandis que Flash-Lite cible des usages à gros volume et à moindre coût comme le doublage et les agents vocaux. Ces lancements interviennent avec Gemini 3.8 Flash TTS et sa déclinaison, une semaine après Gemini 3.8 Live.
Réplication, consentement et traçabilité des contenus
La reproduction d’une voix existante est possible avec un échantillon audio de 30 secondes, sous réserve d’un consentement oral enregistré du propriétaire de la voix et d’une vérification que ce locuteur correspond à l’échantillon. Tous les fichiers générés comportent un filigrane SynthID invisible et des certificats d’origine C2PA. Une prochaine mise à jour permettra de transformer une voix et d’en ajuster le timbre, la hauteur, la vitesse ou l’accent à partir d’une instruction écrite. Google a embauché Alan Cowen, ex-dirigeant de Hume AI, ainsi que sept ingénieurs dans le cadre d’un accord de licence. Hume AI est spécialisée dans l’IA émotionnelle et la reproduction du timbre et de l’intonation, et Alan Cowen cosigne l’annonce en tant que directeur de recherche scientifique chez Google.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.