L’IA créative te passionne ?
Image, vidéo, son, design génératif : le meilleur chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Alibaba Qwen Audio 3.0 TTS Plus domine le classement vocal
Le nouveau modèle de synthèse vocale d'Alibaba, Qwen-Audio-3.0-TTS-Plus, domine le classement des voix de fournisseurs dans le tableau de bord de Artificial Analysis. Avec un score Elo de 1 236, il devance de justesse Simba 3.2 (1 234). Gemini 3.1 Flash TTS (1 214) et Sonic 3.5 (1 207) suivent derrière.
Le modèle se décline en deux versions. Flash est conçu pour une interaction en temps réel avec environ 300 millisecondes de latence, tandis que Plus vise une sortie vocale de haute qualité. Il prend en charge 16 langues, y compris des langues moins couramment couvertes comme le tagalog, le malais, le thaï et le vietnamien, ainsi que plusieurs dialectes chinois. Les utilisateurs peuvent orienter le style de parole avec un langage naturel ou ajouter des indices non verbaux à l'aide de balises telles que "[en colère]" ou "[rire]". Alibaba affirme également que le modèle gère mieux les enregistrements de référence bruyants ou réverbérants que les versions précédentes lors du clonage de voix.
La vitesse est un point faible : avec 16 caractères par seconde, il est largement distancé par Sonic 3.5 (120) et Simba 3.2 (30,2). Le prix est de 27,60 $ par million de caractères via Alibaba Cloud Model Studio. Une collection d'échantillons audio est disponible.


