Brief IA : Alibaba Qwen Audio 3.0 TTS Plus domine le classement vocal

Alibaba Qwen Audio 3.0 TTS Plus domine le classement vocal

Brief IA
Tom Levy·1 min·2 vues

Le Qwen Audio 3.0 TTS Plus d'Alibaba est en tête du classement Speech Arena d'Artificial Analysis avec un score Elo de 1 236, devançant Simba 3.2 (1 234) et Gemini 3.1 Flash TTS (1 214). Ce modèle prend en charge 16 langues et permet un contrôle avancé du style de parole, bien qu'il ait une vitesse de 16 caractères par seconde, inférieure à celle de ses concurrents Sonic 3.5 et Simba 3.2.

En bref
1Le Qwen Audio 3.0 TTS Plus d'Alibaba est en tête du classement Speech Arena d'Artificial Analysis.
2Ce modèle innovant prend en charge 16 langues et offre un contrôle avancé du style de parole.
3Malgré sa domination, sa vitesse de 16 caractères par seconde est inférieure à celle de Sonic 3.5 et Simba 3.2.
💡Pourquoi c'est importantLa performance d'Alibaba dans la synthèse vocale démontre son influence croissante dans le secteur technologique mondial.
Le brief IA que lisent les pros

L’IA créative te passionne ?

Image, vidéo, son, design génératif : le meilleur chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Alibaba Qwen Audio 3.0 TTS Plus domine le classement vocal

Le nouveau modèle de synthèse vocale d'Alibaba, Qwen-Audio-3.0-TTS-Plus, domine le classement des voix de fournisseurs dans le tableau de bord de Artificial Analysis. Avec un score Elo de 1 236, il devance de justesse Simba 3.2 (1 234). Gemini 3.1 Flash TTS (1 214) et Sonic 3.5 (1 207) suivent derrière.

Le modèle se décline en deux versions. Flash est conçu pour une interaction en temps réel avec environ 300 millisecondes de latence, tandis que Plus vise une sortie vocale de haute qualité. Il prend en charge 16 langues, y compris des langues moins couramment couvertes comme le tagalog, le malais, le thaï et le vietnamien, ainsi que plusieurs dialectes chinois. Les utilisateurs peuvent orienter le style de parole avec un langage naturel ou ajouter des indices non verbaux à l'aide de balises telles que "[en colère]" ou "[rire]". Alibaba affirme également que le modèle gère mieux les enregistrements de référence bruyants ou réverbérants que les versions précédentes lors du clonage de voix.

La vitesse est un point faible : avec 16 caractères par seconde, il est largement distancé par Sonic 3.5 (120) et Simba 3.2 (30,2). Le prix est de 27,60 $ par million de caractères via Alibaba Cloud Model Studio. Une collection d'échantillons audio est disponible.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires