La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un nouveau classement open-source de la synthèse vocale mise sur des mesures objectives et un protocole de streaming explicite. Il couvre plusieurs langues, compare le clonage de voix et ouvre la porte aux retours de la communauté, sans se substituer aux préférences humaines.
Le streaming classé par TTFA sur prompts partagés et H200
Le classement compare les capacités de streaming à l'aide du temps jusqu'à la première audio (TTFA), qui mesure l'attente avant qu'un son soit jouable, un critère mis en avant pour les agents vocaux et autres usages interactifs. Pour les modèles disposant d'une API de streaming, le TTFA est le délai jusqu'à l'arrivée du premier morceau audio, tandis que pour les modèles sans streaming il correspond à la génération complète de l'énonciation. Tous les modèles sont évalués en taille de lot 1 sur les mêmes 50 prompts anglais de CV3-Eval, dans leur voix par défaut et sur un matériel identique ; les trois premières exécutions servent d'échauffement et sont exclues, puis le TTFA médian est reporté. La vue par défaut présente les résultats sur un GPU H200, et des mesures CPU sont disponibles pour un ensemble restreint mais en augmentation. kyutai/pocket-tts est cité comme performant en streaming sur GPU et CPU. Les scripts d'évaluation doivent par ailleurs être prochainement ouverts, avec contributions via GitHub.
Des métriques objectives pour intelligibilité, vitesse et timbre
Le tableau de bord s'appuie sur des métriques objectives couvrant plusieurs facettes. L'intelligibilité est mesurée via WER et CER entre le texte et la transcription de l'audio généré, en utilisant Qwen3 ASR présenté comme le meilleur modèle open-source sur un classement ASR. La vitesse combine le RTFx pour l'inférence hors ligne par lots sur GPU H200 et le TTFA pour la latence en streaming sur GPU et CPU H200. La similarité de locuteur s'appuie sur la similarité cosinus entre embeddings WavLM d'un échantillon généré et d'un clip de référence. Selon les promoteurs du projet, ces métriques ramènent l'évaluation de quelques semaines à quelques heures. Le dispositif ne prétend pas remplacer les jugements humains : WER et similarité de locuteur n'évaluent ni naturalité ni expressivité ni préférence. Les résultats chiffrés peuvent toutefois aider des classements par vote à sélectionner les modèles à inclure.
Hexgrad, Supertone et fishaudio en tête selon le WER macro-moyenné
Par défaut, les modèles sont ordonnés selon un WER macro-moyenné sur l’anglais, en combinant Seed TTS Eval et CV3 Eval en zero shot. Sur ce critère, hexgrad/Kokoro-82M, Supertone/supertonic-3 et fishaudio/s2-pro arrivent en tête, et des graphiques de Pareto montrent les compromis entre WER, RTFx et taille. La performance anglaise ne se généralise pas toujours, ce qui permet d’activer plusieurs langues dans le classement. Seed TTS Eval ne couvre que l’anglais et le chinois ; pour les autres langues, les scores proviennent de CV3 Eval en zero shot. Pour le chinois, le japonais et le coréen, la mesure reportée est le CER, et la moyenne interculturelle est une macro-moyenne. Côté multilingue, k2-fsa/OmniVoice, fishaudio/s2-pro et FunAudioLLM/Fun-CosyVoice3-0.5B-2512 sont signalés comme solides. En activant le clonage de voix, le tableau ajoute une colonne SIM et deux Pareto supplémentaires pour visualiser les arbitrages avec l’inférence par lots et la taille. Dans ce mode, certains modèles comme bosonai/higgs-tts-3-4b et openbmb/VoxCPM2 voient leur WER moyen s’améliorer lorsqu’un audio de référence est fourni.
Un onglet permet d’écouter et de comparer les synthèses vocales
Un onglet Écouter permet d’entendre les sorties qui fondent les métriques afin de comparer concrètement les modèles. L’utilisateur choisit langue ou dataset, décide d’inclure le clonage de voix et peut sélectionner des modèles ou se laisser guider par une sélection aléatoire. Cet espace est présenté comme comblant un manque des classements existants, en offrant l’exploration d’un large éventail de sorties. Des retours peuvent être laissés sur les audios ; si suffisamment de votes communautaires sont collectés, ces données pourraient être intégrées au classement. Pour réduire les spams et bots, il est demandé de se connecter avec un compte Hugging Face. Les responsables affirment vouloir un dispositif façonné par la communauté et sollicitent des suggestions sur les datasets, modèles et métriques à inclure.
Pourquoi un nouveau classement et sur quoi il se concentre
L'évaluation TTS est décrite comme morcelée, alors même que plus de 8000 modèles sont référencés au 30 septembre 2026 sur le Hub. Les arènes de comparaison, basées sur des duels évalués par des utilisateurs puis notés en Elo via des modèles comme Bradley–Terry, sont accusées de mal suivre le rythme des sorties. Au 30 septembre 2026, parmi les 92 modèles recensés par Artificial Analysis, seuls 16 disposent de poids ouverts, un constat de biais analogue étant relevé sur Voice Arena. Plusieurs raisons pratiques sont avancées : l’ajout via une clé API se révèle aisé, alors qu’un modèle open nécessite d’être hébergé et servi par l’opérateur, et les fournisseurs commerciaux sont plus motivés à obtenir un classement. Il n’existe aucune assurance quant à la stabilité des votants au fil du temps, et leurs préférences sont susceptibles de changer. En réaction, l’Open TTS Leaderboard s’est construit autour de modèles open-source peu visibles dans les arènes et met l’accent sur l’évaluation multilingue, la performance en anglais n’étant pas considérée comme un bon substitut pour d’autres langues.





