L’IA créative te passionne ?
Image, vidéo, son, design génératif : le meilleur chaque soir en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Alibaba annonce des baisses de prix importantes sur ses services audio IA, avec des réductions allant jusqu'à 95 % pour la reconnaissance vocale. En parallèle, Qwen-Audio-3.1 introduit cinq nouveaux modèles couvrant la reconnaissance, la synthèse et l'interaction en temps réel, avec des fonctions étendues pour l'ASR, le TTS et les agents vocaux.
Tarifs en chute pour TTS, temps réel et ASR
Alibaba revoit à la baisse les prix de ses services audio IA. Les tarifs de la synthèse vocale diminuent d'environ 70 %, ceux des capacités d'interaction en temps réel d'environ 85 %, et la reconnaissance vocale (ASR) baisse jusqu'à 95 %. Ces réductions concernent les catégories TTS, temps réel et ASR.
Reconnaissance vocale : multilingue, dialectes et contexte sonore
Le modèle ASR de Qwen-Audio-3.1 renforce la prise en charge des langues multiples et des différents dialectes, tout en éliminant de façon automatique les mots parasites et les répétitions. La version ASR-Next permet également d’identifier plusieurs intervenants avec des repères temporels, et reconnaît les émotions, les bruits de fond ainsi que les sons de machines.
Synthèse et interaction : diffusion en un passage et réponses adaptées
Pour la synthèse vocale, Qwen propose une génération multilingue avec un transfert vocal naturel entre les langues, et permet de contrôler l'émotion, la vitesse et le style via de simples instructions textuelles. TTS-Next combine un modèle linguistique et une méthode de diffusion pour générer simultanément la voix, les effets sonores et l’arrière-plan audio en une seule étape. Le modèle temps réel autorise la prise de parole et l’écoute en même temps, avec la possibilité d’interrompre instantanément. Selon Qwen, une détection de moral faible entraîne une réponse plus lente et davantage d’empathie. Qwen-Audio-3.1 regroupe ainsi cinq modèles couvrant ces usages, avec des informations complémentaires disponibles sur le blog et sur Qwen Cloud.


