Brief IA

Alibaba baisse jusqu’à 95 % les tarifs audio IA

🎨 Creative AI·Tom Levy·

Alibaba baisse jusqu’à 95 % les tarifs audio IA

Alibaba baisse jusqu’à 95 % les tarifs audio IA
Key Takeaways
1Alibaba réduit les prix de ses services audio IA, avec des baisses allant jusqu'à 95 % pour l'ASR
2Qwen-Audio-3.1 introduit cinq modèles couvrant reconnaissance vocale, synthèse et interaction en temps réel
3Les nouveaux modèles ajoutent la détection d'émotions, la gestion multilingue et des fonctions avancées de synthèse
💡Why it mattersCes évolutions rendent les technologies audio IA d'Alibaba plus accessibles et enrichissent les fonctionnalités pour les utilisateurs.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Alibaba annonce des baisses de prix importantes sur ses services audio IA, avec des réductions allant jusqu'à 95 % pour la reconnaissance vocale. En parallèle, Qwen-Audio-3.1 introduit cinq nouveaux modèles couvrant la reconnaissance, la synthèse et l'interaction en temps réel, avec des fonctions étendues pour l'ASR, le TTS et les agents vocaux.

Tarifs en chute pour TTS, temps réel et ASR

Alibaba revoit à la baisse les prix de ses services audio IA. Les tarifs de la synthèse vocale diminuent d'environ 70 %, ceux des capacités d'interaction en temps réel d'environ 85 %, et la reconnaissance vocale (ASR) baisse jusqu'à 95 %. Ces réductions concernent les catégories TTS, temps réel et ASR.

Reconnaissance vocale : multilingue, dialectes et contexte sonore

Le modèle ASR de Qwen-Audio-3.1 renforce la prise en charge des langues multiples et des différents dialectes, tout en éliminant de façon automatique les mots parasites et les répétitions. La version ASR-Next permet également d’identifier plusieurs intervenants avec des repères temporels, et reconnaît les émotions, les bruits de fond ainsi que les sons de machines.

Synthèse et interaction : diffusion en un passage et réponses adaptées

Pour la synthèse vocale, Qwen propose une génération multilingue avec un transfert vocal naturel entre les langues, et permet de contrôler l'émotion, la vitesse et le style via de simples instructions textuelles. TTS-Next combine un modèle linguistique et une méthode de diffusion pour générer simultanément la voix, les effets sonores et l’arrière-plan audio en une seule étape. Le modèle temps réel autorise la prise de parole et l’écoute en même temps, avec la possibilité d’interrompre instantanément. Selon Qwen, une détection de moral faible entraîne une réponse plus lente et davantage d’empathie. Qwen-Audio-3.1 regroupe ainsi cinq modèles couvrant ces usages, avec des informations complémentaires disponibles sur le blog et sur Qwen Cloud.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.