Brief IA : Alibaba baisse jusqu’à 95 % les tarifs audio IA

Alibaba baisse jusqu’à 95 % les tarifs audio IA

Brief IA
Tom Levy·2 min·1 vues

Alibaba a réduit les prix de ses services audio IA, avec des baisses allant jusqu'à 95 % pour la reconnaissance vocale (ASR), environ 70 % pour la synthèse vocale (TTS) et 85 % pour les capacités d'interaction en temps réel. Parallèlement, la nouvelle version Qwen-Audio-3.1 introduit cinq modèles améliorés, incluant la détection d'émotions et la gestion multilingue.

En bref
1Alibaba réduit les prix de ses services audio IA, avec des baisses allant jusqu'à 95 % pour l'ASR
2Qwen-Audio-3.1 introduit cinq modèles couvrant reconnaissance vocale, synthèse et interaction en temps réel
3Les nouveaux modèles ajoutent la détection d'émotions, la gestion multilingue et des fonctions avancées de synthèse
💡Pourquoi c'est importantCes évolutions rendent les technologies audio IA d'Alibaba plus accessibles et enrichissent les fonctionnalités pour les utilisateurs.
Le brief IA que lisent les pros

L’IA créative te passionne ?

Image, vidéo, son, design génératif : le meilleur chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Alibaba annonce des baisses de prix importantes sur ses services audio IA, avec des réductions allant jusqu'à 95 % pour la reconnaissance vocale. En parallèle, Qwen-Audio-3.1 introduit cinq nouveaux modèles couvrant la reconnaissance, la synthèse et l'interaction en temps réel, avec des fonctions étendues pour l'ASR, le TTS et les agents vocaux.

Tarifs en chute pour TTS, temps réel et ASR

Alibaba revoit à la baisse les prix de ses services audio IA. Les tarifs de la synthèse vocale diminuent d'environ 70 %, ceux des capacités d'interaction en temps réel d'environ 85 %, et la reconnaissance vocale (ASR) baisse jusqu'à 95 %. Ces réductions concernent les catégories TTS, temps réel et ASR.

Reconnaissance vocale : multilingue, dialectes et contexte sonore

Le modèle ASR de Qwen-Audio-3.1 renforce la prise en charge des langues multiples et des différents dialectes, tout en éliminant de façon automatique les mots parasites et les répétitions. La version ASR-Next permet également d’identifier plusieurs intervenants avec des repères temporels, et reconnaît les émotions, les bruits de fond ainsi que les sons de machines.

Synthèse et interaction : diffusion en un passage et réponses adaptées

Pour la synthèse vocale, Qwen propose une génération multilingue avec un transfert vocal naturel entre les langues, et permet de contrôler l'émotion, la vitesse et le style via de simples instructions textuelles. TTS-Next combine un modèle linguistique et une méthode de diffusion pour générer simultanément la voix, les effets sonores et l’arrière-plan audio en une seule étape. Le modèle temps réel autorise la prise de parole et l’écoute en même temps, avec la possibilité d’interrompre instantanément. Selon Qwen, une détection de moral faible entraîne une réponse plus lente et davantage d’empathie. Qwen-Audio-3.1 regroupe ainsi cinq modèles couvrant ces usages, avec des informations complémentaires disponibles sur le blog et sur Qwen Cloud.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires