Brief IA : Microsoft AI lance MAI-Transcribe-2 et MAI-Voice-2.1

Microsoft AI lance MAI-Transcribe-2 et MAI-Voice-2.1

Brief IA
Tom Levy·2 min·2 vues

Microsoft AI lance MAI-Transcribe-2-Streaming pour la transcription en temps réel Deux nouveaux modèles de synthèse vocale, dont MAI-Voice-2.1, couvrent 23 langues Les modèles sont proposés à des tarifs d'introduction et accessibles sur plusieurs plateformes.

⚡
En bref
1Microsoft AI lance MAI-Transcribe-2-Streaming pour la transcription en temps réel
2Deux nouveaux modèles de synthèse vocale, dont MAI-Voice-2.1, couvrent 23 langues
3Les modèles sont proposés à des tarifs d'introduction et accessibles sur plusieurs plateformes
💡Pourquoi c'est important — Ces nouveautés renforcent l'offre de Microsoft AI pour les agents conversationnels, en combinant rapidité, multilinguisme et dispositifs de sécurité pour le clonage vocal.
⚡Le brief IA que lisent les pros

L’IA créative te passionne ?

Image, vidéo, son, design génératif : le meilleur chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Microsoft AI ajoute un transcripteur temps réel et deux voix de synthèse à son catalogue pour agents conversationnels. L’entreprise revendique des temps de réponse très faibles, un large support de langues et des mesures de sécurité pour encadrer le clonage vocal, avec des tarifs promotionnels et une large distribution.

Clonage vocal encadré et naturalité perçue en test

Les deux modèles de synthèse vocale de Microsoft AI sont capables de reproduire une voix à partir de quelques secondes d'audio de référence. Microsoft AI précise avoir intégré des mesures de sécurité pour limiter les usages abusifs. Lors d'une expérimentation, environ la moitié des 4 000 personnes sollicitées ont estimé que les voix générées étaient celles d'un humain.

Performances annoncées en transcription et synthèse

Microsoft AI a présenté MAI-Transcribe-2-Streaming, un système de transcription instantanée que la société affirme être en tête du classement de précision établi par Artificial Analysis. Ce système couvre 60 langues et affiche ses premiers résultats intermédiaires en un peu plus de 100 millisecondes, ce qui offrirait la possibilité à un agent vocal d'intervenir pendant que l'utilisateur s'exprime encore. Deux modèles supplémentaires de synthèse vocale sont mis à disposition : MAI-Voice-2.1, conçu pour s'exprimer dans 23 langues avec la même voix et un accent natif pour chacune, et sa variante MAI-Voice-2.1-Flash, annoncée avec une latence de 150 millisecondes.

Plateformes de disponibilité et tarifs annoncés

MAI-Transcribe-2-Streaming est proposé à 0,54 dollar par heure d'audio jusqu'à la fin de l'année, en tarif d'introduction. Pour la synthèse vocale, MAI-Voice-2.1-Flash est facturé 15 dollars par million de caractères, contre 22 dollars pour l'autre grille tarifaire. Les modèles sont accessibles via Microsoft Foundry et MAI Playground, et les deux modèles vocaux sont également disponibles sur OpenRouter.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires