Brief IA : Cohere dévoile Transcribe, un modèle vocal open-source révolutionnaire

Cohere dévoile Transcribe, un modèle vocal open-source révolutionnaire

Brief IA
Tom Levy·3 min·0 vues

Cohere a lancé Transcribe, un modèle vocal open-source de transcription avec 2 milliards de paramètres, conçu pour être utilisé sur des GPU de consommation. Il prend en charge 14 langues et affiche un taux d'erreur moyen de mots de 5,42, surpassant plusieurs modèles concurrents. Cette innovation permet aux utilisateurs de l'héberger eux-mêmes, favorisant ainsi l'autonomie et la personnalisation.

En bref
1Cohere a lancé Transcribe, un modèle vocal open-source pour la transcription, prenant en charge 14 langues.
2Transcribe surpasse des modèles concurrents avec un taux d'erreur moyen de mots de 5,42 selon Hugging Face.
3Cohere prévoit d'intégrer Transcribe à sa plateforme North et le rend disponible gratuitement via une API.
💡Pourquoi c'est importantTranscribe pourrait transformer la transcription vocale en démocratisant l'accès à des outils avancés et précis.
Le brief IA que lisent les pros

Tu codes avec l’IA ?

Outils, agents et nouveautés dev IA décryptés, chaque soir en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Cohere dévoile Transcribe, un modèle vocal open-source révolutionnaire

Cohere, une entreprise spécialisée dans l'intelligence artificielle, a récemment introduit un modèle vocal innovant nommé Transcribe. Ce modèle de reconnaissance automatique de la parole est open-source, ce qui signifie qu'il est accessible à tous pour des applications variées telles que la prise de notes ou l'analyse de discours. Cette initiative marque une avancée significative dans le domaine de la transcription vocale.

Le modèle Transcribe se distingue par sa légèreté, avec un total de 2 milliards de paramètres. Cela le rend particulièrement adapté pour être utilisé avec des GPU de niveau consommateur, permettant ainsi à des utilisateurs individuels ou à de petites entreprises de l'héberger eux-mêmes. Transcribe est actuellement capable de traiter 14 langues, couvrant un large éventail linguistique comprenant l'anglais, le français, l'allemand, l'italien, l'espagnol, le portugais, le grec, le néerlandais, le polonais, le chinois, le japonais, le coréen, le vietnamien et l'arabe.

Selon Cohere, Transcribe surpasse plusieurs modèles concurrents tels que Zoom Scribe v1, IBM Granite 4.0 1B, ElevenLabs Scribe v2, et Qwen3-ASR-1.7B Speech. Sur le classement Open ASR de Hugging Face, Transcribe atteint un taux d'erreur moyen de mots (WER) de 5,42, ce qui est inférieur à tous les autres modèles évalués sur cette plateforme. Cette performance exceptionnelle souligne la précision et l'efficacité de Transcribe dans le domaine de la reconnaissance vocale.

En termes de précision, Cohere affirme que Transcribe a obtenu un taux de victoire moyen de 61% lors d'évaluations humaines. Ces évaluations ont pris en compte la précision, la cohérence et l'utilité des transcriptions fournies par le modèle. Cependant, il est important de noter que Transcribe a montré des performances légèrement inférieures dans la transcription de langues telles que le portugais, l'allemand et l'espagnol, par rapport à ses concurrents.

Transcribe est également remarquable par sa capacité à traiter 525 minutes d'audio en une seule minute, ce qui est une performance notable pour un modèle de sa catégorie. Cette rapidité de traitement pourrait révolutionner la manière dont les entreprises et les particuliers gèrent de grandes quantités de données audio.

Cohere envisage d'intégrer Transcribe dans sa plateforme d'orchestration d'agents d'entreprise, appelée North. En outre, le modèle est mis à disposition gratuitement via une API, ce qui facilite son adoption par un large éventail d'utilisateurs. Transcribe sera également accessible sur Model Vault, la plateforme d'inférence gérée par Cohere, renforçant ainsi son accessibilité et son utilisation.

La popularité des modèles de reconnaissance vocale est en pleine expansion, notamment en raison de la demande croissante pour des applications de prise de notes et de dictée comme Granola et Wispr Flow. Cette tendance souligne l'importance croissante de la transcription vocale dans divers secteurs.

Plus tôt cette année, Cohere a informé ses investisseurs de ses ambitions de croissance, prévoyant un chiffre d'affaires récurrent annuel de 240 millions de dollars d'ici 2025. Le PDG de Cohere, Aidan Gomez, a également laissé entendre que l'entreprise pourrait envisager une entrée en bourse dans un avenir proche, ce qui pourrait marquer une nouvelle étape dans l'évolution de la startup.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires