Fish Audio lève 52M$ pour révolutionner les voix IA

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un marché en pleine expansion pour les modèles vocaux IA
Le secteur des modèles vocaux générés par l'intelligence artificielle connaît une croissance rapide. Les applications créatives nécessitent des voix IA plus expressives, tandis que les entreprises cherchent à automatiser des fonctions comme le support client et les ventes avec des modèles plus contrôlables.
Fish Audio : une réponse aux besoins variés
Installée à Palo Alto, Fish Audio s'efforce de répondre à ces divers besoins grâce à une bibliothèque impressionnante de plus de 15 000 contrôles en langage naturel. Depuis sa création l'année dernière, la startup a attiré plus de 8 millions d'utilisateurs pour ses modèles open source ou hébergés, générant un revenu annuel récurrent de 21 millions de dollars.
Un financement significatif pour soutenir la croissance
Pour soutenir cette dynamique, Fish Audio a annoncé avoir levé 52 millions de dollars lors d'un tour de financement de seed. Ce tour a été dirigé par Coreline Ventures et Capital Today, avec la participation de plusieurs autres investisseurs tels que 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners, et HF0.
Les débuts de Fish Audio et son évolution
Fish Audio a démarré comme un projet personnel de Shijia Liao, ancien chercheur chez Nvidia. Frustré par le manque de voix synthétiques expressives, Liao a développé un modèle vocal sur un seul GPU, qu'il a ensuite partagé en open source. Le dépôt Fish Speech sur GitHub a depuis récolté plus de 31 000 étoiles et est utilisé par des développeurs et créateurs de divers horizons.
Des modèles variés pour des besoins divers
Au cours de l'année écoulée, Fish Audio a lancé cinq modèles différents : quatre pour la génération de discours et un pour la conversion de discours en texte. Bien que trois de ces modèles soient disponibles en open source, le modèle le plus avancé, S2.1 Pro, est accessible uniquement via une API payante.
Offres adaptées aux créateurs et aux entreprises
Fish Audio propose des abonnements mensuels qui permettent aux créateurs d'accéder à un nombre défini de minutes de génération et à des fonctionnalités de clonage vocal. Pour les entreprises, une version dédiée de ses API est disponible, déjà adoptée par des organisations comme HeyGen, Sanas, et LiveKit.
La confiance des créateurs : un enjeu crucial
Rissa Cao, PDG et co-fondatrice de Fish Audio, souligne l'importance de répondre aux besoins spécifiques des entreprises, qu'il s'agisse de réalisme pour des avatars IA ou de voix expressives pour des jeux vidéo. Cependant, la confiance des créateurs est essentielle, surtout après des incidents où des voix ont été téléchargées sans consentement.
Fish Audio a construit sa bibliothèque de voix en sollicitant les utilisateurs pour soumettre leurs propres voix afin d'entraîner ses modèles. Les utilisateurs sont compensés si leurs voix sont utilisées, ce qui a soulevé des préoccupations lorsque certains créateurs ont affirmé que leurs voix avaient été téléchargées sans leur consentement. Pour traiter ces préoccupations, la startup avait initialement mis en place un processus de retrait DMCA, bien que celui-ci ait été jugé lent par certains utilisateurs.
Un processus de retrait automatisé
Pour résoudre ces problèmes, Fish Audio a mis en place un processus automatisé permettant aux créateurs de retirer leurs voix en moins de trois minutes après vérification. Malgré cela, le risque demeure que des voix soient téléchargées à l'insu des artistes.
La communauté au cœur de la stratégie
Osuke Honda de Coreline Ventures insiste sur l'importance de la confiance et de la transparence pour un modèle communautaire durable. Il a déclaré qu'un modèle axé sur la communauté ne fonctionne que lorsque les créateurs font confiance à la plateforme, soulignant la nécessité de conditions de licence claires et de modèles de partage des revenus.
Une vision pour l'avenir
Bien que Fish Audio ait initialement fonctionné sans financement extérieur, l'intérêt croissant des investisseurs a conduit à cette levée de fonds pour développer des modèles plus avancés et élargir sa clientèle. La startup prévoit de lancer un modèle de compréhension audio et un modèle de conversion de discours en discours prochainement.
Un marché compétitif
Le secteur de la génération de discours est très concurrentiel, avec des entreprises comme ElevenLabs, WellSaid, Cartesia, Speechify, Async (anciennement Podcastle), et Krisp. Rico Mallozzi de 359 Capital estime que les contrôles fins et l'entraînement rentable des modèles de Fish Audio lui donneront un avantage concurrentiel.
Conclusion
Fish Audio, avec son financement récent, est bien positionnée pour continuer à innover et à se démarquer dans le domaine des technologies vocales IA, tout en renforçant la confiance des créateurs et des entreprises.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.