Brief IA

Fish Audio lève 52M$ pour révolutionner les voix IA

💼 Business & Startups·Tom Levy·

Fish Audio lève 52M$ pour révolutionner les voix IA

Fish Audio lève 52M$ pour révolutionner les voix IA
Key Takeaways
1Fish Audio, basée à Palo Alto, a levé 52 millions de dollars pour développer des modèles vocaux IA.
2La startup a déjà attiré plus de 8 millions d'utilisateurs et génère 21 millions de dollars de revenus annuels.
3Fish Audio a automatisé le retrait des voix non autorisées, réduisant le délai à trois minutes.
💡Why it mattersCette levée de fonds permet à Fish Audio de renforcer sa position face à une concurrence croissante dans le secteur des technologies vocales IA.
Le brief IA que lisent les pros

Le brief IA que les pros lisent chaque soir

Les 7 actus IA du jour, décryptées en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
Full Analysis

Un marché en pleine expansion pour les modèles vocaux IA

Le secteur des modèles vocaux générés par l'intelligence artificielle connaît une croissance rapide. Les applications créatives nécessitent des voix IA plus expressives, tandis que les entreprises cherchent à automatiser des fonctions comme le support client et les ventes avec des modèles plus contrôlables.

Fish Audio : une réponse aux besoins variés

Installée à Palo Alto, Fish Audio s'efforce de répondre à ces divers besoins grâce à une bibliothèque impressionnante de plus de 15 000 contrôles en langage naturel. Depuis sa création l'année dernière, la startup a attiré plus de 8 millions d'utilisateurs pour ses modèles open source ou hébergés, générant un revenu annuel récurrent de 21 millions de dollars.

Un financement significatif pour soutenir la croissance

Pour soutenir cette dynamique, Fish Audio a annoncé avoir levé 52 millions de dollars lors d'un tour de financement de seed. Ce tour a été dirigé par Coreline Ventures et Capital Today, avec la participation de plusieurs autres investisseurs tels que 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners, et HF0.

Les débuts de Fish Audio et son évolution

Fish Audio a démarré comme un projet personnel de Shijia Liao, ancien chercheur chez Nvidia. Frustré par le manque de voix synthétiques expressives, Liao a développé un modèle vocal sur un seul GPU, qu'il a ensuite partagé en open source. Le dépôt Fish Speech sur GitHub a depuis récolté plus de 31 000 étoiles et est utilisé par des développeurs et créateurs de divers horizons.

Des modèles variés pour des besoins divers

Au cours de l'année écoulée, Fish Audio a lancé cinq modèles différents : quatre pour la génération de discours et un pour la conversion de discours en texte. Bien que trois de ces modèles soient disponibles en open source, le modèle le plus avancé, S2.1 Pro, est accessible uniquement via une API payante.

Offres adaptées aux créateurs et aux entreprises

Fish Audio propose des abonnements mensuels qui permettent aux créateurs d'accéder à un nombre défini de minutes de génération et à des fonctionnalités de clonage vocal. Pour les entreprises, une version dédiée de ses API est disponible, déjà adoptée par des organisations comme HeyGen, Sanas, et LiveKit.

La confiance des créateurs : un enjeu crucial

Rissa Cao, PDG et co-fondatrice de Fish Audio, souligne l'importance de répondre aux besoins spécifiques des entreprises, qu'il s'agisse de réalisme pour des avatars IA ou de voix expressives pour des jeux vidéo. Cependant, la confiance des créateurs est essentielle, surtout après des incidents où des voix ont été téléchargées sans consentement.

Fish Audio a construit sa bibliothèque de voix en sollicitant les utilisateurs pour soumettre leurs propres voix afin d'entraîner ses modèles. Les utilisateurs sont compensés si leurs voix sont utilisées, ce qui a soulevé des préoccupations lorsque certains créateurs ont affirmé que leurs voix avaient été téléchargées sans leur consentement. Pour traiter ces préoccupations, la startup avait initialement mis en place un processus de retrait DMCA, bien que celui-ci ait été jugé lent par certains utilisateurs.

Un processus de retrait automatisé

Pour résoudre ces problèmes, Fish Audio a mis en place un processus automatisé permettant aux créateurs de retirer leurs voix en moins de trois minutes après vérification. Malgré cela, le risque demeure que des voix soient téléchargées à l'insu des artistes.

La communauté au cœur de la stratégie

Osuke Honda de Coreline Ventures insiste sur l'importance de la confiance et de la transparence pour un modèle communautaire durable. Il a déclaré qu'un modèle axé sur la communauté ne fonctionne que lorsque les créateurs font confiance à la plateforme, soulignant la nécessité de conditions de licence claires et de modèles de partage des revenus.

Une vision pour l'avenir

Bien que Fish Audio ait initialement fonctionné sans financement extérieur, l'intérêt croissant des investisseurs a conduit à cette levée de fonds pour développer des modèles plus avancés et élargir sa clientèle. La startup prévoit de lancer un modèle de compréhension audio et un modèle de conversion de discours en discours prochainement.

Un marché compétitif

Le secteur de la génération de discours est très concurrentiel, avec des entreprises comme ElevenLabs, WellSaid, Cartesia, Speechify, Async (anciennement Podcastle), et Krisp. Rico Mallozzi de 359 Capital estime que les contrôles fins et l'entraînement rentable des modèles de Fish Audio lui donneront un avantage concurrentiel.

Conclusion

Fish Audio, avec son financement récent, est bien positionnée pour continuer à innover et à se démarquer dans le domaine des technologies vocales IA, tout en renforçant la confiance des créateurs et des entreprises.

Brief IA — L'actualité IA en français

L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.