Tu veux les meilleurs outils IA avant les autres ?
On teste et on décrypte les nouveaux outils IA chaque soir, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Un dispositif interne permet d’associer des noms réels aux prises de parole des réunions. Il s’appuie sur une transcription anonyme avec Soniox, des embeddings audio comparés par similarité cosinus et un seuil de 80 % pour l’étiquetage automatique. Des modèles Nvidia peuvent fonctionner en local pour comparaison, et des agents de codage accélèrent la mise en œuvre à l’échelle de quelques heures.
Des embeddings audio et un seuil de 80 % pour nommer les voix
Le système commence par isoler les plages temporelles correspondant à chaque intervenant unique afin d’extraire un échantillon audio par personne. Chaque échantillon est ensuite comparé à une base d’échantillons déjà enregistrés. Cette comparaison s’effectue à l’aide d’embeddings audio et d’une mesure de similarité cosinus. Si le score de confiance dépasse 80 %, l’intervenant est automatiquement identifié comme probablement déjà connu. En dessous de ce seuil, l’échantillon est soumis à un étiquetage manuel et ajouté à la base de référence. La transcription anonyme initiale est obtenue avec Soniox, qui, d’après l’expérience décrite, donne de meilleurs résultats que le modèle local dans ce contexte et fournit une précision jugée suffisante dans la plupart des cas.
Choix d’implémentation : Soniox, modèles Nvidia et conversion vers des noms
Le dispositif combine un service en ligne de transcription anonyme et des modèles locaux pour la comparaison. Soniox est utilisé pour la transcription anonyme, apprécié pour sa précision et sa capacité à fonctionner dans plusieurs langues. En parallèle, des modèles Nvidia, déjà employés dans l’application FluidVoice, peuvent être téléchargés pour fonctionner localement et servir de point de comparaison. Le processus vise à convertir la transcription anonyme en transcription nommée. Après quelques étiquetages de référence, le système affiche ses prédictions, permettant à l’utilisateur d’évaluer la précision obtenue.
Rôle des agents de codage : du brief unique à l’application en heures
Les agents de codage permettent de créer des outils internes beaucoup plus rapidement qu’auparavant, réduisant les délais de plusieurs semaines ou mois à quelques minutes ou heures. Fournir une vision détaillée dans une seule invite, en anticipant les choix techniques comme le modèle de transcription et la méthode d’étiquetage, évite des allers-retours inutiles. Il est estimé qu’en 2019, sans agents de codage, une implémentation solide aurait nécessité environ deux jours, sous réserve des capacités des modèles de l’époque. Aujourd’hui, le même objectif peut être atteint en quelques heures avec une grande précision. Cette rapidité modifie aussi l’arbitrage classique entre achat et développement, qui reposait auparavant sur une évaluation détaillée du coût et du temps gagné.
Un besoin métier non couvert et l’intérêt du faire-soi-même
Le cas d’usage concerne la relecture de réunions internes avec des intervenants identifiés par leur nom, et non par des étiquettes anonymes comme c’est souvent le cas dans les outils du marché. L’utilisation de Soniox montre cette limite lorsqu’un seul enregistrement est fourni et qu’aucune référence préalable n’existe pour nommer les voix. N’ayant pas trouvé de service jugé suffisamment robuste pour associer des échantillons audio à des identités, la décision a été prise de développer l’outil en interne. Cette solution offre un contrôle total, une personnalisation précise et une gestion appropriée des données. L’ensemble permet une reconnaissance des intervenants plus efficace et une transcription plus fluide, grâce à l’appui des agents de codage pour adapter l’outil aux besoins exacts.






