La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Le modèle de diarisation Nemotron 3 de NVIDIA prend la première place sur le Diarization‑Bench de VoiceArena avec un DER de 14,72 %, devant le système suivant à 19,3 %. Conçu pour le hors‑ligne et le streaming, il gère jusqu’à huit locuteurs et propose des réglages de latence affinables. Son architecture Transformer à 31 couches et ses choix de post‑traitement visent une attribution stable des intervenants, y compris en cas de chevauchements.
Un classement public détaille 14,72 % de DER sur 22 heures
Dans les résultats initiaux du Diarization‑Bench de VoiceArena, Nemotron 3 Diarization s'est classé premier parmi 12 systèmes et 17 configurations évaluées. Le corpus réunissait 139 conversations en anglais, pour environ 22 heures. Avec les discours chevauchants comptabilisés, une VAD générée par les systèmes et sans tolérance de bord, NVIDIA Nemotron 3 Diarization affiche un taux d'erreur de diarisation de 14,72 %, contre 19,3 % pour le suivant, soit une réduction relative d'environ 24 %. Le modèle figure ainsi numéro 1 sur ce classement.
Streaming : stabiliser les étiquettes et choisir la latence
Le streaming complique la préservation de l'attribution des locuteurs, car le système ne traite que de petits morceaux d'audio avec un contexte limité, là où un mode hors ligne examine l'enregistrement complet. Sans mécanisme de mémoire, un locuteur peut changer de canal d'un morceau au suivant, malgré la détection et l'attribution correctes recherchées par tout système de diarisation. Nemotron 3 Diarization applique l'approche Sortformer : les canaux de sortie suivent l'ordre d'arrivée des voix, la première devenant le canal 1, la suivante le canal 2, ce qui stabilise les étiquettes génériques et évite de résoudre des permutations à chaque morceau. Le modèle prévoit des latences d'entrée tampon recommandées de 30,4 s, 1,04 s, 0,64 s et 0,32 s. Des tampons plus courts accélèrent la réponse, tandis qu'un contexte plus large améliore en général la précision et le débit.
Architecture : 31 couches Transformer et sorties par probabilité
Le modèle ingère un flux mono à 16 kHz, converti en caractéristiques Mel avec un pas de 10 ms. Ces caractéristiques sont empilées par huit pour former des trames de 80 ms alimentant un encodeur Transformer à 31 couches doté d'embeddings positionnels rotatifs. Une couche Conv1D remonte ensuite la résolution des prédictions à celle des entrées. Par défaut, la sortie est un tenseur flottant [T, 8] où chaque valeur est la probabilité d'activité d'un locuteur à un instant donné. Cette représentation gère naturellement les chevauchements, avec plusieurs canaux actifs dans une même trame, puis un post‑traitement génère des étiquettes génériques avec horodatages de début et de fin. Jusqu'à huit canaux de locuteurs sont pris en charge ; ces canaux restent anonymes et ne constituent pas des identités, le modèle pouvant signaler qu'un "locuteur_2" a parlé sur un intervalle sans déterminer qui il est.
Entraînement et gain lié aux données David AI
Selon NVIDIA, l'entraînement combine des données publiques et sous licence, incluant des conversations réelles multi‑locuteurs annotées. L'ajout de données fournies par David AI aurait réduit le taux d'erreur de diarisation composite de 0,77 point absolu, passant de 11,19 % à 10,42 %.
À quoi sert la diarisation et comment se mesure l'erreur
La diarisation indique qui parle quand, y compris quand plusieurs personnes interviennent simultanément, et ses horodatages peuvent être combinés à l'ASR pour produire des transcriptions attribuées. Son utilité est tangible dans les recherches, résumés, éléments d'action, analyses de conversation et mémoires d'agents, qui pâtissent de l'absence d'attribution fiable. La précision est évaluée via le DER, défini comme la somme des discours manqués, des faux positifs et des confusions de locuteur, divisée par le temps total de référence des locuteurs. Un discours manqué correspond à une activité de référence non détectée ; un faux positif à une activité détectée sans équivalent en référence ; une confusion à une activité détectée mais attribuée au mauvais locuteur.



