Whisper auto-hébergé : percée dans la transcription médicale

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Optimisation de Whisper auto-hébergé sur la parole médicale allemande
Un défi pour la transcription médicale
Dans le domaine de l'intelligence artificielle appliquée à la médecine, une idée largement répandue est que les services de transcription vocale hébergés dans le cloud offrent le meilleur niveau de précision. Cependant, cette perception est remise en question par les récentes avancées dans les systèmes auto-hébergés, notamment pour la transcription de consultations médicales en langue allemande. Une étude a démontré que ces systèmes peuvent non seulement rivaliser avec les solutions cloud, mais aussi les surpasser en termes de précision tout en garantissant la confidentialité des données. Par exemple, AWS Transcribe, un service de transcription cloud, atteint un rappel de 0,82 pour les termes médicaux. En comparaison, un modèle de parole auto-hébergé, bien que généraliste, atteint un rappel de 0,75. Mais c'est un pipeline auto-hébergé en couches qui se distingue avec un rappel de 0,91, dépassant ainsi la référence cloud tout en gardant les fichiers audio sous contrôle local.
Contexte et contraintes du projet
L'objectif de ce projet est de développer un scribe médical ambiant pour les pratiques médicales en Allemagne. Ce système doit être capable d'écouter les consultations, de les transcrire et de produire des notes cliniques structurées ainsi que des codes de facturation. Deux contraintes majeures ont guidé le développement de ce système : premièrement, il doit fonctionner sur site, ce qui signifie que l'audio ne peut quitter les locaux de la pratique médicale, excluant ainsi l'utilisation de services de transcription cloud. Deuxièmement, les erreurs de transcription dans ce contexte sont critiques, car elles peuvent avoir des conséquences cliniques graves, comme la mauvaise interprétation d'un nom de médicament. Il est donc crucial de mesurer l'exactitude sur le vocabulaire médical spécifique plutôt que sur l'ensemble des mots transcrits. Le défi est de taille : égaler la précision d'un service cloud comme AWS Transcribe, qui atteint un rappel de 0,82 sur les termes médicaux dans des consultations simulées.
Méthodologie d'évaluation rigoureuse
Pour évaluer la performance des modèles, le taux d'erreur moyen des mots n'est pas suffisant. En effet, un modèle peut être très performant sur un allemand conversationnel tout en échouant sur les termes médicaux, qui sont pourtant cruciaux. L'évaluation se concentre donc sur le rappel des termes médicaux. Deux ensembles de données ont été utilisés pour cette évaluation : une carte de capacité synthétique et une ancre du monde réel. La carte de capacité synthétique comprend 86 termes médicaux allemands, chacun rendu par quatre voix synthétiques dans divers contextes, totalisant 1 376 extraits par modèle. À travers quatre modèles candidats, 5 504 transcriptions ont été notées. L'ancre du monde réel se compose de cinq consultations complètes médecin-patient synthétiques, couvrant 27 termes clés. Cette approche permet de vérifier que les résultats obtenus sur des données synthétiques se maintiennent dans des contextes réels.
Choix du modèle de base
Le choix du modèle de base s'est avéré contre-intuitif. Initialement, un modèle de parole spécialisé pour l'allemand semblait être le meilleur choix pour traiter l'audio médical allemand. Cependant, ce modèle s'est révélé être le moins performant et le plus difficile à améliorer. Lors des tests, il a montré un rappel inférieur de 8 à 10 points sur le vocabulaire médical par rapport aux attentes. De plus, lors d'une consultation riche en médicaments, il a produit environ la moitié des mots par rapport à un modèle général, perdant ainsi une partie significative de la conversation. Deux autres architectures ont été testées mais rejetées : Gemma LLM, qui a échoué sur des audios longs, et NVIDIA Canary, qui n'a pas pu récupérer suffisamment de noms de médicaments. Finalement, c'est le modèle Whisper général qui a été retenu, car il a permis d'améliorer le rappel du modèle unique de 0,65 à 0,73, se rapprochant ainsi de la référence cloud.
Analyse des erreurs et ajustements
Les erreurs de transcription ne sont pas uniformes et leur analyse est cruciale pour cibler les améliorations. Les noms de marques et les ingrédients de médicaments sont les catégories les plus problématiques pour chaque modèle. En revanche, les diagnostics, les valeurs de laboratoire et l'anatomie sont généralement bien transcrits par les modèles compétents. Un petit nombre de termes, notamment des anticoagulants et des antidiabétiques, échappent à tous les modèles testés, y compris le service cloud. Cette distribution des erreurs a influencé la conception de l'architecture finale, qui utilise le contexte environnant pour améliorer la détection des termes médicaux critiques.
Stratégies d'amélioration et résultats
Pour atteindre un rappel de 0,91, une architecture en couches a été mise en place, intégrant quatre choix de conception délibérés. Le premier choix, bien que contre-intuitif, a été de commencer avec le modèle Whisper ajusté pour l'allemand, qui s'est avéré être le point de départ le plus faible. Cependant, en intégrant des couches supplémentaires et en ajustant le modèle pour mieux capter les termes médicaux spécifiques, le système a pu surpasser la référence cloud. L'utilisation de contextes environnants a permis de récupérer des termes qui auraient autrement été manqués, en particulier dans des phrases complexes ou des consultations riches en termes médicaux. Cette approche a démontré que la précision et la confidentialité ne sont pas mutuellement exclusives, offrant ainsi une solution viable aux pratiques médicales qui souhaitent garder le contrôle de leurs données tout en bénéficiant d'une transcription précise.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.