Malgré des levées considérables et des lancements à cadence soutenue, des cadres de PolyAI et d’Otter estiment que la voix n’a pas atteint le niveau de bascule observé avec ChatGPT. Ils pointent des obstacles concrets, de la précision de l’ASR à l’expression d’émotions, et défendent davantage de transparence dans les usages.
La fiabilité et la transparence restent des angles morts
Les assistants vocaux peinent encore à comprendre correctement leurs interlocuteurs et les outils de prise de notes peuvent produire des transcriptions ou des résumés erronés. Shawn Wen attribue une part du problème aux modèles de reconnaissance de la parole qui omettent des mots-clés, au détriment du contexte complet. Alex Gay juge que la langue elle-même demeure un axe d’amélioration pour ces modèles. Il prévient qu’une transcription initiale insuffisamment précise dégrade toutes les actions de suivi et mine la confiance des utilisateurs, d’où, selon lui, la nécessité de poursuivre l’amélioration de l’ASR en raison d’impacts en aval significatifs. Les responsables plaident aussi pour davantage de transparence : les outils devraient signaler l’enregistrement et l’usage d’une IA. Otter veut instaurer la confiance en notifiant dans le chat l’enregistrement d’une réunion, y compris sans bot présent. Shawn Wen souligne enfin qu’il est important d’indiquer clairement aux appelants en entreprise qu’ils s’adressent à une IA. Ces prises de position ont été formulées sur scène lors de la conférence HumanX le mois dernier.
Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Naturalité de la voix et nouveaux usages au cœur des feuilles de route
Après le jalon du full-duplex, Shawn Wen place le prochain défi dans l’accélération du raisonnement pour fournir des réponses rapides et rendre l’échange fluide. Il estime que des agents en service client doivent éviter un ton robotique et inspirer suffisamment de confiance pour que les appelants considèrent qu’un problème peut être résolu. Il ajoute que si la qualité vocale permet deux ou trois tours d’échanges confortables et si l’agent résout la demande, le besoin de parler à un humain peut diminuer. Chez Otter, Alex Gay identifie comme étapes clés l’identification des intervenants, la capture des intentions et une transcription enrichie par les connaissances de l’organisation. L’entreprise travaille aussi sur des jumeaux numériques capables de représenter des personnes en réunion, avec un impératif : une voix de sortie qui exprime les émotions d’une conversation humaine. Sans capacité à débattre ni relation ressentie, un avatar resterait, selon lui, un simple chatbot de questions-réponses. La transcription n’est pour Otter qu’une base destinée à générer des gains de productivité.
Un marché foisonnant, mais pas d’« instantané ChatGPT »
Le secteur attire des milliards de dollars, depuis les bâtisseurs de modèles jusqu’aux applications en service client, à la prise de notes de réunion et à la dictée. Les annonces se succèdent chaque semaine et promettent des voix et des dialogues proches de l’humain. Pour autant, Shawn Wen considère que la voix n’a pas vécu l’onde de choc observée avec ChatGPT. Le développement de modèles full-duplex marque un jalon technique, mais il ne suffit pas, à lui seul, à produire ce basculement.




