Tu suis la course aux modèles IA ?
Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Deux lancements rapprochés fixent le décor de la transcription automatique. Google met à jour sa gamme avec Gemini 3.5 Transcribe, tandis qu’OpenAI pousse GPT‑Transcribe et son mode live. Entre coûts affichés, métriques publiées et fonctions comme la diarisation, les arbitrages diffèrent.
Tarifs connus chez OpenAI et absence de grille publique chez Google
OpenAI affiche des prix détaillés pour GPT-Transcribe : la transcription de fichiers est facturée 0,0045 $ la minute, tandis que le streaming audio revient à 0,017 $ la minute. Selon OpenAI, GPT-Transcribe est proposé à un tarif par minute inférieur de 25 % à celui de la version précédente. Le tableau comparatif rappelle ces chiffres et précise que Google n’a pas publié de tarification par minute, ni pour le streaming ni pour le traitement de fichiers.
Choisir selon l’attribution des locuteurs et l’horodatage
Gemini 3.5 Transcribe propose une attribution intégrée des intervenants, fiable jusqu’à trois personnes, ainsi que des horodatages au niveau des mots sans recourir à un modèle séparé. Le tableau indique que Gemini permet la diarisation jusqu’à trois locuteurs, tandis que la variante standard de GPT‑Transcribe n’inclut ni diarisation ni horodatages ; ces fonctions nécessitent gpt‑4o‑transcribe‑diarize, ou whisper‑1 pour les horodatages. Dans ce contexte, Gemini est présenté comme l’option la plus adaptée aux réunions, journaux d’appels et autres scénarios multi-intervenants, évitant un appel de modèle supplémentaire que la pile d’OpenAI requiert encore. GPT-Transcribe est mis en avant pour des transcriptions simples à un seul intervenant ou du sous-titrage en direct sans attribution.
Performances publiées : WER et couverture de langues
Pour Gemini 3.5 Transcribe, des mesures d’Artificial Analysis citées par Google indiquent un taux d’erreur de mots (WER) de 4,0 % en streaming et 2,6 % en non‑streaming. Google publie aussi des résultats sur le benchmark FLEURS avec 5,50 % en streaming et 5,04 % en non‑streaming. Pour GPT‑Transcribe, OpenAI rapporte, sur Common Voice et 22 langues, un WER passant de 40,37 % avec whisper-1 à 19,27 %. Le tableau récapitule ces chiffres. Côté langues, Gemini 3.5 annonce la prise en charge de plus de 85 langues ; le tableau mentionne également des indices de mots-clés et de langues sur un périmètre de 22 langues évaluées.
Cas d’usage : réunion à trois voix et sous-titrage en direct
Un exemple pour Gemini 3.5 Transcribe consiste à transcrire l’enregistrement d’une réunion à trois personnes : l’envoi des octets audio avec une instruction en langage naturel produit une transcription segmentée par intervenant et horodatée, exploitable directement par un pipeline d’analyse. Pour un événement en direct où la latence est prioritaire, le mode gpt‑live‑transcribe d’OpenAI utilise une connexion WebSocket persistante. Les transcriptions partielles arrivent sous forme d’événements delta pendant que l’orateur parle, chaque fragment audio étant ajouté à un tampon puis converti en texte incrémental dès que le système le juge suffisamment confiant.
Architecture et variantes : héritages et recommandations
Chez OpenAI, Whisper était le modèle de transcription ouvert initial, remplacé en mars 2025 par gpt‑4o‑transcribe, premier modèle bâti sur l’architecture GPT‑4o. GPT‑Transcribe, lancé fin juillet 2026, poursuit cette lignée, avec une recommandation officielle d’OpenAI par rapport à whisper‑1, gpt‑4o‑transcribe et gpt‑4o‑mini‑transcribe pour la parole enregistrée. Il existe aussi en version streaming, gpt‑live‑transcribe, pour des sessions à faible latence. Google segmente également son offre : gemini‑3.5‑transcribe‑live pour le streaming, avec une latence cible sous la seconde via l’API Live, et gemini‑3.5‑transcribe pour l’audio préenregistré via l’API Interactions.
Accélération, intégrations et fonctions de suivi chez Google
Google annonce une amélioration de 70 % du temps de transcription finale par rapport à Chirp 3, en plus d’un gain de précision. Gemini 3.5 est en mesure de confier à d’autres modèles Gemini, via l’appel de fonctions, des opérations de suivi telles que la génération d’images ou l’analyse de fichiers, cette option étant accessible dans l’application macOS. L’ajout du vocabulaire personnalisé vient compléter cette offre axée sur l’intégration.





