Brief IA : Gemini 3.5 et GPT-Transcribe : prix et fonctions clés

Gemini 3.5 et GPT-Transcribe : prix et fonctions clés

Brief IA
Tom Levy·4 min·3 vues

Google a lancé Gemini 3.5 Transcribe et OpenAI a introduit GPT-Transcribe, respectivement en décembre 2023 et novembre 2023. OpenAI propose des tarifs de 0,0045 $ par minute pour la transcription de fichiers et 0,017 $ pour le streaming audio, tandis que Google n'a pas communiqué de grille tarifaire. Les deux modèles diffèrent par leurs fonctionnalités, notamment la diarisation intégrée de Gemini pour trois locuteurs, alors que GPT-Transcribe nécessite un modèle séparé pour cette fonction.

⚡
En bref
1Google et OpenAI lancent à un mois d’intervalle leurs nouveaux modèles de transcription
2OpenAI affiche des tarifs précis et des gains de WER face à Whisper ; Google met en avant la diarisation intégrée et des métriques de précision
3Les cas d’usage diffèrent : réunions multi-intervenants pour Gemini, sous-titrage en direct et coût réduit pour GPT-Transcribe
💡Pourquoi c'est important — Le choix entre ces modèles dépend des besoins en attribution des locuteurs, de la précision attendue et du budget.
⚡Le brief IA que lisent les pros

Tu suis la course aux modèles IA ?

Chaque sortie (GPT, Claude, Gemini, Mistral…) décryptée le soir même, en 5 min. Gratuit.

Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.

Choisis ton rythme

Gratuit · Pas de spam · Désabonnement en 1 clic

📄
L'analyse en français

Deux lancements rapprochés fixent le décor de la transcription automatique. Google met à jour sa gamme avec Gemini 3.5 Transcribe, tandis qu’OpenAI pousse GPT‑Transcribe et son mode live. Entre coûts affichés, métriques publiées et fonctions comme la diarisation, les arbitrages diffèrent.

Tarifs connus chez OpenAI et absence de grille publique chez Google

OpenAI affiche des prix détaillés pour GPT-Transcribe : la transcription de fichiers est facturée 0,0045 $ la minute, tandis que le streaming audio revient à 0,017 $ la minute. Selon OpenAI, GPT-Transcribe est proposé à un tarif par minute inférieur de 25 % à celui de la version précédente. Le tableau comparatif rappelle ces chiffres et précise que Google n’a pas publié de tarification par minute, ni pour le streaming ni pour le traitement de fichiers.

Choisir selon l’attribution des locuteurs et l’horodatage

Gemini 3.5 Transcribe propose une attribution intégrée des intervenants, fiable jusqu’à trois personnes, ainsi que des horodatages au niveau des mots sans recourir à un modèle séparé. Le tableau indique que Gemini permet la diarisation jusqu’à trois locuteurs, tandis que la variante standard de GPT‑Transcribe n’inclut ni diarisation ni horodatages ; ces fonctions nécessitent gpt‑4o‑transcribe‑diarize, ou whisper‑1 pour les horodatages. Dans ce contexte, Gemini est présenté comme l’option la plus adaptée aux réunions, journaux d’appels et autres scénarios multi-intervenants, évitant un appel de modèle supplémentaire que la pile d’OpenAI requiert encore. GPT-Transcribe est mis en avant pour des transcriptions simples à un seul intervenant ou du sous-titrage en direct sans attribution.

Performances publiées : WER et couverture de langues

Pour Gemini 3.5 Transcribe, des mesures d’Artificial Analysis citées par Google indiquent un taux d’erreur de mots (WER) de 4,0 % en streaming et 2,6 % en non‑streaming. Google publie aussi des résultats sur le benchmark FLEURS avec 5,50 % en streaming et 5,04 % en non‑streaming. Pour GPT‑Transcribe, OpenAI rapporte, sur Common Voice et 22 langues, un WER passant de 40,37 % avec whisper-1 à 19,27 %. Le tableau récapitule ces chiffres. Côté langues, Gemini 3.5 annonce la prise en charge de plus de 85 langues ; le tableau mentionne également des indices de mots-clés et de langues sur un périmètre de 22 langues évaluées.

Cas d’usage : réunion à trois voix et sous-titrage en direct

Un exemple pour Gemini 3.5 Transcribe consiste à transcrire l’enregistrement d’une réunion à trois personnes : l’envoi des octets audio avec une instruction en langage naturel produit une transcription segmentée par intervenant et horodatée, exploitable directement par un pipeline d’analyse. Pour un événement en direct où la latence est prioritaire, le mode gpt‑live‑transcribe d’OpenAI utilise une connexion WebSocket persistante. Les transcriptions partielles arrivent sous forme d’événements delta pendant que l’orateur parle, chaque fragment audio étant ajouté à un tampon puis converti en texte incrémental dès que le système le juge suffisamment confiant.

Architecture et variantes : héritages et recommandations

Chez OpenAI, Whisper était le modèle de transcription ouvert initial, remplacé en mars 2025 par gpt‑4o‑transcribe, premier modèle bâti sur l’architecture GPT‑4o. GPT‑Transcribe, lancé fin juillet 2026, poursuit cette lignée, avec une recommandation officielle d’OpenAI par rapport à whisper‑1, gpt‑4o‑transcribe et gpt‑4o‑mini‑transcribe pour la parole enregistrée. Il existe aussi en version streaming, gpt‑live‑transcribe, pour des sessions à faible latence. Google segmente également son offre : gemini‑3.5‑transcribe‑live pour le streaming, avec une latence cible sous la seconde via l’API Live, et gemini‑3.5‑transcribe pour l’audio préenregistré via l’API Interactions.

Accélération, intégrations et fonctions de suivi chez Google

Google annonce une amélioration de 70 % du temps de transcription finale par rapport à Chirp 3, en plus d’un gain de précision. Gemini 3.5 est en mesure de confier à d’autres modèles Gemini, via l’appel de fonctions, des opérations de suivi telles que la génération d’images ou l’analyse de fichiers, cette option étant accessible dans l’application macOS. L’ajout du vocabulaire personnalisé vient compléter cette offre axée sur l’intégration.

Suivez Brief IA

L'actu IA du jour, aussi dans votre fil.

Commentaires