La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Google présente Gemini 3.5 Transcribe, un modèle de reconnaissance vocale destiné aux interactions à la voix. L'offre arrive en aperçu public pour les développeurs et les entreprises, avec une disponibilité grand public qui commence sur macOS et Android et doit s'étendre à Chrome. Le modèle revendique des gains de précision et de latence par rapport à Chirp 3 et couvre plus de 85 langues.
Développeurs et entreprises accèdent à l’aperçu public
Gemini 3.5 Transcribe est proposé en aperçu public via l’API Gemini dans Google AI Studio et via Google Antigravity pour les développeurs. Les entreprises peuvent y accéder en aperçu public via la plateforme Gemini Enterprise Agent, avec une disponibilité annoncée bientôt dans Gemini Enterprise pour l’expérience client. Côté grand public, l’accès est ouvert dans l’application Gemini sur macOS en anglais et via Rambler sur Android dans certains pays et langues. Une arrivée sur Chrome est prévue prochainement.
Précision mesurée et latence en progrès face à Chirp 3
Selon Analyse Artificielle, le modèle atteint un taux d’erreur moyen de 4.0% en streaming et de 2.6% hors streaming, et montre de bonnes performances en environnement bruyant, y compris sur des entités alphanumériques. Google présente ces résultats comme une avancée majeure par rapport à Chirp 3, avec de nouvelles capacités, de meilleurs taux d’erreur et une latence sensiblement améliorée. Mesuré par Analyse Artificielle, le temps de transcription final s’améliore de 70%. Sur le benchmark FLEURS, le modèle améliore Chirp 3 et affiche un taux d’erreur de 5.50% en mode streaming et de 5.04% hors streaming.
Deux API distinguent streaming à <1 s et audio préenregistré
L’offre repose sur deux interfaces. L’API de streaming Live, consommée via le modèle gemini-3.5-transcribe-live, fournit un flux bidirectionnel continu pour des applications vocales interactives, avec une latence inférieure à une seconde. Pour l’audio préenregistré, l’API Interactions, via le modèle gemini-3.5-transcribe, prend en charge la transcription d’enregistrements, de réunions et de journaux d’appels, avec attribution des locuteurs et horodatage au niveau des mots.
Le modèle adapte la transcription au style de parole naturel
Le modèle gère les auto‑corrections, élimine les mots de remplissage et formate automatiquement le texte. Il capture le style de parole naturel pour mieux comprendre l’intention et s’adapte à un vocabulaire personnalisé, tout en gérant les changements de langue en direct. La couverture s’étend à plus de 85 langues et prend en compte accents et dialectes. En audio préenregistré, la diarisation est proposée jusqu’à trois locuteurs, le support au‑delà étant expérimental. Le modèle peut déléguer des tâches à d’autres modèles Gemini via des appels de fonction, une capacité disponible dans l’application macOS.
Intégrations: Gboard, Antigravity, AI Studio et app macOS
Google indique avoir déjà observé des bénéfices utilisateurs via l’app Gemini et sur Android, avec Rambler. Sur Gboard Android, Rambler transforme la parole en texte bien formaté, filtre les mots de remplissage et permet d’éditer, corriger et changer de style à la voix. Sur Google Antigravity, le modèle exploite, avec permission, le contexte d’écran et l’historique des échanges pour optimiser la transcription, y compris sur les noms de fichiers, pensées d’agents et documents ouverts. Dans AI Studio, 3.5 Transcribe est accessible en mode Build pour coder des applications en temps réel à la voix. Dans l’app Gemini sur macOS, au‑delà de la transcription proprement dite, des commandes vocales s’alignent sur le contexte d’écran pour des flux complexes, en appelant d’autres modèles Gemini pour synthétiser des fichiers locaux, réutiliser du texte entre applications ou générer des images directement au curseur, uniquement à la voix.



