La recherche en IA te passionne ?
Les papers et avancées qui comptent, expliqués simplement, chaque soir. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Une avancée majeure dans la traduction vocale avec Gemini 3.5
Google a récemment lancé Gemini 3.5 Live Translate, un modèle audio innovant qui permet de traduire des conversations en temps quasi réel dans plus de 70 langues. Cette technologie représente une avancée significative dans le domaine de la traduction vocale, en offrant une expérience utilisateur plus fluide et naturelle.
Depuis ses débuts il y a vingt ans, Google a fait de la traduction l'un de ses principaux champs d'innovation en matière d'apprentissage automatique. Aujourd'hui, avec Gemini 3.5 Live Translate, l'entreprise franchit une nouvelle étape en proposant un modèle capable de traduire un trillion de mots chaque mois pour des milliards d'utilisateurs à travers le monde.
Des traductions vocales en temps réel
Le modèle Gemini 3.5 se distingue par sa capacité à détecter automatiquement plus de 70 langues et à générer une traduction vocale qui conserve l'intonation et le rythme du locuteur. Contrairement aux systèmes traditionnels qui attendent la fin d'une phrase pour traduire, Gemini 3.5 fonctionne en continu, offrant ainsi une traduction quasi instantanée. Cette approche permet de réduire les pauses gênantes et de maintenir une conversation fluide, avec seulement quelques secondes de décalage par rapport au locuteur.
Déploiement et accessibilité
Dès aujourd'hui, Gemini 3.5 Live Translate est disponible dans plusieurs produits Google. Les développeurs peuvent y accéder via l'API Gemini Live et Google AI Studio en aperçu public, tandis que les entreprises peuvent l'expérimenter en aperçu privé dans Google Meet. De plus, l'application Google Translate sur Android et iOS intègre désormais cette technologie, rendant la traduction vocale accessible à un plus large public.
Une technologie robuste et adaptable
Gemini 3.5 Live Translate est conçu pour traiter la parole en temps réel, même dans des environnements bruyants. Cette robustesse permet d'utiliser le modèle dans divers contextes, tels que les appels multilingues, les réunions, les cours ou les diffusions en direct. Grâce à l'API Gemini Live, des plateformes comme Agora, Fishjam, LiveKit, Pipecat et Vision Agents peuvent développer des applications de traduction vocale sans se soucier de l'infrastructure complexe nécessaire à la diffusion en temps réel.
Des retours positifs des premiers utilisateurs
Des entreprises telles que Grab, CJ ENM et LiveKit ont déjà testé Gemini 3.5 Live Translate et ont exprimé leur satisfaction quant à la qualité des traductions, la précision et la faible latence du modèle. Grab, par exemple, utilise cette technologie pour faciliter la communication entre conducteurs et passagers, avec plus de 10 millions d'appels vocaux par mois.
Améliorations prévues pour Google Meet
Google Meet bénéficiera bientôt de Gemini 3.5 Live Translate, élargissant ainsi son offre de traduction vocale à plus de 70 langues, contre seulement cinq auparavant. Cette mise à jour permettra également des conversations dans plus de 2000 combinaisons linguistiques, dépassant ainsi les limites actuelles de traduction uniquement depuis l'anglais. L'interface de Google Meet sera également mise à jour pour offrir un accès plus rapide à la traduction vocale.
Intégration dans Google Translate
L'application Google Translate sur Android et iOS intègre désormais Gemini 3.5 Live Translate, permettant aux utilisateurs de profiter d'une traduction vocale fluide dans plus de 70 langues. Un nouveau mode d'écoute est également en cours de déploiement pour les utilisateurs Android, permettant d'entendre les traductions directement via l'écouteur du téléphone, sans avoir besoin d'écouteurs externes.
Sécurité et responsabilité avec SynthID
Tous les audios générés par Gemini 3.5 Live Translate sont marqués avec SynthID, un filigrane imperceptible qui garantit que le contenu généré par l'IA peut être détecté. Cette mesure vise à prévenir la désinformation et à assurer la responsabilité dans l'utilisation de cette technologie. Pour plus d'informations sur les pratiques de sécurité de Google, la carte du modèle est disponible pour consultation.


