Gemini Flash analyse les vidéos par agents, sans surcoût

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Google active une analyse vidéo dite agentique dans plusieurs modèles Gemini Flash. L'entreprise affirme des économies substantielles de tokens et de coûts, avec une disponibilité immédiate via l'API et un déploiement annoncé dans ses produits.
Accès via l’API, périmètre supporté et tarification inchangée
La nouvelle analyse vidéo est utilisable pour des fichiers téléversés et des vidéos YouTube via l’API Gemini, dans Google AI Studio et sur la Gemini Enterprise Agent Platform. Elle sert notamment à retrouver des scènes précises dans de longues vidéos. Les développeurs activent un mode de traitement agentique dans la configuration. Cette option n’entraîne pas de frais additionnels : la facturation suit les tarifs standard de l’API Gemini. Un guide destiné aux développeurs détaille la mise en œuvre.
Économies de tokens et de coûts revendiquées par Google
Google avance jusqu’à 88 % d’économies de tokens et une baisse des coûts de 66 %, tout en parlant d’une précision accrue. Dans ses propres évaluations, incluant LongVideoBench, la société attribue à Gemini 3.7 Flash en mode agentique la meilleure qualité globale et le meilleur compromis entre précision et efficacité des coûts. Dans son évaluation 1H-VideoQA, la même variante atteint, selon Google, la précision la plus élevée pour le coût par requête le plus faible.
Ce que change l’approche agentique dans le traitement vidéo
L’analyse quitte un balayage image par image à cadence fixe pour un parcours piloté par le modèle, qui relie son raisonnement aux outils vidéo natifs. Le modèle choisit les passages, la vitesse d’examen et les modalités mobilisées, qu’il s’agisse d’images, d’audio ou de transcriptions, et ne récupère que les signaux nécessaires. Gemini s’appuie pour cela sur un outil interne capable d’extraire uniquement la portion pertinente du fichier. Là où les développeurs pouvaient autrefois bricoler une sélection semblable, le modèle gère désormais cette boucle de récupération ciblée de manière autonome.
Capacités nouvelles et limites de l’ancien pipeline
Les versions 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite détectent des moments inférieurs à la seconde, y compris des changements d’état ou des coupures difficiles à voir à une cadence d’une image par seconde. Elles localisent des scènes au sein d’heures de vidéo sans recourir à des millions de tokens, rééchantillonnent à cadence plus élevée des fenêtres jugées suspectes et comptent précisément mouvements répétés et objets dans le temps. À l’opposé, l’ancien pipeline utilisait par défaut un échantillonnage statique d’une image par seconde, ce paramètre pouvant être modifié via l’API. Depuis 2025, Gemini effectue une transcription de la piste audio et procède à l’analyse des images chaque seconde.
Origine de la méthode et calendrier d’extension produit
Cette démarche s’inscrit dans la vision agentique introduite pour Gemini 3 Flash en janvier, où le modèle pouvait écrire et exécuter du Python pour zoomer, recadrer et annoter des images, avec une boucle réflexion–action–observation pour valider les résultats. Au lancement, ce fonctionnement n’était pas automatique dans tous les cas. Lors de la présentation de Gemini 3 Flash en décembre, l’arrivée prochaine d’un raisonnement visuel et spatial appliqué à la vidéo avait été évoquée. Les bénéfices en matière d’efficacité se manifestent principalement sur des vidéos de longue durée, allant de tutoriels de 10 minutes à des conférences de 90 minutes, voire à des enregistrements de plusieurs heures. Concernant la feuille de route, une future intégration à l’application Gemini et à YouTube est annoncée, avec un déploiement prévu pour l’ensemble des utilisateurs sur appareils Flash et Flash Lite, ainsi qu’une alimentation prochaine d’Ask YouTube directement sur la page de lecture.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.