Gemini : l’analyse vidéo agentique sans surcoût

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Google propose une compréhension vidéo agentique sur plusieurs modèles Gemini Flash. L'entreprise annonce des baisses de consommation de tokens et de coûts, ainsi qu’une amélioration de la précision pour l’analyse de contenus longs. La fonctionnalité s’active dès maintenant via l’API, sans frais additionnels.
Activation immédiate et facturation inchangée
La compréhension vidéo agentique utilise la tarification standard des tokens de l’API Gemini, sans frais supplémentaires. Pour l’activer, il suffit de définir le traitement sur « agentic » dans la configuration de l’API. La fonctionnalité est disponible dans Google AI Studio et la Gemini Enterprise Agent Platform, et s’applique aux vidéos téléversées ainsi qu’aux contenus YouTube via l’API.
Du statique à l’agentique : le modèle choisit quoi regarder
Le traitement statique ingère les flux vidéo à un rythme fixe, par défaut 1 FPS, ajustable via l’API. L’approche agentique associe le raisonnement du modèle à des outils vidéo natifs pour rechercher et inspecter dynamiquement images, audio et transcriptions. Le modèle décide quoi analyser, à quelle vitesse et par quel canal, et ne récupère que les moments nécessaires. Il peut invoquer un outil interne pour charger la partie pertinente du fichier dans une boucle agentique, ce qui, selon Google, réduit les charges de développement par rapport à une orchestration manuelle.
Gains revendiqués et efficacité sur les longues vidéos
Google annonce des réductions d’utilisation de tokens jusqu’à 88 % et des coûts d’analyse jusqu’à 66 % sur des benchmarks d’analyse vidéo, avec une amélioration de la précision jusqu’à 7 %. Ces gains sont particulièrement notables sur des contenus longs, des guides d’environ 10 minutes aux conférences de 90 minutes et à des enregistrements de plusieurs heures. L’entreprise présente l’approche agentique comme une alternative au traitement statique, qui oblige souvent à choisir entre des coûts élevés de tokens ou des méthodes qui omettent des détails importants.
Cas d’usage annoncés : recherche rapide, anomalies et comptage
Parmi les capacités mises en avant figurent la récupération de moments en moins d’une seconde, une détection d’anomalies plus précise et un comptage exact d’actions et d’objets. Google cite l’identification de changements d’état en une fraction de seconde et de coupures difficiles à voir à 1 FPS, la réponse à des requêtes complexes dans des vidéos de plusieurs heures sans consommer des millions de tokens, et le rééchantillonnage de fenêtres temporelles à un taux plus élevé pour inspecter des mouvements rapides et des artefacts subtils. Des partenaires ayant eu un accès anticipé rapportent de bonnes performances lors de tests. La fonctionnalité est lancée sur Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite et s’active via le mode « agentic » de l’API.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.