HeadlinesBriefing favicon HeadlinesBriefing.com

Google DeepMind lance la compréhension vidéo agente pour Gemini

Google DeepMind Blog •
×

Google DeepMind a lancé la compréhension vidéo agente sur les modèles Gemini 3.7 Flash, 3.6 Flash et 3.5 Flash-Lite, réduisant la consommation de tokens jusqu'à 88%, les coûts jusqu'à 66% et augmentant la précision jusqu'à 7%. Contrairement au traitement statique à un taux de trame fixe, cette fonctionnalité permet à Gemini de rechercher, scanner et inspecter dynamiquement des segments vidéo dans les images visuelles, l'audio et les transcriptions via une boucle agente.

Les références montrent que les gains d'efficacité sont les plus prononcés sur le contenu de longue durée — allant des guides de 10 minutes aux enregistrements de plusieurs heures — où les développeurs étaient auparavant confrontés à des compromis entre des coûts de tokens élevés et la perte de détails. Gemini 3.7 Flash avec compréhension vidéo agente se situe désormais à la frontière de Pareto précision-coût pour l'analyse vidéo.

Les capacités clés comprennent : la récupération de moment en sous-seconde pour un montage précis ; la recherche d'une aiguille dans une botte de foin dans des vidéos de plusieurs heures ; la détection d'anomalies par rééchantillonnage à haute fréquence d'images par seconde ; et le comptage précis des actions et des objets. Les partenaires d'accès anticipé ont rapporté des résultats solides. Cette fonctionnalité est disponible dès aujourd'hui via l'API Gemini dans Google AI Studio et la plateforme Gemini Enterprise Agent pour les téléchargements de vidéos et les vidéos YouTube.

Entités clés : Entreprises : Google DeepMind, Google AI Studio, Gemini Enterprise Agent Platform | Personnes : Mario Lučić

FAQ : Comment la compréhension vidéo agente réduit-elle l'utilisation de tokens par rapport au traitement statique ?

Au lieu d'ingérer la vidéo à un taux de trame fixe, la compréhension vidéo agente permet à Gemini de récupérer dynamiquement uniquement les trames, l'audio ou les segments de transcription nécessaires pour répondre à une requête, réduisant ainsi la consommation de tokens jusqu'à 88% sur les vidéos de longue durée.