HeadlinesBriefing favicon HeadlinesBriefing.com

Google DeepMind lanza comprensión de video agente para Gemini

Google DeepMind Blog •
×

Google DeepMind ha lanzado comprensión de video agente en los modelos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite, reduciendo el consumo de tokens hasta en un 88%, los costos hasta en un 66% y mejorando la precisión hasta en un 7%. A diferencia del procesamiento estático a una tasa de fotogramas fija, esta función permite a Gemini buscar, escanear e inspeccionar dinámicamente segmentos de video en marcos visuales, audio y transcripciones mediante un bucle agente.

Los puntos de referencia muestran que las ganancias de eficiencia son más pronunciadas en contenido de larga duración — desde guías de 10 minutos hasta grabaciones de varias horas — donde los desarrolladores anteriormente enfrentaban compromisos entre altos costos de tokens y pérdida de detalles. Gemini 3.7 Flash con comprensión agente ahora se encuentra en la frontera de Pareto de precisión-costo para el análisis de video.

Las capacidades clave incluyen recuperación de momentos a sub-segundo para edición precisa, búsqueda de aguja en un pajar en videos de varias horas, detección de anomalías mediante muestreo de alta FPS y conteo preciso de acciones y objetos. Los socios de acceso temprano reportaron resultados sólidos. La función está disponible hoy mediante la API de Gemini en Google AI Studio y la Plataforma de Agente Empresarial de Gemini para cargas de video y videos de YouTube.

Entidades clave: Empresas: Google DeepMind, Google AI Studio, Plataforma de Agente Empresarial de Gemini | Personas: Mario Lučić

Preguntas frecuentes: ¿Cómo reduce el uso de tokens la comprensión de video agente frente al procesamiento estático?

En lugar de ingerir video a una tasa de fotogramas fija, la comprensión de video agente permite a Gemini obtener dinámicamente solo los marcos, audio o segmentos de transcripción necesarios para responder una consulta, reduciendo el consumo de tokens hasta en un 88% en videos de larga duración.