HeadlinesBriefing favicon HeadlinesBriefing.com

Google DeepMind lança compreensão de vídeo agente para Gemini

Google DeepMind Blog •
×

Google DeepMind lançou a compreensão de vídeo agente nos modelos Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite, reduzindo o consumo de tokens em até 88%, os custos em até 66% e aumentando a precisão em até 7%. Diferentemente do processamento estático em uma taxa de quadros fixa, esse recurso permite que o Gemini pesquise, escaneie e inspecione dinamicamente segmentos de vídeo em quadros visuais, áudio e transcrições por meio de um loop agente.

Os benchmarks mostram que os ganhos de eficiência são mais pronunciados em conteúdo de longa duração — de guias de 10 minutos a gravações de várias horas — onde os desenvolvedores anteriormente enfrentavam trade-offs entre altos custos de tokens e perda de detalhes. O Gemini 3.7 Flash com compreensão de vídeo agente agora está na fronteira de Pareto de precisão-custo para análise de vídeo.

As principais capacidades incluem: recuperação de momento em sub-segundo para edição precisa; busca de agulha em palheiro em vídeos de várias horas; detecção de anomalias por meio de reamostragem em alta FPS; e contagem precisa de ações e objetos. Parceiros de acesso inicial relataram resultados fortes. O recurso está disponível hoje por meio da API do Gemini no Google AI Studio e na Plataforma de Agente Empresarial do Gemini para upload de vídeo e vídeos do YouTube.

Entidades-chave: Empresas: Google DeepMind, Google AI Studio, Plataforma de Agente Empresarial do Gemini | Pessoas: Mario Lučić

Perguntas frequentes: Como a compreensão de vídeo agente reduz o uso de tokens em comparação com o processamento estático?

Em vez de ingerir vídeo em uma taxa de quadros fixa, a compreensão de vídeo agente permite que o Gemini busque dinamicamente apenas os quadros, áudio ou segmentos de transcrição necessários para responder a uma consulta, reduzindo o consumo de tokens em até 88% em vídeos de longa duração.