HeadlinesBriefing favicon HeadlinesBriefing.com

Google DeepMind запускает агентное понимание видео для Gemini

Google DeepMind Blog •
×

Google DeepMind запустил агентное понимание видео в моделях Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite, сокращая потребление токенов на 88%, затрат на 66% и повышая точность на 7%. В отличие от статической обработки с фиксированной частотой кадров, эта функция позволяет Gemini динамически искать, сканировать и проверять сегменты видео в визуальных кадрах, аудио и транскриптах через агентный цикл.

Бенчмарки показывают, что прирост эффективности наиболее выражен в длиннометражном контенте — от руководств продолжительностью 10 минут до многчасовых записей — где разработчики ранее сталкивались с компромиссом между высокими затратами на токены и потерей деталей. Gemini 3.7 Flash с агентным пониманием теперь находится на границе Парето точность-стоимость для анализа видео.

Ключевые возможности включают: извлечение момента с субсекундной точностью для точного редактирования; поиск иголки в стоге сена в многочасовых видео; обнаружение аномалий посредством передискретизации с высокой FPS; и точный подсчет действий и объектов. Партнеры раннего доступа сообщили о сильных результатах. Эта функция доступна сегодня через API Gemini в Google AI Studio и на платформе Gemini Enterprise Agent для загрузки видео и видео с YouTube.

Ключевые сущности: Компании: Google DeepMind, Google AI Studio, Gemini Enterprise Agent Platform | Люди: Mario Lučić

Часто задаваемые вопросы: Как агентное понимание видео снижает использование токенов по сравнению со статической обработкой?

Вместо приема видео с фиксированной частотой кадров, агентное понимание видео позволяет Gemini динамически получать только соответствующие кадры, аудио или сегменты транскрипта, необходимые для ответа на запрос, снижая потребление токенов до 88% на длиннометражном видео.