HeadlinesBriefing favicon HeadlinesBriefing.com

Google DeepMind、Gemini向けエージェント型ビデオ理解を発表

Google DeepMind Blog •
×

Google DeepMindは、Gemini 3.7 Flash、3.6 Flash、および3.5 Flash-Liteモデルにおいてエージェント型ビデオ理解機能をローンチし、トークン消費を最大88%削減、コストを最大66%削減、精度を最大7%向上させました。固定フレームレートでの静的処理とは異なり、この機能により、Geminiはエージェントループを通じて、視覚フレーム、オーディオ、トランスクリプト全体にわたってビデオセグメントを動的に検索、スキャン、検査できるようになります。

ベンチマークによると、この効率の向上は長尺コンテンツにおいて最も顕著です — 10分のガイドから数時間の録画まで — ここで開発者は以前、高いトークンコストと詳細の損失の間でトレードオフを強いられていました。エージェント型理解を備えたGemini 3.7 Flashは、現在ビデオ分析における精度とコストのパレトフロンティアに位置しています。

主な機能には以下が含まれます:精密編集のためのサブセカンドレベルの瞬間検索;数時間のビデオにおける「干し草の山の中の針」検索;高FPSリサンプリングによる異常検出;およびアクションとオブジェクトの正確なカウント。早期アクセスパートナーは強力な結果を報告しています。この機能は、本日よりGoogle AI StudioおよびGemini Enterprise AgentプラットフォームのGemini APIを通じて利用可能で、ビデオのアップロードおよびYouTubeビデオに対応しています。

主要エンティティ:企業:Google DeepMind, Google AI Studio, Gemini Enterprise Agent Platform | 人物:Mario Lučić

よくある質問:エージェント型ビデオ理解は、静的処理と比較してトークン使用量をどのように削減しますか?

固定フレームレートでビデオを取り込む代わりに、エージェント型ビデオ理解により、Geminiはクエリに回答するために必要な関連するフレーム、オーディオ、またはトランスクリプトのセグメントのみを動的に取得できるようになります。これにより、長尺ビデオにおいてトークン消費を最大88%削減できます。