記事のサマリー(TL;DR)
- Gemini 3.7 Flash 等3モデルで「エージェント型動画理解」が正式提供開始。トークン消費最大88%削減・コスト最大66%削減を達成
- 固定フレームレート(1FPS)の静的処理から脱却し、モデル自身が「どこを・何速度で・どの形式で」取得するかを自律判断する構造に変化
- YouTube の「Ask YouTube」機能にも数ヶ月以内に展開予定。追加料金なしで標準 API トークン料金のみで利用可能
国内動画 AI 活用・長尺コンテンツ処理への実務的影響
これまで長尺動画(90分の講義動画・数時間の録画など)を LLM で処理する場合、固定フレームレートで全フレームを取り込むとトークンコストが膨大になり、フレームを間引くと重要シーンを見落とすというトレードオフが常に存在していました。今回のエージェント型動画理解はモデル自身がターゲット区間だけを動的にフェッチする仕組みであるため、このトレードオフが実質的に解消されます。
国内での具体的な応用として、社内研修動画・ウェビナー録画からのハイライト抽出、製造ラインの異常検知、EC の商品動画から特定シーンをピンポイントで切り出す自動編集といったユースケースが現実的なコストで実装できるようになります。Gemini API は Google AI Studio 経由でも利用できるため、既存の GCP 環境を持つ企業はすぐに検証を始められる状態です。また、BigQuery や GA4 と組み合わせた動画視聴データの分析基盤にも組み込みやすく、動画コンテンツのエンゲージメントをより粒度細かく計測する構成が現実的になりました。
詳細
概要
2026年9月1日、Google DeepMind は エージェント型動画理解(Agentic Video Understanding) を Gemini 3.7 Flash・Gemini 3.6 Flash・Gemini 3.5 Flash-Lite の3モデルで正式リリースしました。動画分析のコストを最大66%削減、トークン消費を最大88%削減しながら、精度を最大7%向上させる機能です。
Gemini API(Google AI Studio および Gemini Enterprise Agent Platform 経由)で、動画ファイルアップロードおよび YouTube 動画の両方に対応しています。
従来の「静的処理」との違い
従来の静的処理では、モデルは固定フレームレート(デフォルト 1FPS、API から変更可能)で動画全体を取り込む方式でした。これに対してエージェント型動画理解は、モデルが「コア推論」と「ネイティブ動画ツール」を組み合わせ、以下を自律的に判断します。
- 何を見るか:ターゲットとする映像・音声・トランスクリプトのセグメント
- どの速度で取得するか:シーンに応じた可変フレームレート
- どのモダリティを使うか:映像フレーム・音声・字幕の使い分け
この「エージェントループ」により、関連部分だけを内部ツールでロードするため、開発者が手動でフレームサンプリングロジックを実装する必要がなくなります。
ベンチマーク結果
| 指標 | 改善幅 |
|---|---|
| トークン消費削減率 | 最大 88% |
| コスト削減率 | 最大 66% |
| 精度向上率 | 最大 7% |
特に長尺コンテンツ(10分の操作ガイドから90分の講義、数時間の録画)において効率改善が顕著です。3モデルの中では Gemini 3.7 Flash が精度・コスト効率の両面で「精度対コストのパレートフロンティア」に位置すると評価されています。
主なユースケース
サブ秒単位のモーメント検索(Sub-second Moment Retrieval)
1FPS では見落としやすいコマ単位の状態変化やカット境界を精密に特定し、自動動画編集を実現します。
長尺 Needle-in-a-Haystack 検索
数時間の動画に対して複雑なクエリを投げても、数百万トークンを消費せずに回答を取得できます。
異常検知(Anomaly Detection)
注目すべき時間帯だけを高フレームレートで再サンプリングし、速い動きや微細な視覚的アーティファクトを検出します。
動作・オブジェクトのカウント(Counting)
繰り返し動作や複数オブジェクトを長時間にわたって正確にトラッキングします。
利用方法
API 設定で processing を "agentic" に指定するだけで有効化できます。追加料金は不要で、標準の Gemini API トークン料金のみが適用されます。
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)
今後の展開
- Gemini アプリ:Flash・Flash-Lite モデル向けに近日中に全ユーザーへ展開
- YouTube「Ask YouTube」機能:動画視聴ページ上での Q&A 機能に、数ヶ月以内にエージェント型動画理解を搭載予定