はじめに
長い動画をAIに解析させると、トークン(処理量)が膨らみ、コストも遅延も大きくなりがちです。Google DeepMindが2026年9月1日に発表した「agentic video understanding」は、動画を最初から最後まで一律に読み込むのをやめ、必要な場面だけをAI自身が選んで見に行く、という新しい処理方式です。Gemini Enterprise Agent Platformでも使えます。
本記事では、公式ブログと公式ドキュメントをもとに、その仕組み、効果、使い方、使い分けの目安を整理します。
agentic video understanding とは
Google公式ブログによると、agentic video understandingは、Geminiの最新モデルで使える新機能です。動画のトークン消費を最大88%、分析コストを最大66%削減しながら、精度を最大7%向上させるとされています(Introducing agentic video understanding with Gemini | Google)。
これまでの静的処理は、動画を固定のフレームレート(既定は1秒あたり1フレーム)で取り込み、映像をコンテキストに詰め込んでいました。agentic video understandingでは、Geminiが推論と動画用のツールを組み合わせ、必要な場面を動的に検索・走査・確認します。違いは次のとおりです。
| 項目 | 静的処理(従来) | agentic video understanding |
|---|---|---|
| 動画の取り込み方 | 固定のフレームレート(既定1FPS)で全体を取り込む | 必要な場面と情報を、必要になったときに取得する |
| 何を見るか | すべてのフレーム | モデルが、何を、どの速さで、どの種類の情報(フレーム・音声・文字起こし)で見るかを決める |
| 既定の設定 | 既定(すべてのモデル) | 明示的に有効にする |
| 公式が挙げる向いているケース | 5分未満の短いクリップで遅延に敏感な場合、クリップ全体でフレーム単位の精度が必要な場合 | 長い動画、または特定の場面を狙った質問 |
Gemini APIの動画理解ドキュメントによると、静的処理では、音声は1Kbps(モノラル)で処理され、1秒ごとにタイムスタンプが付きます。素早い動きの場面は、1FPSのサンプリングでは細部が失われることがあります(Video understanding | Gemini API | Google AI for Developers)。
提供対象は、アップロードした動画とYouTube動画です。Gemini APIのGoogle AI Studioと、Gemini Enterprise Agent Platformの両方で利用できます。さらに、Geminiアプリでもまもなく全ユーザー向けに展開され、YouTubeの「Ask YouTube」機能にも数ヶ月以内に搭載される予定とされています。
仕組み: 「Think → Act → Observe」のループ
Google公式の開発者ガイドによると、agentic video understandingは、動画を最初にまとめて読み込む代わりに、サーバー側のツールループで動作します。「考える(Think)→動く(Act)→観察する(Observe)」を繰り返し、答えに必要な情報が集まるまで続けます(Agentic video understanding in Gemini: Developer Guide | Google AI Studio)。
| ステップ | 内容 |
|---|---|
| 参照渡し | APIは動画全体をデコードせず、動画への軽量なポインタだけをモデルに渡す |
| 必要な区間の絞り込み | 文字起こしを検索するなどして、関連しそうな時間帯を絞り込む |
| 時間方向のズームと可変フレームレート | 詳細を見るときは、必要な時間帯(例: 14〜16秒)だけを読み込み、フレームレートを調整する。素早い動きなら5〜10FPS、内容を流し見するなら0.1FPS |
| 音声トラック | 音の手がかり、音楽、話者の口調が重要な場合は、音声ストリームを直接取り出す |
| 観察と統合 | 取り出した区間は観察結果としてモデルに返される。モデルは、検索をさらに絞り込むか、根拠に基づく最終的な回答をまとめる |
公式ブログによると、開発者が手作業で似たことをするのは以前から可能でしたが、agentic video understandingでは、Gemini自身が内部ツールを呼び出して動画の該当部分を読み込む形になり、開発の手間を大きく減らせるとされています。画像向けには、コード実行と画像理解を組み合わせる「agentic vision」という似た機能があり、公式ブログはこれと並べて紹介しています。
効果: 「最大」の数字
公式ブログが示している効果は、標準的な動画解析のベンチマークでの数値です。
| 指標 | 効果 |
|---|---|
| トークン消費 | 最大88%削減 |
| 分析コスト | 最大66%削減 |
| 精度 | 最大7%向上 |
公式ブログによると、これらの効果は、特に長い動画で大きくなります。静的処理では、長い動画を扱うと、高いトークンコストを払うか、重要な情報を落とす手法を選ぶかの二択になっていた、という説明です。
開発者ガイドによると、最大88%のトークン削減と最大7%の精度向上は、Gemini 3.7 Flashで有効にした場合の数値です。
発表時にサポート対象だった3つのモデルすべてで効果が見られるとされ、そのなかでもGemini 3.7 Flashにagentic video understandingを組み合わせた場合が、精度とコストのバランスで最良(精度対コストのパレートフロンティア)だったと紹介されています。ブログの図では、Gemini 3.7 Flashで長尺動画の理解を測るベンチマーク(LongVideoBench)の結果が示され、トークンの大幅な削減と精度の向上が確認できます。
なお、これらは「最大」の数値で、あくまでGoogleが公開したベンチマークでの結果です。実際の効果は、動画の長さや、質問の内容によって変わります。
できること
公式ブログでは、agentic video understandingで可能になる用途として、次の4つが挙げられています。
| 用途 | 内容 |
|---|---|
| サブ秒単位の場面検索 | 1FPSでは見逃されやすい、一瞬の状態変化や、ショットの切り替わりを特定できる。精密な自動動画編集などに使える |
| 長尺動画の中からの探し物 | 数時間にわたる動画から、何百万ものトークンを消費せずに、複雑な質問に答えられる |
| 異常検知 | 気になる時間帯を高いフレームレートで再サンプリングし、素早い動きや、微妙な映像の乱れを確認できる |
| 動作・物体の数え上げ | 繰り返される身体の動きや、時間経過とともに現れる複数の物体を、正確に数えられる |
数え上げの例として、ブログでは、Gemini 3.7 Flashが素早い動きを数える際に、フレームレートを変えながら動画を見直す様子が紹介されています。
使い方: Gemini Enterprise Agent Platformでの設定
Gemini Enterprise Agent Platformのドキュメントによると、agentic video understandingは、対応するすべてのモデルで**既定では無効(静的処理)**になっています(Video understanding | Gemini Enterprise Agent Platform | Google Cloud Documentation)。
有効にするには、動画の入力に、次のパラメータを設定します。Agent Platformのリリースノートに記載されています(Gemini Enterprise Agent Platform release notes | Google Cloud Documentation)。
| 利用するAPI | 設定 |
|---|---|
| Interactions API | 動画の入力に processing: "agentic" を指定 |
| GenerateContent API | 動画の入力に media_processing: "AGENTIC" を指定 |
公式ブログには、Gemini APIを使ったサンプルコードが掲載されています。YouTube動画を対象にした例で、動画の入力に"processing": "agentic"を指定するだけです。
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)
料金について、公式ブログとAI Studioの開発者ガイドは、標準のGemini APIのトークン料金で、機能自体の追加料金はないと説明しています。Gemini Enterprise Agent Platformでの料金は、公式の料金ページで確認してください。開発者ガイドによると、課金の内訳は次のとおりです。
| 課金対象 | 内容 |
|---|---|
| 動画の入力トークン | 実行中に実際に取り出したメディアのトークン分だけ。最初の軽量な参照と、モデルが明示的に取得したフレームの断片・音声の区間が対象 |
| 思考・出力トークン | モデルの推論ステップとツール呼び出しは、標準の出力・思考トークン料金で課金 |
| コンテキストキャッシュ | 複数ターンのセッションで読み込まれた動画には、標準の暗黙的キャッシュが適用され、明示的なキャッシュも使える |
| Batch API | agentic処理はBatch APIでも使え、標準コストの50%で利用できる |
なお、Gemini APIの動画理解ドキュメントには、長い動画や複雑なプロンプトでagentic処理に時間がかかる場合は、ストリーミングやバックグラウンド実行を使うよう案内されています。
対応モデル
対応モデルの書かれ方は、ページによって少し異なります。
| 出典 | 記載されている対応モデル |
|---|---|
| 公式ブログ(発表時) | Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite |
| AI Studioの開発者ガイド | Gemini 3.8 Flash、3.7 Flash、3.6 Flash、3.5 Flash-Lite |
| Gemini APIの動画理解ドキュメント | Gemini 3.8 Flash、3.7 Flash、3.6 Flash、3.5 Flash Lite、およびそれ以降のモデル |
| Agent Platformのリリースノート | 「Gemini 3.5 Pro以降のモデル」 |
発表時点のGemini APIの変更履歴では、3.7 Flash、3.6 Flash、3.5 Flash-Liteの3モデルでのリリースと記載されています(Release notes | Gemini API | Google AI for Developers)。また、agentic処理に対応していないモデルで指定すると、エラーが返る、と説明されています(Gemini API optimization and inference | Google AI for Developers)。実際に使うモデルが対応しているかどうかは、利用するプラットフォームの最新ドキュメントで確認してください。
使い分けの目安
Gemini APIの動画理解ドキュメントは、一般的な目安として、まずagenticモードから試すことを勧めています。特に、応答の品質やトークン効率を最適化したい場合です。そのうえで、次のケースでは静的処理が向くとされています。
| 動画・質問の性質 | 向いている方式 |
|---|---|
| 長い動画、または特定の場面を狙った質問(コンテキストを埋めずに、関連する情報に絞って取得したい) | agentic video understanding |
| 5分未満の短いクリップで、遅延に敏感なクエリ | 静的処理 |
| クリップ全体でフレーム単位の精度が必要 | 静的処理 |
agentic video understandingでは、生成が始まる前に、内部の推論とツールの往復が入ります。そのため、5分未満の短いクリップでは、最初のトークンが返るまでの時間(TTFT)が少し延びることがあります。実際の動画と質問で、両方を試して比較するのが確実です。
まとめ
- agentic video understandingは、2026年9月1日に発表された、Geminiが動画の必要な場面だけを選んで確認する新しい処理方式
- 従来の固定フレームレートでの取り込みをやめ、「Think → Act → Observe」のループで、フレーム・音声・文字起こしを必要に応じて取得する
- 公式ブログでは、標準ベンチマークで、トークン消費が最大88%、分析コストが最大66%削減され、精度は最大7%向上したとされる。効果は特に長い動画で大きく、88%と7%はGemini 3.7 Flashでの数値
- Gemini Enterprise Agent Platformでは既定で無効。Interactions APIでは
processing: "agentic"、GenerateContent APIではmedia_processing: "AGENTIC"で有効にする - Gemini APIでは追加の機能料金はなく、標準のトークン料金。推論分は思考・出力トークンとして課金され、Batch APIなら標準コストの50%で使える。Agent Platformの料金は料金ページで確認する
- 対応モデルの記載はページによって異なるため、使うモデルが対応しているかを最新のドキュメントで確認する
- 公式の目安は、まずagenticから試すこと。5分未満の短いクリップで遅延に敏感な場合や、フレーム単位の精度が必要な場合は、静的処理が向く
長い動画の解析にかかるコストや遅延を減らしたい方の参考になれば幸いです。
参考リンク
- Introducing agentic video understanding with Gemini | Google
- Video understanding | Gemini API | Google AI for Developers
- Agentic video understanding in Gemini: Developer Guide | Google AI Studio
- Video understanding | Gemini Enterprise Agent Platform | Google Cloud Documentation
- Gemini Enterprise Agent Platform release notes | Google Cloud Documentation
- Release notes | Gemini API | Google AI for Developers
- Gemini API optimization and inference | Google AI for Developers
本記事は2026年9月時点の公式情報をもとにまとめています。機能の対応モデルや設定は変更される可能性があります。実際の利用を検討される際は、最新の公式情報をご確認ください。