2026年9月1日、Google DeepMindは公式ブログでGeminiのインテリジェントなエミュラティブ動画理解機能を発表し、最初の一波はGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteをカバーしました。この変更は単に「モデルが動画を視聴できる」だけでなく、無関係な多数の画像を固定フレームレートで文脈に入力する必要がなくなることです。
「もう少し見てみる」のではなく、まずどこを見るかを決めることです
従来のビデオ解析は通常、固定されたレートでフレームを抽出しますが、Gemini APIの静的処理のデフォルトは1フレーム/秒です。長時間のチュートリアルや講義、長時間の録画を扱う場合、この方法は大量のトークンを消費するか、サンプリング密度の低下により短い操作を見逃すことがあります。
新しい機能は推論とネイティブのビデオツールを組み合わせています。モデルは問題の周囲のクリップを動的に検索、スキャン、再生し、映像、音声、文字起こしテキストの中から望ましい信号を選択します。1秒以内に起こる変化を検出することで、局所的なサンプリングレートを向上させることができます。重要な文を検索する際は、クリップ全体を段落ごとに読む必要はありません。これはまた、AIエージェントと固定ワークフローの違いでもあります。モデルは次にどのツールを呼び出すかを決定し始めます。
「トークンの最大88%節約」は固定割引とはみなされません
Googleの標準的な動画分析ベンチマークによると、アクティベート後はトークン消費が最大88%減少し、分析コストは最大66%減少、精度は最大7%向上します。これらの数値はすべて「ほとんどの」条件を持ち、特定のモデル、動画の長さ、問題タイプに基づいており、すべてのビジネスに直接適用できるわけではありません。より信頼できる方法は、自社の動画やクエリコレクションをA/Bテストに使い、トークン、レイテンシ、リコール、誤位置を記録しながら行うことです。
公式には、Gemini 3.7 Flashはテストモデルにおいて精度とコストの両面でより良い評価を提供します。短い動画や大まかな要約だけのタスクでは、同じ効果が得られない場合があります。利点は、迅速な対応、異常検出、正確なカウント、そして数時間にわたる検索に向けられる可能性が高いです。関連する能力の境界については、サイトの「マルチモーダルモデル実用利用概要」をご参照ください。
開発者はログイン前に4回のチェックを行う必要があります
この機能は動画やYouTube動画のアップロードに対応しており、Google AI StudioのGemini APIやGemini Enterprise Agent Platformなどのエントリーポイントがあります。動画処理モードをagenticに設定すると有効になります。追加の機能料金はかかりませんが、通常のAPIトークンとして請求されます。
ローンチ前に、企業が単なる要約だけでなく詳細に注力する必要があるかを確認しましょう。回答に手動で確認する時間帯を含めるべきか、音声、字幕、映像が競合した場合にどのようなルールを適用すべきか。バッチタスクにコストと持続時間の上限があるかどうか。GoogleはGeminiアプリやYouTubeのAsk YouTubeに機能を導入する計画です。現時点では、APIの利用可能性がすべての端末が既に稼働していると同一視することはできません。