テクノロジー 注目度 61

Geminiが動画を自律的に分析する新機能「Agentic Video Understanding」を発表:長尺動画の効率と精度を飛躍的に向上

※本記事の要約および解説はAIが自動生成しており、誤りが含まれる可能性があります。事実確認は元ニュースをご参照ください。

Google DeepMindは、AIによる動画分析の新たなパラダイムを提示する「Agentic Video Understanding」という新機能を2026年9月1日に発表しました。この機能は、従来の動画理解機能の限界を克服し、Geminiが質問内容に基づいて動画内の必要な情報源を自律的に判断し、分析を行う仕組みです。

従来の動画処理は「静的処理」が主流であり、動画から1秒間に1フレームを取り出し、映像や音声を一律に読み込ませるため、数十分から数時間に及ぶ長尺動画の場合、膨大なトークンを消費し、コストが高くなるという課題がありました。また、情報量を減らすと、一瞬の動きや重要なディテールを見落とす可能性もありました。

「Agentic Video Understanding」は、この課題を解決します。Gemini自身が「どこを確認すべきか」を判断し、必要な区間のみに処理を集中させます。これにより、単にフレームや音声を読み込むだけでなく、必要に応じて対象区間のフレームレートや解像度を動的に調整して再確認することが可能です。例えば、拍手の回数など一瞬の動きを正確に数えることが可能になりました。

この新機能の導入により、トークン消費量は最大88%削減され、精度は最大約7%向上したことがベンチマークで示されています。特に、90分の講義や数時間に及ぶ録画など、長時間のコンテンツ分析において効率改善が極めて大きいとされています。また、分析コストについても最大66%の削減が期待できます。

利用はGemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Liteで可能であり、現時点ではGemini API経由(Google AI StudioおよびGemini Enterprise Agent Platform)で利用できます。今後は、GeminiアプリのFlashおよびFlash-Liteへの展開に加え、数カ月以内にはYouTubeの動画視聴ページで質問できる「Ask YouTube」にも導入され、より広範なユーザーに高品質な動画分析機能が提供される予定です。


背景

従来のAIによる動画分析は、動画全体を均一な密度(静的処理)で読み込む必要があり、長尺動画では計算資源とトークン消費量が膨大になるという課題がありました。この新機能は、AIが「必要な情報」を能動的に特定し、処理を最適化することで、この効率性の壁を打ち破ることを目指しています。

重要用語解説

  • Agentic Video Understanding: 動画の内容を単に読み込むだけでなく、質問内容に基づきAI自身が分析すべき最適な区間や視点(フレームレート、解像度)を自律的に判断する、高度な動画分析処理モード。
  • 静的処理: 動画を一定のフレームレート(例:1秒間に1フレーム)で固定的に取り出し、映像と音声をまとめてAIに読み込ませる、従来の標準的な動画処理方法。
  • トークン消費量: AIが情報を処理・理解するために使用する計算単位の量。この値が少ないほど、処理が効率的でコストが低いことを示します。

今後の影響

本機能は、AIによる長尺動画コンテンツ(講義、会議、ライブ配信など)の分析を、これまで高コストで困難だった領域から、実用的なレベルへと引き上げます。これにより、教育、研究、メディアなど、動画コンテンツが重要なあらゆる産業のワークフローに革命的な効率化をもたらすと予想されます。