テクノロジー 注目度 88

Geminiが「エージェンティック動画理解」を発表:動画分析の精度と効率を飛躍的に向上

※本記事の要約および解説はAIが自動生成しており、誤りが含まれる可能性があります。事実確認は元ニュースをご参照ください。

Googleは、最新のAIモデル「Gemini 3.7 Flash」「3.6 Flash」「3.5 Flash-Lite」に「エージェンティック動画理解(agentic video understanding)」という画期的な新機能を搭載したと発表しました。この機能は、動画分析の精度を大幅に向上させると同時に、トークン使用量とコストを劇的に削減することを可能にします。

従来の動画処理(静的処理)では、モデルが動画を固定のフレームレート(デフォルト1 FPSなど)で一律に読み込む必要があり、特に10分以上の長尺動画では、コストと詳細情報の取得のトレードオフに直面していました。これに対し、エージェンティック動画理解は、Geminiのコアな推論能力とネイティブな動画ツールを組み合わせることで、動画の視覚フレーム、音声、トランスクリプトの全てを横断し、目標達成のために必要な特定の瞬間や信号のみを動的に検索・スキャン・検査します。

ベンチマークの結果によると、この新機能を利用することで、標準的な動画分析のコストを最大66%削減し、トークン消費量を最大88%削減しつつ、精度を最大7%向上させることが実証されました。特にGemini 3.7 Flashは、品質とコスト効率のバランスにおいて最高の性能を発揮し、テストされたモデルの中で「精度対コストのパレートフロンティア」に位置づけられています。

具体的な応用例としては、1 FPSでは見逃されがちな「サブ秒単位の瞬間変化の検出」、数時間にわたる動画からの「特定の情報(針の山の中の針)の検索」、高速な動きを捉える「異常検知」、そして「物体やアクションの正確なカウント」などが挙げられます。この機能は本日よりGoogle AI StudioおよびGemini Enterprise Agent PlatformのGemini APIを通じて利用可能であり、今後、Geminiアプリ全ユーザー、さらにはYouTubeの動画視聴ページにおける「Ask YouTube」機能にも展開される予定です。


背景

従来のAIによる動画分析は、動画全体を固定のフレームレートで処理する「静的処理」が主流でした。しかし、長尺動画の分析では、膨大なデータ量ゆえにコストが高騰し、処理の効率と詳細な情報取得のバランスを取ることが困難でした。本技術は、この課題を解決するため、AIに能動的(エージェンティック)な役割を与え、必要な情報のみをピンポイントで抽出する仕組みを導入したものです。

重要用語解説

  • エージェンティック動画理解: AIが単なるデータ処理に留まらず、目標を設定し、動画のどの部分(フレーム、音声、文字起こし)を、どの速度で見るべきかを能動的に判断する、高度な動画分析能力。
  • 静的処理: 動画を固定されたフレームレート(例:1 FPS)で一律に読み込み、分析を行う従来の動画処理方法。効率が悪く、長尺動画ではコストがかさむ。
  • パレートフロンティア: 経済学や最適化問題で用いられる概念。本記事では、動画理解において「最高の品質」と「最低のコスト」を両立できる最適な性能ラインを指す。

今後の影響

本機能のリリースは、動画コンテンツの自動分析市場に革命をもたらします。開発者は、これまで不可能だった「長尺動画からの高精度な情報抽出」を低コストで実現でき、自動編集、監視システム、教育コンテンツの分析など、多岐にわたる産業分野でのAI活用が加速すると予想されます。Googleのエコシステム全体での展開も、市場への影響は甚大です。