テクノロジー 注目度 72

Googleが動画生成AI「Gemini Omni 1.1 Flash」を公開:会話による編集やシーン延長が可能に

※本記事の要約および解説はAIが自動生成しており、誤りが含まれる可能性があります。事実確認は元ニュースをご参照ください。

Googleは、文章や写真から音声付きの短い動画を生成するAI「Gemini Omni 1.1 Flash」を正式版(stable)として公開しました。本AIは、単に動画を生成するだけでなく、生成後に会話形式で修正や続きの作成ができる点が最大の特長です。

**【概要と機能】**

Gemini Omni 1.1 Flashは、テキストや画像をインプットとして受け取り、3〜10秒の短い動画を生成します。最大の特徴は、一度生成した動画の「続き」を10秒ずつ追加し、合計で最大40秒まで動画の尺を延長できる点です。また、以前のプレビュー版から強化された点として、以下の機能が追加されています。一つ目は、動画の開始点と終了点を指定して、2枚の画像間を滑らかにつなぐ動画を作成できる点です。二つ目は、標準画質(720p)よりも速く、費用を抑えて試作できる「360pドラフト」機能です。三つ目は、参考となる短い動画(最大3本)を渡すことで、動きや人物の動きを模倣させられる点です。

**【利用方法と制約】**

利用にはGoogle AI Studioのアカウントと有料プランのAPIキーが必要であり、無料枠は提供されていません。動画の指示(プロンプト)は、単に「〜して」という曖昧な表現ではなく、「1カットの連続ショット」「シーンカットなし」「セリフなし」といった具体的な制約を盛り込むことが推奨されています。また、動画の修正や続きの作成は、前回生成した動画の「ID(動画の番号)」を渡して、変更点のみを短く指示することが重要です。この仕組みにより、まるで人間が編集するように、段階的な修正が可能となっています。なお、動画の生成は1回あたり最大10秒が基本であり、40秒は10秒の延長を繰り返した合計時間となります。日本語での指示も可能ですが、より正確な結果を得るためには英語での指示が推奨されています。


背景

動画生成AIは近年急速に進化していますが、実用化の段階では「コスト」「編集の柔軟性」「指示の精度」が課題でした。Googleが正式版として1.1をリリースしたことで、単なるデモ動画の生成に留まらず、プロの映像制作プロセスに近づいた点が注目されています。特に、会話による編集機能は、AIツールの利用障壁を大きく下げるものです。

重要用語解説

  • Gemini Omni 1.1 Flash: Googleが開発した動画生成AIの最新モデル名。文章や画像から、音声付きの高品質な動画を生成し、生成後の会話による編集や続きの作成が可能な点が特徴です。
  • APIキー: プログラムからGoogleのAIサービスを呼び出すための「合言葉」のような文字列。このキーを使って、Pythonなどのプログラミング言語からAIの機能を利用します。
  • Base64: 動画や画像といったバイナリデータ(数字の塊)を、テキストデータ(文字)として表現するためのエンコード方式。プログラム内でデータをやり取りする際に使用されます。

今後の影響

本AIの登場により、プログラミング知識を持つ個人や中小企業でも、高精度な動画コンテンツを容易に制作できるようになります。特に、既存の動画を「修正」や「延長」という形で編集できるため、マーケティングや教育分野におけるコンテンツ制作のワークフローが劇的に効率化されると予想されます。