Google、動画生成AI「Gemini Omni 1.1 Flash」を発表:最大40秒のシームレスなシーン延長と4Kアップスケールを実現
米Googleは、動画の生成および編集に対応したマルチモーダルAIモデル「Gemini Omni 1.1 Flash」を開発者向けに発表しました。これは、Gemini APIおよびGoogle AI Studioを通じて提供され、プロ用途に耐えうる「production-ready」な段階に到達したとされています。
今回の最大の強化点は「シーン延長」機能です。従来のモデルが直前の1秒しか参照できなかったのに対し、Omni 1.1 Flashは最大10秒分の文脈を解析することで、視覚的な一貫性と物語の整合性を大幅に向上させました。これにより、動画は10秒単位で延長でき、累計で最大40秒まで生成することが可能です。
機能面では、ショットの開始フレームと終了フレームを指定して連続的な映像を生成できる点も特徴的です。これは、複雑なカメラの周回移動やズームによる転換、シームレスなループクリップ制作に役立ちます。また、制作ワークフローの効率化のため、360p解像度での軽量なプレビュー生成に対応しました。これは標準の720pと比較して生成速度が最大60%速く、コストが3分の1に抑えられます。最終的な出力は1080pまたは4Kへのアップスケールが可能です。
さらに、マルチモーダル入力として最大3秒の動画を参照素材に指定できるため、キャラクターの見た目や視覚的な文脈を維持したまま動画を生成できます。提供形態は、Google AI Studioや企業向けプラットフォームに加え、動画制作ツール「Google Flow」でもGoogle One AI Premium/Pro/Ultra契約者向けに世界展開を開始しました。なお、開発者向けドキュメントによると、生成された動画には機械的に検出可能な電子透かし「SynthID」が付与されます。
背景
動画生成AIは、コンテンツ制作の自動化と効率化を目的として急速に進化しています。特に、単なるテキストからの動画生成に留まらず、既存の映像の文脈を理解し、自然な続きを生成する「シームレスな延長」機能が求められてきました。Googleの今回の発表は、このプロレベルの要求に応えるための技術的ブレイクスルーと位置づけられます。
重要用語解説
- マルチモーダルAI: テキスト、画像、動画など複数の異なる種類のデータ(モダリティ)を同時に理解し、処理できるAIモデルのこと。人間のように多様な情報を統合的に扱う能力を持ちます。
- シーン延長: AIが既存の動画クリップの直前の映像の文脈(時間、光、キャラクターの動きなど)を分析し、違和感なく続きの映像を生成する技術。物語の連続性を保つ上で重要です。
- SynthID: AIが生成したコンテンツであることを証明するために、動画や画像に埋め込まれる電子透かし(ウォーターマーク)のこと。AI生成物の出所を追跡する目的があります。
今後の影響
本モデルの登場により、AIを活用した動画制作のワークフローが劇的に変化します。特に、低解像度での高速プレビューと高解像度での最終出力という二段階のプロセスが確立されたことで、プロのクリエイターがアイデアを試行錯誤する際のコストと時間を大幅に削減することが可能となり、コンテンツ産業全体に大きな変革をもたらすと予想されます。