フェイフェイ・リー氏のWorld Labsが空間知能オムニモデル「Atlas」を発表:画像から3D空間やバレットタイム映像を生成
米World Labsは、次世代の「世界モデル(ワールドモデル)」となるオムニモデル「Atlas」を発表しました。同モデルは、テキスト、画像、動画、3Dといった多様なデータをネイティブに扱うことが可能であり、空間知能(Spatial Intelligence)の実現を目指しています。World Labsは、ImageNet構築などで知られるスタンフォード大学のフェイフェイ・リー博士が共同創業した新興企業です。
Atlasの最大の特徴は、入力された全てのデータを単一の「空間コンテキスト」に統合し、3D的な整合性を保ちながら続きを生成する点にあります。これにより、単なる画像生成に留まらない、高度な空間理解とシミュレーション能力を実現しています。
主な用途は以下の4点に及びます。第一に「カメラ制御生成」では、参照画像から任意のカメラ位置・角度を指定し、新たな視点の画像や動画を生成できます。テキスト指示ではなくカメラの幾何情報そのものを入力するため、構図や動きを細かく制御でき、最大1440pの1分動画出力が可能です。無関係な画像間も、モデルが廊下や出入り口を想像して補間します。第二に「空間再構成」では、専用機材や大量の視点なしに、わずか2~3枚の画像から実在の空間を忠実に再構成します。入力画像に写っていない部分はモデルが補完し、点群や3Dガウシアンスプラッティングといった明示的な3Dデータ形式にも対応します。第三に「時空間シミュレーション」機能があり、一般的なスマホ動画から時間を止めて自由な角度に切り替える「バレットタイム」風の映像生成が可能です。また、ロボティクス向けのReal-to-Sim用途として、大規模環境の再構成と、その空間を移動するロボットのカメラデータ(RGB/深度)生成に利用できます。第四に、テキストや画像からの360度パノラマ生成も対応しています。
性能評価では、カメラ制御生成において、AtlasはMiniMax H3と比較して75%、Gemini Omni Flashと比較して81%の評価を得ており、特にカメラの軌道が複雑になるほど高い性能差を示しています。また、少数の画像からの3D再構成においても、複数のベンチマークで既存のオープンソースモデルを上回る精度を実証しました。Atlasは現在、一部のパートナー限定の早期アクセス段階にあり、今後の自社製品(Marbleなど)の標準的な選択肢となることが期待されています。
背景
近年、AI技術は単なる画像生成から、現実世界の物理法則や空間構造を理解し、シミュレーションする「世界モデル」へと進化しています。Atlasは、この世界モデルの最先端であり、単なるデータ処理ではなく、空間的な整合性(3D的な連続性)を保ちながら情報を生成する点が画期的です。これにより、仮想空間でのリアリティと実用性が飛躍的に向上します。
重要用語解説
- オムニモデル: Omni-modelの略。テキスト、画像、動画、3Dなど、異なる形式(モダリティ)のデータをすべて同時に処理し、理解できる汎用的なAIモデルを指します。
- 空間コンテキスト: 空間知能AIが、単なるピクセル情報ではなく、物体が3D空間上のどこに存在し、どのように配置されているかという「空間的な文脈」を理解し、処理する基盤となる概念です。
- ガウシアンスプラッティング: 近年注目される3D再構成技術の一つ。点群やメッシュではなく、ガウス分布(小さな球体)を多数配置することで、非常に高品質でリアルな3Dシーンを効率的に表現・出力する手法です。
今後の影響
本モデルは、映画・ゲーム業界の制作プロセスを根本的に変革する可能性を秘めています。特に、少ない入力データから高品質な3Dアセットやシミュレーション環境を生成できるため、映画のプリビズ(事前視覚化)や、ロボティクス学習のためのデータ生成(Real-to-Sim)において、コストと時間を劇的に削減すると予想されます。