GoogleのAI研究開発組織・DeepMindは、ゲーム環境を自動生成できる世界モデル「Genie 3」を発表しました。プロンプトから、インタラクティブな環境を生成できます。前モデルの「Genie 2」よりも長い、数分間の一貫性の維持が可能です。AIエージェントやAGI研究に活用される見通しです。
Genie 3は秒間24フレーム、720pの解像度でリアルタイムのナビゲーションに対応しています。生成された環境は数分間、一貫した状態を維持可能です。また、水や光などの物理的特性や、生態系、動物の行動、植物など自然界の要素のモデリングが可能です。
さらに、アニメーションや歴史的な場所、異なる時代設定にも対応しています。従来モデルである「Genie 2」や「Veo」と比較して大幅に改善されており、リアルタイムでの相互作用や複数分間にわたる環境の一貫性などが強化されています。例えば、Genie 2の環境維持時間が最大1分間であったのに対し、Genie 3では数分間の一貫性が可能になりました。
環境の変化には、テキストで指示可能な「promptable world events(プロンプトで指示可能な環境事象)」という仕組みを採用しています。天候の変化や新しい物体、キャラクターの追加がテキスト指示で可能となっています。
「Genie 3」のような大規模世界モデルはAIエージェント(AIが自律的に動作するシステム)の研究にも貢献するとされます。世界モデルは、AIが環境の変化や自身の行動の影響を予測するための仕組みであり、Genie 3はその研究を推進する役割を果たすとしています。
実際にGenie 3は、Google DeepMindが開発するAIエージェント「SIMA」のトレーニング環境として、活用される見通しです。また、汎用人工知能(AGI)の開発における重要な進展の一つとして位置付けられています。より複雑な目標の達成を想定した長期的かつ一貫した行動シミュレーションが実施可能なため、教育や訓練、自律型ロボットなど多方面での活用も期待されています。
なお、Genie 3の課題としては、AIエージェントがとることのできる行動範囲(アクションスペース)には限界があり、他のAIエージェントとの複雑な相互作用のモデリングには改善が必要とされています。また、実世界の正確な描写やテキストの表示にも限界があります。インタラクション可能な時間が数分間にとどまっている点も現在の制約となっています。
Google DeepMindは、同社の責任ある開発・イノベーションチームと協力し、安全かつ責任ある方法で技術開発を進めていることを明らかにしています。そのため、現時点では限られた研究プレビューという形で、学者やクリエイターに限定的に提供されている状況です。将来的には、より多くのテスターへの提供を検討しつつ、利用者からのフィードバックを収集していく計画です。
(参考)Google

