NVIDIAの研究チームは2026年5月14日、ワールドモデル「SANA-WM」の論文を公開しました。ワールドモデルとは、現実空間の物理的な動きや奥行きを学習し、それをもとに映像を生成するAIモデルです。
SANA-WMは、世界モデリングおよびEmbodied AI(身体性を持つAI)研究の新たなベースラインとして位置づけられています。
SANA-WMでは、1枚の静止画とカメラの移動経路を入力するだけで、60秒・720p解像度の動画を生成します。カメラの動きは6自由度(6-DoF)で制御できます。上下左右の移動に加え、パン・チルトなど回転方向の動きも指定できるため、空間を実際に移動しながら撮影したような映像を出力できます。
デモページでは、雪山のトレイルや水没した遺跡、砂漠のSF廃墟といった多彩なシーンのサンプル映像が公開されています。なお、デモ映像は2.6Bのベースモデルと170億パラメータのリファイナーを組み合わせた2段階のパイプラインで生成されています。
技術面では、既存のオープンソースモデルと比較して36倍のスループット(時間あたりにシステムや機器が処理できる「実質的なデータ量」や「作業の処理能力」のこと)を達成しながら、LingBot-WorldやHY-WorldPlayといったクローズドソース製品と同等の映像品質を実現しているとのこと。
学習にはH100を64基使用し、15日間で完了。標準的な推論はシングルH100で動作します。蒸留版にNVFP4量子化を適用した場合は、RTX 5090でも60秒・720pの動画を34秒で生成できます。
ライセンスはApache 2.0が採用されており、商用利用も可能です。論文はarXivで公開済みですが、コードおよびモデルの公開は近日予定となっています。最新情報はGitHubのNVlabs/Sanaリポジトリで確認できます。



