Home » NVIDIAのワールドモデル「SANA-WM」公開、1枚の画像から1分間の720p映像を生成


ワールドモデル 2026.05.22

NVIDIAのワールドモデル「SANA-WM」公開、1枚の画像から1分間の720p映像を生成

NVIDIAの研究チームは2026年5月14日、ワールドモデル「SANA-WM」の論文を公開しました。ワールドモデルとは、現実空間の物理的な動きや奥行きを学習し、それをもとに映像を生成するAIモデルです。

SANA-WMは、世界モデリングおよびEmbodied AI(身体性を持つAI)研究の新たなベースラインとして位置づけられています。

SANA-WMでは、1枚の静止画とカメラの移動経路を入力するだけで、60秒・720p解像度の動画を生成します。カメラの動きは6自由度(6-DoF)で制御できます。上下左右の移動に加え、パン・チルトなど回転方向の動きも指定できるため、空間を実際に移動しながら撮影したような映像を出力できます。

デモページでは、雪山のトレイルや水没した遺跡、砂漠のSF廃墟といった多彩なシーンのサンプル映像が公開されています。なお、デモ映像は2.6Bのベースモデルと170億パラメータのリファイナーを組み合わせた2段階のパイプラインで生成されています。

技術面では、既存のオープンソースモデルと比較して36倍のスループット(時間あたりにシステムや機器が処理できる「実質的なデータ量」や「作業の処理能力」のこと)を達成しながら、LingBot-WorldやHY-WorldPlayといったクローズドソース製品と同等の映像品質を実現しているとのこと。

学習にはH100を64基使用し、15日間で完了。標準的な推論はシングルH100で動作します。蒸留版にNVFP4量子化を適用した場合は、RTX 5090でも60秒・720pの動画を34秒で生成できます。


ライセンスはApache 2.0が採用されており、商用利用も可能です。論文はarXivで公開済みですが、コードおよびモデルの公開は近日予定となっています。最新情報はGitHubのNVlabs/Sanaリポジトリで確認できます。

参考

SANA-WM
arXiv
GitHub

もぐら関連記事


CONSULTING / DEVELOPMENT

コンサルティング・開発サービス

Moguraの知見を、あなたのプロジェクトに

mogura_next

Moguraの知見を、あなたのビジネスに
編集長の久保田を筆頭に、XR/メタバースなどバーチャル領域を知り尽くす専門チームが、リサーチからコンサルティング、企画、開発までを一貫支援。
Mogura VRで培った豊富な情報力と業界ネットワークを強みに、企業・行政機関の成果につながる最適な解決策をご提案します。