Home » ワールドモデルって何? AIが空間をつくる時代がもう始まっている【Podcastもぐラジオ要約版】


ワールドモデル 2026.05.18

ワールドモデルって何? AIが空間をつくる時代がもう始まっている【Podcastもぐラジオ要約版】

XR/メタバース/VTuber専門メディア「MoguraVR」は毎週、Podcast「もぐラジオ」を配信中。「テック・コンテンツ業界の最前線を掘る」というコンセプトのもと、すんくぼ(MoguraVR編集長)とゆりいか(MoguraVR副編集長)が業界の注目トピックを語ります。

今回取り上げる注目トピックは、AIが3D空間を丸ごと生成する「ワールドモデル」の台頭です。World Labsの「Marble」やテンセントの「HY-World 2.0」など、テキストや画像からリアルな3Dワールドを生成するAIが相次いで登場。ゲームやメタバース、フィジカルAIまで、空間をつくる時代の今を探ります。

(※本記事はポッドキャスト「もぐラジオ」の対談内容を要約・編集したものです)

編集部が感じるAIニュースの変化

ゆりいか:今回は「ワールドモデルって何?AIが空間をつくる時代がもう始まっている」です。最近、編集していて本当に困っているのが、AIの話題があまりにも多いことなんです。専門的で難しいものがプレスリリースでどんどん届く。「これはうちのメディアと関係があるのか」と調べるだけでも一苦労なんですが、よく掘っていくと本当に大きい話題が多いんですよね。

すんくぼ:少し前まではChatGPTやClaudeといった生成AIの話がテックニュースとして流れてきて、「自分たちの仕事が変わるかも」くらいの、どちらかというとお隣の領域という感覚でした。でも最近は、そもそもMogura VRが扱う話題の中にAIがどんどん入り込んできていますよね。

ゆりいか:そうなんです。特に目立つのが、3D空間を生成するタイプのAIです。最近一番話題になったのが、World Labsというところが出している「Marble」という新モデルで、大規模なワールド生成に対応したというニュースが届きました。

World LabsのMarbleと、授業で使った体験

すんくぼ:Marble自体は去年の秋ごろに出てきましたよね。World Labsって、AI業界でも世界的に知られた方が作っている会社で、資金調達はしていたのに何もリリースしていないまましばらく経って、ようやく去年の秋に出てきたという印象が強くて。写真や動画、360度写真などを入力すると空間を生成してくれるというものでした。

実はあのMarbleが公開された直後に、鳥取県の青翔開智高校さんでMoguraとコラボした授業があって。生徒さんとXRで何かを作ろうという授業だったんですが、3DCGのモデリングって一番ハードルが高い部分じゃないですか。BlenderをダウンロードしてCGを作りましょうとなっても、そこが大きな壁になってしまう。そのタイミングでちょうどMarbleが出てきたので、授業でさっそく使ってみたんです。

ゆりいか:なかなかアドリブが効いた授業ですね。

すんくぼ:イメージを伝えたり、自分が思い描いた世界を歩いてもらうという用途であれば、あれで十分だなと思いました。

ゆりいか:実際に使ってみてどうでしたか?

すんくぼ:まさにそこが大事なところで。自分が言葉や頭の中で思い描いているものが、スキルを習得せずにそのまま形になるというのは今までなかったことですよね。画像生成やコーディングでも同じことが起きていますが、工程がある意味すっ飛ばされる感覚があります。

ゆりいか:クオリティはどうでしたか?

すんくぼ:高いですよ。CGや3Dスキャンを日常的に扱っている人たちもびっくりするくらいのものが出てくる。再現度が高いというのが本当に重要で、「これはワークフローに組み込めるかも」と感じられるレベルです。ただ、どのAIでも同じことですが、出力されたものがそのまま完成品かというとそうではない。コーディングでも文章でも画像でも変わらず、手直しは必要です。

それをMarble自体もちゃんと理解していて、サービスの中に編集機能が最初から入っているんですよ。手直しが大前提の設計になっている。

話を戻すと、3Dの世界を生成するサービスを世界で最初に提供したのがこのWorld Labsで、さらに大規模なワールド生成にも対応してきた。そこが今回の大きなポイントだと思います。

テンセントが出した「HY-World 2.0」

ゆりいか:そしてそのMarbleの発表の翌日に来たのが、テンセントでした。

すんくぼ:テンセントは中国のインターネット企業で、世界最大規模のゲーム会社でもありますね。WeChatから始まって、今はゲーム業界で圧倒的な地位を持っています。

ゆりいか:そのテンセントが「HY-World 2.0」というモデルを出してきました。テキストや画像を入力すると3Dワールドを生成できるのですが、大きな特徴がアバターで特定の視点から歩き回れる空間を作れるという点です。しかも3Dガウシアン・スプラッティング(点群データをもとにシーンをリアルタイム描画する技術)にも対応していて、生成したデータを外部で活用することもできる。ただ見て終わりではなく、空間の中を実際に歩き回って何がどこにあるか確認できる。つまり、ゲームが作れるし、メタバースのベースになるモデルにもなれる。処理時間は約10分であると高速さをアピールしています。

すんくぼ:2025年秋頃のMarbleに続いて、MetaもHorizon Worldsのクリエイター向けにAIを使った制作ワークフローを打ち出していましたし、Robloxも似た取り組みをしていた。文章を作れるようになった、画像を作れるようになった、動画を作れるようになった、その先が3Dという流れで、世界中が取り組んでいるという感じですね。

ゆりいか:そうですね。しかもHY-World 2.0はオープンソースです。

すんくぼ:UnityとUnreal Engineへの直接インポートにも対応しているんですよね。MarbleがSaaSとして提供されているのに対して、テンセントのものはオープンソースで組み込み前提という、提供の形が全然違う。

ゆりいか:まだ実験的な段階だとは思いますが、開発者のフィードバックを得ながらアップデートしていく方針が透けて見えます。

Soraが実は3Dを使っていた話

すんくぼ:ここで少し補足すると、OpenAIが出した動画生成AI「Sora」も、実は動画を作るために裏側で3Dを疑似的に構築していたんですよ。

ゆりいか:それは知らなかったです。

すんくぼ:カメラを置いて撮影するのと同じように、疑似的に構築された世界でカメラワークを再現しているのが動画生成AIなんです。だから奥行きもカメラワークという概念もある。動画生成系のAIはただ動画を作っているわけではなく、裏側で3Dの世界構築をある程度やり始めていた。ただ、Soraの出力は「歩き回れる3D空間」ではなかった。GoogleのGenieもエルデンリングみたいなゲームをプレイしている動画が作れますというもので、中を自由に動き回れるというところまではいっていなかった。MarbleやHY-World 2.0で、ようやくそれが実現し始めているということです。

別途TripoやMeshyといった3Dオブジェクトを作るサービスも早くから存在していましたし、3D制作のワークフローはすでに変わり始めていましたが、それが「空間全体」に広がってきたというのが今の段階ですね。

Vibe Coding XRとArrival Space

ゆりいか:空間そのものを作るだけでなく、空間を生かしてAIを活用するという動きも出てきています。4月8日にGoogleが「Vibe Coding XR」を発表しました。

Vibe Coding(バイブ・コーディング)というのは、AIにアイデアや要件を伝えるだけでプログラムのコードを生成させる手法です。今回はそれをXRアプリに応用していて、3D空間の中に置くオブジェクトに対して、「こういう動きをして」と指示するだけで実装できるようになってきています。手の動きの認識や物理演算、空間認識に基づいた動作なども、デモでは科学実験をシミュレートするアプリとして紹介されていました。

すんくぼ:これはGoogleのリサーチ段階の話だと思いますが、出力先がいきなりXRに来たなという印象で。VRの体験設計では物理法則の実装やインタラクションのチューニングが特に大変な部分で、やり直しも時間がかかる。そこに直接来たのかと。

ゆりいか:GoogleはAndroid XRというAI搭載のOSも作っていますから、後々そこに組み込まれて、かぶった状態でデモを作ったりその場で空間を生成したりできるようになっていくんだと思います。

すんくぼ:さっきまでの3D生成の話と、このVibe Coding XRの話を組み合わせると、5年後・10年後には開発者やクリエイター向けだけでなく、デバイスを使っている一般ユーザーが「今日は雪景色を見たい」と言ったら雪景色が生成される、というレベルまで来る可能性がある。ARグラスで現実に重ねることもできる。

ゆりいか:「Arrival Space」というプラットフォームも今それに近い変化を見せていて面白いんですよ。3Dガウシアン・スプラッティングでスキャンした現実空間をアップロードしてバーチャルワールドとして共有できるサービスなんですが、そこにVibe Coding機能が入りました。

すんくぼ:ガウシアン・スプラッティングのワールドをシェアする手段として唯一無二のサービスという感じでしたが。

ゆりいか:それがだいぶ化け始めています。試してみたんですが、現実のスケートボード練習場をスキャンしてArrival Spaceにアップロードしていたものに、スケボーのオブジェクトを置いて遊べるように実装されていたんです。衝突判定の設定を自分で書かなくても、Vibe Codingで実装できていた。インタラクティブなオブジェクトも置ける。デジタルツイン的な実証実験にも使えるようになってきています。他のメタバースプラットフォームとは全然違う進化の仕方をしそうで、目が離せないですね。

RobloxはなぜここまでゴリゴリにAIを入れているのか

すんくぼ:この流れで外せないのがRobloxですね。AIをゴリゴリに入れているプラットフォームとして、コンセプトレベルで一番一致しているのがRobloxだと感じています。
Robloxには「誰でもどこでも作れるようにする」というクリエイター向けのミッションがあります。でもRobloxはLuaという言語を使っていて、それをちゃんと学ばないと実装できない。「誰でも作れる」と言いながら、知識がないとダメという矛盾がある。だからAIが入ることで、その矛盾を解消しようとしているわけです。

ゆりいか:プレイしているのが10代・20代の若い層で、プログラミングをまだ授業で習ったことがない子たちもいる。その子たちが「レースゲームを作りたい」と思った時に、まず1からRoblox Studioを勉強するか、AIを使って自分のアイデアを即座に形にするか、という話ですよね。

すんくぼ:GDCでクリエイターに見せてもらったのが、マリオカートみたいなゲームだったんですが、カートを自分でプロンプトを使って言葉で作れるんですよ。「こんな車にしたい」と言ったら生成されて、速度や加速度のパラメーターも一定のロジックで設定される。それでみんなでレースする。

ゆりいか:「俺はダンボール製の車で行くぜ」みたいなことができるわけですね。

すんくぼ:遊び方と体験が根本から変わる感じがしますね。Robloxはバックエンドのサーバー部分を一切クリエイターにやらせないという信念も昔からあります。同時接続1000万人を超えてもそれを支えるサーバーはプラットフォーム側が持つ。その分手数料を75%持っていくという仕組みで、クリエイターはサーバーを気にせず作りたいものに集中できる。AIも同じ文脈で、面倒な部分をRoblox側が引き受けてクリエイターの想像力を解放するという方向に全てを注いでいますね。
NPCに多言語で話させる機能もあるし、増え続けるワールドの一次スクリーニングにもAIを使っている。あらゆるところに使っていて、ワールドモデルという観点でも見ておくべきプラットフォームです。

そもそもワールドモデルとは何か

すんくぼ:ここで少し立ち返って、今話してきた「3D空間を作るAI」がどういうものなのかを整理したいと思います。

ChatGPTやClaudeの裏側にはLLM(大規模言語モデル)というモデルが存在していて、そこがAIの基盤になっています。言語を処理しているから「言語モデル」です。でも私たちが今いるこの空間は、言葉で全部記述できるものではありません。言葉は入力の入り口に過ぎない。

だから3D空間を作るには別のモデルが必要で、その裏側にあるのが「ワールドモデル」と今呼ばれているものです。OpenAIがLLMを育て、GoogleがLLMを育てているように、各社が今ワールドモデルを育てています。World LabsのMarbleの裏にあるワールドモデル、RobloxのAIの裏にいるモデル、それぞれが今強化されている段階です。

そのワールドモデルのアウトプットとして3D空間が生成される。またフィジカルAI(物理法則を学習しているAI)という形でシミュレーション環境を作り、ロボットがその環境を認識して現実と照らし合わせることで性能が上がっていく、という使われ方もあります。

ゆりいか:現実世界って構造と見た目だけじゃないですよね。物理法則、風の流れ、光の環境、硬さ、音、匂い。パラメーターが尋常じゃない量あって、しかもそれが相互に連動しているってことですね。

すんくぼ:現実世界の全てを分解しないと、本当の意味でのコピーにはならない。でもそれを全部コンピューターにやらせようとしたら、今でも処理負荷や電力の問題が語られているLLMの比じゃないくらい大変なことになる。だからパラメーターを用途別に絞るわけです。
工場向けのロボットなら、工場内で起こりうる動きや光の環境に限定する。工場の中でダンスを踊る人は出てこない。自動運転なら、認識が必要なのは天気・歩行者・対向車・障害物といった要素で、ぬいぐるみが何であるかを細かく理解する必要はなく、障害物として認識できれば十分です。

ゆりいか:なるほど、用途に絞ってチューニングしていくわけですね。

すんくぼ:フィジカルAIが今特に盛り上がっているのは、ロボットや自動運転という産業が変わるという意味でビジネスになるからです。投資する価値があるし、買い手もいる。ゲームやXRに向けて空間を作るAIがビジネス的な可能性を見せ始めたら、そちらも一気に動き出すと思います。

ゲーム業界とAIの微妙な関係

すんくぼ:ただゲーム業界はAIの活用自体がデリケートな問題を抱えている。Steamのゲームページに「このゲームには生成AIを使っていません」という表示が出るようになってきたり、外には言わないけど裏では使っているという話がちょろちょろ出てきたりしている。大手を振って「ワールドモデルでゲーム業界を変革します」とはなかなか言いにくい。裏でじわじわ広がるか、Robloxのように既存の業界の常識に縛られないプラットフォームが先行するか、という感じですね。

ゲームやXRに必要なインタラクションの実装という部分は、これからワールドモデルがさらに育つことで変わっていく。見た目は出てくるようになった、インタラクションの部分はどうだというのが次の段階で、Arrival Spaceのスケボーはできていたとはいえ、どこまでAIがやっていてどこまで手直ししたのかはわからない。そこはまだ伸びしろがある。

ゆりいか:この話、ゲームクリエイター・AI研究者・ビジネスマン、それぞれで全く視点の違う話になってきますよね。

すんくぼ:各プレイヤーがどう動くかもまだわからない。ChatGPTが出てきた時はみんなが使っていたのが、今はClaudeが職種や業界ごとに特化したアップデートを繰り返して、少しずつ置き換わっていく変化の仕方をしている。ワールドモデル周辺もどうなるかは未知数です。

AIレジェンドの参入と、スマートグラスとの接続

すんくぼ:注目している動きとして、MetaをやめたヤンルカンというAI界のレジェンドがいます。LlamaなどをMetaで作っていた方ですが、退社後にワールドモデルに注力していて、つい最近Xに「既存のフィジカルAIのスピードと精度を圧倒的に書き換えるものを出す」という投稿をしていました。

ゆりいか:みんなやる気がある。

すんくぼ:プレイヤーもどんどん増えていくでしょうね。そしてもう1つ僕らが追わなきゃいけないのがデバイスです。スマートグラスに入るAIという話で、今はChatGPT系の生成AIとエージェントが中心ですが、さらにマルチモーダル(複数の種類の情報を同時に処理する)なAIがグラスに入ってくる。スマートグラスやヘッドセットのAIの最終形は、このワールドモデルに接続しているんだと思っています。

ゆりいか:ワールドモデルで空間まで全部認識・生成できてしまったら、グラスをかけながらリアルタイムでそれが使えるわけですから。

すんくぼ:NianticはSpatial AIという言い方をしていたりとか、呼び方はまだ定まっていませんが、それが究極的なスマートグラスのAIになっていくんだと思います。見ておかないといけないですね。

ゆりいか:本当に思わぬところからやってきたなという感じがあります。全然関係ないと思っていたAIニュースやAIモデルの話も、ある程度触れておかないと急にこちらの話になってくるなと強く感じています。

すんくぼ:XRやメタバースを見てきた立場からすると、Robloxを見ていたらAIのアップデートが急に激しくなってなんだなんだとなり、理解しなきゃいけないなと。引き続きこういった話は定期的に取り上げていきたいと思います。

ゆりいか:RobloxのAIの話は改めて回を設けてやりましょう。

すんくぼ:そうですね、改めてやらなきゃいけないですね。

ゆりいか:2人に話してもらいたいネタがある方は概要欄のフォームからラジオネームとともにご連絡ください。

もぐら関連記事


CONSULTING / DEVELOPMENT

コンサルティング・開発サービス

Moguraの知見を、あなたのプロジェクトに

mogura_next

Moguraの知見を、あなたのビジネスに
編集長の久保田を筆頭に、XR/メタバースなどバーチャル領域を知り尽くす専門チームが、リサーチからコンサルティング、企画、開発までを一貫支援。
Mogura VRで培った豊富な情報力と業界ネットワークを強みに、企業・行政機関の成果につながる最適な解決策をご提案します。