Appleの研究チームが、複数カメラの映像から高精度な3D人物頭部モデルを生成するAI技術「HeadsUp」を発表しました。研究論文はarXivにて2026年5月5日に公開されています。
HeadsUpは、多数のカメラで撮影した映像をエンコーダー・デコーダー構造で処理し、ガウシアン・スプラッティングを用いた3D頭部モデルを出力します(※ガウシアン・スプラッティング:3D空間を多数の小さな楕円体で表現し、高速かつ高精度な描画を実現する技術)
本手法ではUVマップ(※3Dモデルの表面を平面の展開図として切り開いた座標データ)上に3D要素を配置する構造を採用しており、入力画像の枚数や解像度が変わっても再構成に使う要素数を一定に保てます。これにより、高解像度の多視点映像を使った学習が実現しています。
学習には1万人超の被写体を含むApple独自のデータセットが使用されました。既存の同種データセットと比べて約10倍の規模にあたります。モデルのスケーリング特性についても分析が行われており、被写体数・視点数・モデル規模それぞれの観点から品質とコストのトレードオフが論文内で検証されています。
この技術の特徴の一つは、一度学習すれば未知の人物に対しても追加の最適化処理なしに適用できる点です。テキストによる新規人物IDの生成や、ブレンドシェイプと呼ばれる表情制御パラメーターを使ったアニメーションへの対応も示されています。アバター生成やXR向けの人物表現技術への応用が見込まれます。
論文はエヴァンゲロス・ンタヴェリス氏ら複数の研究者が共同執筆し、arXiv(arXiv:2605.04035)にて閲覧できます。


