1時間から3.5分まで、Metaの新しいアルゴリズムは携帯電話で3D顔データを収集できる

1時間から3.5分まで、Metaの新しいアルゴリズムは携帯電話で3D顔データを収集できる

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

人間の顔の 3D モデリングを完了するには、いくつのステップが必要ですか?

データ収集段階での答えは、「携帯電話 1 台 + 3.5 分」でした。

そうです、わずか 3.5 分間のデータで、忠実度が高く運転可能な、リアルな 3D 顔ポートレートを生成するのに十分です。

この研究は、ザッカーバーグ氏のメタバース プロジェクトの中核部門である Meta Reality Labs によるものです。この論文はSIGGRAPH 2022に採択されました。

著者らは、このアプローチは VR アプリケーションに適していると述べています。

つまり、VRの世界では、将来的には漫画のような顔で登場する必要がなくなるかもしれないのです。

代わりに、太った友達の本当の姿に簡単に会うことができます。

方法の原理

この結果を達成するための方法のフレームワークを下の図に示します。

具体的には、3つの部分に分かれています。

まず、大規模なマルチビュー顔データセットを使用してスーパーネットワークをトレーニングします。このスーパーネットワークは、ニューラルネットワークデコーダーを通じて個人のアバターパラメータを生成できます。

データセット内の顔は、マルチビューキャプチャシステムによって収集され、さまざまな年齢、性別、人種の 255 人の参加者の顔画像データが含まれています。

△左が撮影装置、右が撮影した顔

この巨大な3D顔を撮影する装置は、2019年にMeta社によって開発された。171台の高解像度カメラを搭載し、1秒あたり180GBのデータを記録できる。収集時間は約1時間です。

このハイパーネットワークでは、デコーダーの基本的な構成要素は、バイアス マップを備えた畳み込みアップサンプリング レイヤーであることに留意してください。

これらのバイアス マップは、レイ トレーシングを介してアバターをレンダリングするためのボリューム セルを生成するために使用されます。

さらに、デコーダー アーキテクチャは視線を他の顔の動きと区別できるため、VR アプリケーションでは視線追跡システムをより直接的に活用できます。

第二に、軽量な表情キャプチャです

この研究では、顔を撮影するために深度カメラを備えたスマートフォンのみが必要でした。

実験では、研究者らはiPhone 12を使用した。

収集プロセスは次のようになります。

収集されたデータは次のように処理されます。

  • 顔画像の各フレームの幾何学的形状とテクスチャを取得します。
  • 入力 RGB 画像に対して顔のランドマーク検出とポートレートのセグメンテーションを実行します。
  • 検出された顔のランドマーク、セグメンテーションのアウトライン、深度マップに合わせてテンプレート メッシュをフィットおよび変形します。
  • 各フレームのテクスチャはアンパックされ、集約されて完全な顔のテクスチャが得られます。

モデルをさらに改善する過程で、65 個の特定の表現を収集する必要があります。

最後に、この方法で出力される 3D 顔アバターは、ユーザーの外見に高度に一致するだけでなく、グローバル表現空間を通じてさらに駆動および制御することもできます。

研究者らは、採取プロセス全体には約3.5分かかると述べた。

ただし、モデリング プロセスはリアルタイムではなく、データ処理には数時間かかることに注意してください。

実験結果

ここまで述べてきましたが、どれくらい効果があるのか​​実験結果を見てみましょう。

Pinscreenの「1枚の写真から3Dデジタルアバターを構築する」方法(CVPR 2021)と比較すると、この方法はよりリアルな顔モデルを生成できます。

ハイデルベルク大学、ミュンヘン工科大学、マックス・プランク研究所などの研究機関による論文「Neural Head Avatars from Monocular RGB Videos」で提案された方法と比較すると、この方法はより忠実度の高い結果を生成できます。

しかし、著者はこの方法には、長い髪や眼鏡をうまく保持できないこと、アーティファクトが発生しやすいことなどの限界もあると指摘しています。さらに、この方法では照明条件に関しても一定の要件があります。

<<:  時代遅れのリソグラフィー機械は中国に販売できません!米国がオランダのASMLに不当な圧力をかけ、国産チップが再び抑制される

>>:  人工知能技術が英語学習にどのように役立つかについての簡単な議論

ブログ    
ブログ    

推薦する

...

ファーウェイの鄭葉来氏:イノベーションと包括性、テクノロジーが産業インテリジェンスの向上を促進

11月11日、中国ハイテクフェア2020が深センで開催されました。ファーウェイクラウドコンピューティ...

...

GauHuman オープンソース: ガウススプラッティングに基づく高品質の 3D 人間高速再構成およびリアルタイム レンダリング フレームワーク

論文タイトル: GauHuman: 単眼の人間動画からの関節型ガウス分布スプラッティング論文ダウンロ...

「2024年最重要AIチャート」が大拡散中!オープンソースのAIモデルは独自のモデルよりも優れているとルカン氏は称賛

最近、この写真はAIコミュニティで広まり始め、LeCun氏もそれを転送しました。この図は、AI オー...

...

人工知能は将来の建築をどのように変えるのでしょうか?

自動化された AI システムは、建物の暖房と冷房を最適化して効率性と持続可能性を向上させるのに役立ち...

技術革新は「プロトタイプ」で止まるわけにはいかない…

[[270666]] [51CTO.com クイック翻訳] 昨今、クラウドコンピューティング、ブロ...

顔認識の国家基準に関する意見募集:顔のスキャンや嗜好予測の義務化はなし

近年、顔認証が話題になっていますが、現実には、通知なく顔認証データを取得したり、強制的に顔認証させら...

AIとセキュリティ:繋がる双子

人工知能とセキュリティは、非常に重要かつ興味深い2つの分野です。それぞれの空間について書かれた本はあ...

...

ビッグデータと人工知能に関する冷静な考察

ビッグデータと人工知能は今年最もホットな話題であり、特に司法分野ではホットです。ビッグデータ時代の司...

韓国初のAI女性キャスターが誕生。本物と間違えられ議論を巻き起こす。AIサベイニングはすでに存在していた

最近、韓国のテレビ局が韓国初の人工知能キャスターを導入した。この新しく作られたAI女性キャスターは、...

スマート物流が一般的なトレンドであり、ロボット、ドローン、5Gの価値が強調されている

近年、電子商取引経済の急速な発展と人々の生活水準の継続的な向上により、物流の需要が急増していますが、...

...