このAIはガールフレンドの自撮りを手伝います: 写真から3D動画を生成

このAIはガールフレンドの自撮りを手伝います: 写真から3D動画を生成

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

自撮りが大好きな女の子たちは、最も美しい角度を見つけるために、いつも美しい写真を撮るのに長い時間をかけます。

たとえば、この女の子は本棚の前で 4 枚の自撮り写真を撮りましたが、どれにも満足できませんでした。

最も美しい角度を選ぶ作業を AI に任せることができるので、女の子たちはもう心配する必要がなくなりました。ほんの数枚の写真で、さまざまな角度からの自撮り写真を生成できます。

そして、AI が生成した動画の中で最も美しいと思う角度を見つけて、Moments で共有できます。

この AI はワシントン大学と Google が共同で開発したものです。

この方法は複雑な機器を必要とせず、スマートフォンのカメラとCPUのみを使用して計算とレンダリングを完了できます。これは、3D画像を生成するためのiPhone 12 Proの内蔵LIDARよりもはるかに安価です。

原理

nerfies という名前を聞くと、デジャブを感じますか? Nerfies は、実際には NeRF と Selfies という 2 つの単語を組み合わせたものです。

NeRF (Neural Radiance Field) は、Google が最近開発した 2D 画像から 3D モデルへの変換ですが、NeRF では、処理中は対象者が完全に静止している必要があります。

例えば、上の女の子が自撮り写真を4枚撮ったとき、頭の姿勢がどうしても変わってしまいました。NeRFを直接適用すると、その影響はひどいものになるでしょう。

ナーフィーとは、非剛体的に変形されたシーンを再構築できる、変形可能なニューラル放射場(NeRF) です。

著者らは、NeRF に基づいて、幾何学と物理シミュレーションの原理に基づく NeRF の弾性正規化を提案し、これにより 2D から 3D への変換の堅牢性がさらに向上しました。

変動性 NeRF では、望ましくない局所最小値を回避するために、弾性正則化、背景正則化、およびアニーリング手法が導入されました。

著者らは、各画像に潜在的な変形コード(ω)と外観コード(ψ)を関連付けています。カメラ光線は観測フレーム内でトレースされ、光線に沿ったサンプルは変形フィールドを使用して標準フレームに変換されます。変形フィールドは変形コード ω によって MLP としてエンコードされます。

さらに、変換されたサンプル位置 (x0、y0、z0)、視線方向 (θ、φ)、および外観コード ψ は、テンプレート NeRF モジュールを照会し、光線に沿ってサンプルを統合するための MLP への入力として使用されます。

遊び方が増える

可変 NeRF は、単に自撮りをするだけでなく、もっと興味深い目的に使用できます。

たとえば、「ヒッチコックズーム」効果を作成するには、以前は特別な写真撮影スキルが必要だったり、遠くから近くまでビデオを撮影して後処理したりする必要がありました。今必要なのは数枚の写真だけです。

シーンの角度を変える必要はないが、キャラクターの姿勢を変える必要がある場合はどうすればよいでしょうか?

Morphability NeRF は、任意の頭部ポーズの写真を左右間で線形補間できます。

最後に、もう 1 つの用途は、手ぶれ補正ビデオを生成することです。可変 NeRF はあらゆる角度で画像を生成できるため、手ぶれは手で処理し、安定性は NeRF に任せることができます。

作者はまだソースコードを公開していませんが、プロジェクトのホームページに GitHub ボタンが配置されており、オープンソース化する準備ができていることを示しているようです。ぜひ試してみたいですか?

プロジェクトアドレス:
https://nerfies.github.io/

論文の宛先:
https://arxiv.org/abs/2011.12948

<<:  第4回パラダイム NeurIPS 2020: ナレッジグラフ埋め込みの自動化

>>:  外国企業が人間の介入を必要としないAI犬訓練機を開発

ブログ    

推薦する

中国は人工知能研究で米国を追い越している

米スタンフォード大学の報告によると、2020年の学術誌におけるAI関連論文の引用率は中国が20.7%...

...

人工知能は人間の生活水準をどのように向上させることができるのでしょうか?

米国を例にとると、10年後には、成人一人当たり人工知能ビジネスから年間13,500ドルの利益を得るこ...

中国のAIチップ「覚醒」の5年

10 種類以上のチップが発売され、多くの合併や買収が行われています。これは、過去 500 日間の中国...

南洋理工大学の最新の視覚言語モデルの概要:事前トレーニング、転移学習、知識蒸留

コンピュータ ビジョン (CV) 研究における長年の課題として、視覚認識 (画像分類、オブジェクト検...

一貫性ハッシュアルゴリズムと分散ストレージへの応用

OStorageの責任者であるLi Mingyu氏は、同社のエンタープライズレベルのオブジェクトスト...

Natureサブジャーナル:ニューロモルフィックコンピューティングがさらに進歩し、科学者はニューロンとシナプスの人工シミュレーションを実現した

ニューロモルフィック コンピューティングは、人間の脳を構成するニューロンとシナプスのメカニズムを模倣...

ChatGPT を使用すると、わずか 3 時間で高品質の論文を書くことができます。

1. 論文のテーマと研究の方向性を決定するディスカッションと詳細化: ChatGPT で論文のトピ...

中国、自動運転を含む情報技術の注目の10大問題を発表

ハルビンで開催された2019年中国科学技術協会年次大会において、情報技術分野のハイエンドシンクタンク...

2020 年の AI チャットボット技術予測

2020 年に入り、さまざまな業界で人工知能技術の導入が進み続けています。この二次微分効果は、ビジネ...

ビッグデータと AI: 3 つの実際の使用例

ビッグデータと人工知能は、企業が新しい方法で顧客体験を向上させるのに役立ちます。 AIとビッグデータ...

Pudu Technology が「2021 年最も革新的な中国のケータリング ブランド トップ 100」に選出されました

最近、ケータリングボスインサイダーが主催する「Upward 2021・第6回中国ケータリングイノベー...

手術ロボットには依然としてリスクがあり、人工知能技術の応用は成熟する必要がある

外科用ロボット、人工知能心理学者、そして一連の「人工知能+」プロジェクト技術の統合が医療分野に急速に...

スタートラインで勝つ: データサイエンスに必須の 5 つのスキル

データサイエンスの分野は競争が激しく、人々はますます多くのスキルと経験を急速に身につけています。 「...