たった5秒でNeRFをトレーニング？！ Nvidia の新技術は Google の研究者の手に負えない | オープンソース

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

「これはおかしい！」

「18か月前、NeRFのトレーニングには5時間かかりました…」

「2か月前は、NeRFのトレーニングに5分しかかかりませんでした！」

「NeRFの訓練は5秒で完了する！？」

いったい何が起こったのでしょうか?これは実際に Google の研究科学者を驚かせました。

(以前人気のあった NeRF モデルを挿入します。バークレーと Google が共同で作成したもので、いくつかの静止画像から 3D のリアルな効果が生成されます)

同じようなレビューが沢山ありますよ〜

この技術を紹介するブログ記事も非常に人気があり、1日も経たないうちに数千件の「いいね！」を獲得しました。

これは NVIDIA の最新技術、つまりマルチ解像度ハッシュコーディングに基づくリアルタイムニューラルグラフィックスプリミティブであることがわかりました。

キツネの NeRF モデルのトレーニングにはわずか 5 秒しかかかりません。

さらに、このテクノロジーは NeRF をトレーニングするだけでなく、他のタスクでも驚異的なトレーニング速度を実現します。

数桁の組み合わせ高速化が達成されました。
高品質のニューラルグラフィックスプリミティブを数秒でトレーニングし、数十ミリ秒で 1920 x 1080 の解像度のグラフィックスをレンダリングできます。

単一 GPU でのリアルタイムマルチタスクトレーニング

まずは結果を見てみましょう。

ラボで目が回りそう？5分間のiPhoneビデオトレーニングで360度リアルタイムレンダリング効果を体験～

実物写真34枚を使って3D画像を再現したいですね〜

NeRF に加えて、ニューラルグラフィックスプリミティブの実装が 3 つあります。

ギガピクセル画像

著者はまた、ネットワークは最初からトレーニングされており、瞬きすると見逃してしまう可能性があることを親切に思い出させてくれます。

各ケースは tiny-cuda-nn フレームワークを使用してトレーニングおよびレンダリングされ、この実験は RTX 3090 でテストされました。

完全に接続されたネットワークによってパラメータ化されたニューラルグラフプリミティブのトレーニングと評価にはコストがかかります。

この論文では、コストを削減するために、汎用性の高い新しい入力エンコーディングを使用しています。

このエンコーディングにより、品質を犠牲にすることなく小規模なネットワークを使用できるようになり、浮動小数点数とメモリアクセスの数が大幅に削減されます。

具体的には、小さなニューラルネットワークに、トレーニング可能な特徴ベクトルのマルチ解像度ハッシュテーブルが追加されます。これらの特徴ベクトルの値は、確率的勾配降下法によって最適化されます。

つまり、このエンコーディングはタスクに依存しません。

研究チームは、ハッシュテーブルのサイズのみを変更し、すべてのタスクで同じ例とハイパーパラメータを使用したと述べています。

このプロジェクトは現在オープンソースになっており、興味のある方は以下のリンクをクリックしてください。

GitHub リンク:
https://github.com/NVlabs/instant-ngp
論文リンク:
https://nvlabs.github.io/instant-ngp/assets/mueller2022instant.pdf
プロジェクトリンク:
https://nvlabs.github.io/instant-ngp/

<<: 中国科学院は「触覚」を備えたロボットを開発し、豚の肝臓に低侵襲手術を成功させた。

>>: 改良された ResNet が Transformer を上回り、アーキテクチャの戦いが再燃します。著者は「革新はない」と述べた

ブログ

2023年のGenAI技術応用動向の観察

ブログ

警戒するのは困難：真剣な AI 研究がいかにしてコンピューター生成ポルノに変わったのか?

ブログ

勾配降下法からアダムまで！ 1つの記事でさまざまなニューラルネットワーク最適化アルゴリズムを理解する

ブログ

機械学習による建物のエネルギー効率の向上

ブログ

TensorFlow が新旧 Mac 向けに新バージョンをリリース、最大 7 倍高速化

ブログ

Stable Diffusion 3 の論文がついに公開され、アーキテクチャの詳細が明らかになりましたが、これは Sora の再現に役立つでしょうか?

ブログ

非常に高価なイエス像はレオナルド・ダ・ヴィンチによって描かれたのでしょうか？アメリカ人夫婦が美術品の贋作を検出するAIプログラムを開発、CNNが報道

ブログ

ただ！ Stack Overflow セルフヘルプがオープン

ブログ

たった5秒でNeRFをトレーニング？！ Nvidia の新技術は Google の研究者の手に負えない | オープンソース

単一 GPU でのリアルタイムマルチタスクトレーニング

2023年のGenAI技術応用動向の観察

警戒するのは困難：真剣な AI 研究がいかにしてコンピューター生成ポルノに変わったのか?

勾配降下法からアダムまで！ 1つの記事でさまざまなニューラルネットワーク最適化アルゴリズムを理解する

機械学習による建物のエネルギー効率の向上

TensorFlow が新旧 Mac 向けに新バージョンをリリース、最大 7 倍高速化

Stable Diffusion 3 の論文がついに公開され、アーキテクチャの詳細が明らかになりましたが、これは Sora の再現に役立つでしょうか?

非常に高価なイエス像はレオナルド・ダ・ヴィンチによって描かれたのでしょうか？アメリカ人夫婦が美術品の贋作を検出するAIプログラムを開発、CNNが報道

ただ！ Stack Overflow セルフヘルプがオープン

推薦する

AIビッグモデルデータ注釈「出稼ぎ労働者」の月収は5000元以下、単価は50セントから4セントに下落

2024 年のビッグデータ業界予測 (パート 2)

Meili United が VALSE カンファレンスで「ファッションをグラフィックで説明」する画像アルゴリズムの体験を共有する方法

ChatGPT 以外にも驚くような 6 つの AI ツール

2022 年の優れたインテリジェントオートメーションのトレンドと予測

人工知能は人類に潜在的に壊滅的なリスクをもたらす

ナレッジグラフを使用して RAG 機能を改善し、大規模モデルの幻覚を軽減する

自動化を推進するAIテストツール

筋肉の震えもはっきりと見えます！ 3D人体モデル自動生成アルゴリズム、第一著者北京大学チューリングクラス

OpenAIの「コピー＆ペースト」の背後にあるのは、盗作者が全てを無料で手に入れたいということ

2018年の人工知能の発展に関する5つの予測

インターネットの未来のために: AI が生み出すものと破壊するもの

単一 GPU でのリアルタイム マルチタスク トレーニング

推薦する

単一 GPU でのリアルタイムマルチタスクトレーニング