DALL・Eは発売からわずか2日で復刻されたのか?公式論文はまだ発表されていないが、専門家らはすでにそれを再現している。

DALL・Eは発売からわずか2日で復刻されたのか?公式論文はまだ発表されていないが、専門家らはすでにそれを再現している。

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

意外なことに、OpenAI が DALL·E を発表するとすぐに、誰かがすでにそれを再現していました。

まだ半完成品ではありますが、大まかなフレームワークは構築されており、現在はサードパーティの作者であるPhilip Wang 氏が作業中です。

DALL·Eは、2日前に発表されたばかりのテキストから画像へのネットワークフレームワークです。 今のところ、プロジェクトの結果のみが発表されており、公式の論文さえまだ公開されていません

この論文はまだ出版されていないが、すでに再掲載され始めている。

この論文の転載の根拠は、 Yannic Kilcherというブロガーが作成した YouTube ビデオです。

動画では、DALL·Eの原理的な構造について考察しました。

彼は、これらの推測は実際の状況を反映しておらず、おそらくDALLEの論文が発表されれば彼の予想は覆されるだろうと述べた。

Yannic 氏は、DALL·E はVQ-VAEモデルと GPT-3 に似た言語モデルを組み合わせたものであるべきだと考えています。

GPT-3 などの言語モデルは非常に強力な言語モデリング機能を備えており、入力テキストの説明を適切に分割して理解できます。

[[374674]]

VAE モデルは強力な画像生成トランスフォーマーです。トレーニング後、モデルはエンコーダー部分を削除し、画像生成用のデコーダーのみを残します。

これら 2 つを組み合わせると、下の図の小さな四角形のように、理解したテキストに基づいて、さまざまな入力オブジェクトを実用的な意味を持つ画像に組み合わせることができます。

たとえば、人物、太陽、木を入力すると、モデルは「太陽の下の木の下に座っている人物」を描いた画像を出力できます。

どうやってそれを達成するのでしょうか?

まず、VQ-VAE のモデル原理を簡単に分析してみましょう。

VAE と同様に、これも Transformer 構造モデルです。エンコーダーは画像をエンコードした後、エンコードされたデータを潜在空間に送信し、デコーダーは潜在空間から画像を再構築します。

VAE と比較すると、VQ-VAE の潜在変数の各次元は離散整数です。つまり、その潜在空間は実際にはさまざまな抽出されたベクトル情報を含むコードブックです。

DALL·E では、このコードブックは本質的に語彙集に相当します。

この語彙は、特に画像のさまざまな説明を保存するために使用されます。

入力画像をエンコードする場合、画像は基本的にさまざまなピクセル ブロックに分割されます。

この期間中に、さまざまな画像情報が生成されます。

空色のグリッドに「空」の説明情報が含まれていると仮定すると、再構築中にデコーダーは「空」情報を読み取り、上部に一連のピクセルを割り当てて空を生成します。

VQ-VAE のトレーニングが完了すると、モデルはデコーダーだけが理解できるコードブックを取得します。

その際、GPT-3に似た言語モデルが入力テキストをデコードし、コーディングブックだけが理解できるベクトル情報に変換します。

次に、コードブックはこの情報を並べ替え、各ピクセル ブロックに対して生成する必要があるデータを順番にリストし、デコーダーに伝えます。

デコーダーはこれらのピクセル データを合成して最終画像を取得します。

この目標を達成するためには、GPT-3と同様の言語モデルをトレーニングし、事前にVQ-VAEモデルを事前トレーニングする必要があります。

さらに、2つの融合モデルをトレーニングする必要があります。

筆者が再現したDALL·Eもこのビデオ解析の原理に基づいています。

プロジェクト自体について

現在、DALL・E 複製プロジェクトは完了しておらず、作者はまだ作業中(WIP)ですが、すでに 700 を超えるスターを獲得しています。

著者は、DALL·E のPyTorchバージョンを作成したいと考えています。現在のフレームワークには、VAE トレーニング、CLIP トレーニング、および VAE と CLIP の融合後のモデルの事前トレーニングがすでに含まれています。

さらに、DALL·E のトレーニングと、事前トレーニング済みの VAE モデルの DALL·E モデルへの統合も含まれます。

上記のモジュールをトレーニングした後、DALL·E を使用してテキストから画像を生成できます。

現在、著者はDALL·Eモジュールのコードを再現しています。

作者は、DALL·E 部分が完成したら CLIP モデルも完成させると約束しました。

著者について

[[374678]]

フィリップ・ワンはコーネル大学で学士号と修士号を取得し、ミシガン大学医学部で博士号を取得しました。

彼の研究対象は AI (ディープラーニング) とヘルスケアです。現在、GitHub で 1.7 千人のフォロワーがいます。

DALL·E自体に関しては、ビデオ分析ブロガーのYannic氏も、このような良好な結果が達成された理由はモデル設計だけによるものではないと述べています。

DALL·E は、GPT-3 と同様に、モデルのトレーニングに大規模なデータセットを使用する可能性が高くなります。

ネットユーザーたちは、これをトレーニングするために使用された GPU の数は想像しがたいと述べ、気候は再び暖かくなるだろうと語った。

では、このプロジェクトを完全に再現したい場合、最も難しいのは実はハードウェア部分なのでしょうか? (手動犬頭)

プロジェクトアドレス:
https://github.com/lucidrains/DALLE-pytorch

DALL·E ビデオ分析:
https://www.youtube.com/watch?v=j4xgkjWlfL4

<<:  李碩:AIは産業知能の波を促進する

>>:  胡勇 | 人工知能の時代を生き抜き、成長する

ブログ    
ブログ    

推薦する

2019年のAI技術のブレークスルーをすべて見る

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

マイクロソフトの小型モデルが大型モデルに勝利:27億のパラメータ、携帯電話で実行可能

先月、マイクロソフトのCEOであるサティア・ナデラ氏はIgniteカンファレンスで、自社開発の小型モ...

サプライチェーン管理においてAIがすでに優れた成果を上げている分野

サプライ チェーンは、製品の設計から調達、製造、流通、配送、顧客サービスまで、さまざまなアクションを...

中国AIGC広告・マーケティング業界パノラマレポート:5つの大きな変化と4つの大きな影響、生成AIにより「1人」のための広告作成が可能に

インターネット トラフィックの配当が薄れるにつれ、広告およびマーケティング業界は既存の市場シェアをめ...

...

「象の鼻」ロボットが登場!ボトルキャップを開けたり、家事も問題なく行えます。

ロボットに対する従来の印象は、四角くて冷たい機械、または人間に似た機械ですが、柔らかいロボット、特に...

音声インターフェース:私たちはインタラクションの次の時代の瀬戸際にいる

[[185877]]コンピュータ処理、音声認識、モバイル通信、クラウドコンピューティング、ニューラル...

Open LLM リストが再び更新されました。Llama 2 よりも強力な「Duckbill Puss」が登場します。

OpenAI の GPT-3.5 や GPT-4 などのクローズドソース モデルの優位性に挑戦する...

...

...

人類の未来における人工知能の重要性

人工知能(AI)は私たちが住む世界を急速に変えています。医療から金融まで、人工知能は産業を変革し、私...

自然言語処理に加えて、単語埋め込み(Word2Vec)を使用してこれを行うこともできます。

機械学習の手法を使用して問題を解決する場合、適切なデータを持つことが重要です。残念ながら、生データは...

PythonでQQロボットを開発する方法

序文この記事の目的はPythonでMiraiロボットを開発することですが、最初のチュートリアル、特に...

金融分野で一般的に使用されているディープラーニングモデルのインベントリ

[[208429]]本日公開したこの記事では、著者の Sonam Srivastava が金融分野に...

Google Cloud Next: カンファレンス全体を通じて人工知能について語る

最近、Google は年次カンファレンス Google Cloud Next を開催しましたが、オー...