公式論文コードが公開されました。OpenAIはGPT-3のイメージ版をどのように実装したのでしょうか?

公式論文コードが公開されました。OpenAIはGPT-3のイメージ版をどのように実装したのでしょうか?

OpenAIはDALL-Eに関するいくつかの論文と実装コードを公開しました。

今年初め、OpenAI の GPT-3 の画像バージョンと 120 億のパラメータを持つ DALL-E がコミュニティを席巻しました。この大規模なモデルは、自然言語で表現された多数の概念を適切な画像に変換することができ、驚くべき結果をもたらします。

「アボカド型の椅子」と入力すると、さまざまな形の緑色のアボカド型の椅子の画像が表示されます。

GPT-3と同じであれば、OpenAIがDALL-Eの公式論文と実装コードを公開するのを皆が楽しみにしています。

約 2 か月の待機の後、DALL-E の論文とコードがついに公開されました。

ただし、このプロジェクトは更新中です。記事執筆時点では、DALL-E は画像再構成部分 d-VAE を使用してトレーニングされた CNN エンコーダーとデコーダー部分のみを公開しており、Transformer コード部分はまだ公開されていません。そうしないとデータセットを使用できません。この論文ではd-VAE論文も掲載されました。

  • プロジェクトアドレス: https://github.com/openai/DALL-E
  • 論文アドレス: https://arxiv.org/abs/2102.12092

今後、OpenAI がさらに技術的な詳細を発表することを期待するばかりです。

DALL-Eコードの一部はオープンソース化されている

これは、DALL·E で使用される d-VAE の公式 PyTorch パッケージです。 DALL-E/notebooks/usage.ipynb プログラムを実行する前に、ソフトウェア パッケージをインストールする必要があります。コードは次のとおりです。

 pip install git+https: //github.com/openai/DALL-E.git

デコーダー、エンコーダーコード

d-VAE 論文

今年の初め、論文が公開される前、何人かの人々がこの現象を再現し始めました。再現の根拠となったのは、ブロガーが作成した YouTube 動画で、その中で彼らは DALL·E の原理的な構造について推測していました。論文が公開された今、彼の予想は覆されたのだろうか?

従来、テキストから画像への生成は、固定されたトレーニング データセット上でより優れたモデリング仮説を見つけることに重点を置いてきました。これらの仮定には、複雑なアーキテクチャ、補助的な損失、またはトレーニング中に提供されるオブジェクト部分のラベルやセグメンテーション マスクなどの補助的な情報が含まれる場合があります。この研究では、テキストと画像のトークンを自己回帰モデリングのための単一のデータ ストリームとして扱うための、単純なトランスフォーマー ベースのアプローチを提案しました。十分なデータと拡張機能があれば、ゼロショット方式で評価した場合、私たちのアプローチは以前のドメイン固有のモデルと競争力があります。

<<:  データサイエンスで勝つ: 製薬会社の幹部が始めるための 5 つのヒント

>>:  深層学習におけるチューリング賞受賞後のベンジオ氏の研究の核心は何ですか?因果表現学習

ブログ    
ブログ    
ブログ    
ブログ    
ブログ    
ブログ    

推薦する

国連チーフAIアドバイザーとの独占インタビュー:AIは完璧だと期待しているが、決して完璧ではない

[[384962]]ビッグデータダイジェスト制作出典: informationweek編纂者:張大毓...

...

人工知能導入の第一歩:企業で最も一般的な3つのアプリケーション

人工知能はあらゆる業界の基盤になりつつありますが、多くの企業はまだどのように始めればよいかわかってい...

AI時代ではモデルは大きいほど良い

今年も4分の3が過ぎた。テクノロジー業界から見れば、「室温超伝導」が実現可能であることが公式に証明さ...

人工知能が教育を改善する32の方法

過去数年間、ソーシャルメディアから音声認識、モノのインターネットから新しい小売業、ロボットから自動運...

一つ選びますか? Python 機械学習の実践的なヒント

原題は「Some Essential Hacks and Tricks for Machine Le...

ニューラル放射フィールドはポイントベースで、NeRFよりも30倍高速なトレーニング速度と優れたレンダリング品質を備えています。

2020 年はボリューメトリック ニューラル レンダリングが爆発的に普及する年です。たとえば、Ne...

飛行、地中への潜水、海への潜水も可能な多機能ソフトロボット

2月10日のニュース(劉亜珠)最近、科学者たちは変形して運転、飛行、水泳ができる新しい「ソフト」ロボ...

予想:2018年ワールドカップで優勝するのはどの国でしょうか?人工知能アルゴリズム分析が結果を教えてくれる

最近、世界で最も注目されているイベントはワールドカップです。現在、ロシアでは2018年ワールドカップ...

人工知能、遺伝子編集、ノーベル賞の画期的な進歩により、80歳でも40歳に見えるようになる

年齢を重ねるにつれ、老化を遅らせて若さを取り戻すことが多くの人の夢となります。 クレオパトラにしろ、...

...

機械学習におけるラベル漏洩とそれがモデルのパフォーマンスに与える影響について紹介します

優れた、またはほぼ優れたモデルのパフォーマンスに圧倒されていますか? あなたの幸せは裏切られています...

新しい消費者向け IoT と人工知能の開発を加速させる機会は何でしょうか?

近年、世界的な技術開発の加速化が進み、新世代の情報通信技術が次々と導入され、数多くの新たなビジネスモ...