この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。 2021年にOpenAIで最も注目され、最もクリエイティブな製品といえば、Dall Eでしょう。これは、テキストを与えられれば、必要な画像を生成できる「AIデザイナー」です。しかし残念ながら、Dall·E は中国語をサポートしていません。 さて、最近、清華大学のTang Jie氏のチームは、中国語のテキストを画像に変換できる「Dall·Eの中国版」であるCogViewを開発しました。 CogView は、「山を流れる小川」などの現実世界のシーンを生成できます。 「猫豚」など、存在しない仮想のものを作成することもできます。 時々、「悲しい博士課程の学生」のように、少しブラックユーモアもあります。 CogView は現在、任意のテキストを入力してグラフィックに変換できる試用 Web ページも提供しています。これは、いくつかのキーワード変更オプションしか提供していない OpenAI の Dall E とは異なります。 絵画スタイルや衣服のデザインを指定できるCogView は、テキストから画像を入力するだけでなく、スタイルの学習、超解像度、テキストと画像のランキング、ファッション デザインなど、さまざまな微調整戦略を使用して下流のタスクを処理することもできます。 CogView を使用する場合、さまざまなスタイル制限を追加して、さまざまなペイント効果を生成できます。微調整中は、画像に対応するテキストも「XX風画像」となります。 CogView がデザインした衣服も非常にリアルで、偽りの痕跡もなく、電子商取引の表示ページのように見えます。 原理CogView は、VQ-VAE トークナイザーの 40 億のパラメータを持つ Transformer です。全体的な構造は次のとおりです。 CogView は GPT モデルを使用して、個別の辞書上のトークン シーケンスを処理します。学習プロセスは 2 つの段階に分割されます。エンコーダーとデコーダーは再構築損失を最小限に抑えるように学習し、単一の GPT はテキストを連結して 2 つの負の対数尤度 (NLL) 損失を最適化します。 その結果、最初のステージは純粋な離散オートエンコーダーに退化し、画像をラベル付きシーケンスに変換する画像トークナイザーとして機能します。2 番目のステージの GPT は、モデリング タスクの大部分を引き受けます。 画像トークナイザーのトレーニングは非常に重要です。最近傍マッピング、ガンベルサンプリング、ソフトマックス近似の 3 つの方法があります。Dall E は 3 番目の方法を使用していますが、CogView の場合、3 つの方法に大きな違いはありません。 CogView のバックボーンは、48 層、40 個のアテンション ヘッド、40 億個のパラメーター、および 2560 の隠し層サイズを持つ単方向トランスフォーマーです。 トレーニング中に、著者らは CogView にオーバーフロー (NaN 損失を特徴とする) とアンダーフロー (発散損失を特徴とする) という 2 つの不安定性を発見し、それらを解決するために PB-Relax と Sandwich-LN を提案しました。 最後に、CogView は MS COCO で最も低い FID を達成し、以前の GAN ベースのモデルや同様の Dall E を上回りました。 手動評価テストでは、CogView が 37.02% の確率で最良として選択され、他の GAN ベースのモデルをはるかに上回り、Ground Truth (59.53%) と競合できるようになりました。 なお、作者はGitHubプロジェクトページを公開していますが、まだコードはありません。興味のある友人は注目して、コードが公開されるのを待ってください。 論文の宛先: デモを試す: GitHub ページ: |
<<: 毎秒400ペタフロップスの計算能力を備えた最速のAIコンピュータが稼働中です。宇宙最大の3Dマップが構築中
[[187064]]人工知能を研究するアメリカの企業カーネルの投資家ブライアン・ジョンソン氏は、埋...
データプライバシーの制限により、複数のセンター間でのデータ共有は制限されており、フェデレーテッドラー...
[[212805]]人工知能の概念は1956年に初めて提唱されました。60年間の浮き沈みを経て、人...
今日、健康は精神的、社会的、政治的、経済的、都市的健康など、さまざまな分野に関連しています。今日、都...
[[428596]]専門家はCNNに対し、フェイスブックのアルゴリズムは改善できる可能性があると語...
[[430244]]現在、人工知能は生産性の向上を可能にし、さまざまな産業のインテリジェント化と新旧...
[[154315]]決定木分類アルゴリズム決定木誘導は古典的な分類アルゴリズムです。これは、トップダ...
ビジネスや社会で AI の利用が広まるにつれ、企業は機械モデルに現れる人間の偏見に注意を払う必要があ...
すべてのアプリにおいて、製品自体が登場する前、アイデアが生まれた時点で、すでに製品マーケティングの問...
序文貪欲は人間が本来持つ能力であり、貪欲アルゴリズムとは貪欲な意思決定に基づいた全体計画の総称です。...
序文インタビュアー: 「仮想 DOM と Diff アルゴリズムをご存知ですか? 説明してください。...
ロボット歯科医はすでに存在するのでしょうか?まだ……。しかし、歯科医院では、日常的なケアに新しい技術...
この記事では、主に 8 つの一般的なソート アルゴリズムの基本概念とそれらの Python 実装を紹...