Google の新しい AI が話題に！世界で最も長い単語を描くことができる

友達、この英語の単語が何だか知っていますか？

超微細珪火山性肺炎。

これは45文字からなる世界最長の単語で、「火山性シリカ粒子が肺に沈着することで起こる病気」（一般に火山性珪肺症として知られている）を意味します。

しかし、単語を綴る代わりに、それを描くように求められたらどうでしょうか?

（読むこともできないのに、どうやって絵を描くの？？？）

Google の最新 AI である Parti は、このタスクを簡単に処理できます。

この単語を Parti に入力すると、肺疾患の妥当な画像がいくつか生成されます。

しかし、これはPartiの能力を試すための小さなテストに過ぎない。Googleによれば、これは現時点で最も先進的な「テキストから画像へ」AIだという。

たとえば、シドニーオペラハウスとエッフェル塔を組み合わせるように指示すると、出力は次のようになります。

（知らない人は絵だと思うかも）

また、アルゴリズムのアプローチという点でも、Google 独自の Imagen とは異なります。Parti は「AI による絵画」を新たな高みに引き上げたと言えます。

Google AI の責任者であるジェフ・ディーン氏も、とても楽しんでいる様子で、立て続けにツイートを投稿しました。

200億のパラメータまで拡張可能：より現実的で、より「インテリジェント」

実際、Parti の機能はこれを超えています。

一方では、このモデルは 200 億のパラメータまで拡張できるため、生成される画像はより詳細でリアルなものになります。

数語であっても、50 語以上の短い段落であっても、明確に表示できます。

たとえば、バイオリンの背面、バイオリンの背面。

あるいは、ゴッホの「星月夜」に描かれた夜景かもしれません。 p.s.、この段落には 67 語あります。

結果、パルティは全く問題なく、いろんな絵を描いてくれました～

これはパティの2番目に大きな能力でもあります。彼は細部にまで気を配るだけでなく、スタイルも多彩です。

「スーツを着たアライグマ、シルクハット、杖、ゴミ袋」といった奇妙な描写もあり、これもまた、細部を見失うことなく派手さを演出している。

スタイルとしては、ゴッホスタイル、エジプトのファラオスタイル、ピクセルスタイル、伝統的な中国絵画スタイル、抽象スタイルなどがあります...

時にはダジャレを言うこともあります。

（トアデイ）

特にテスト結果に関して言えば、Parti は MS-COCO および Localized Narrative (LN、4 倍長い説明) の FID スコアで最先端の結果を達成しました。

特に、MS-COCOゼロサンプルのFIDスコアはわずか7.23ですが、微調整FIDスコアは3.22であり、これは以前のImagenおよびDALL-E 2を上回っています。

すべてのコンポーネントはトランスフォーマーです

1か月後、GoogleはAIによる絵画制作を新たなレベルに引き上げたが、その秘密は非常にシンプルだと著者は語った。

Parti は、テキストから画像への生成を主にシーケンスからシーケンスへのモデリングと見なしています。これは機械翻訳に多少似ています。機械翻訳では、テキストトークンがエンコーダーへの入力として使用され、ターゲット出力がテキストから画像に変更されます。

構造的には、すべてのコンポーネントはエンコーダー、デコーダー、イメージタガーの 3 つの部分のみで構成され、すべて標準の Transformer に基づいています。

まず、Transformer ベースの画像タグ付けツール ViT-VQGAN を使用して、画像を個別のタグシーケンスにエンコードします。

その後、Transformer エンコード/デコード構造を通じて、パラメータは 200 億に拡張されます。

最も初期の GAN を除いて、テキストから画像への生成に関するこれまでの研究は、おおまかに 2 つのアプローチに分けることができます。

1 つは自己回帰モデルに基づいており、最初にテキスト機能を画像機能にマッピングし、次に Transformer に似たシーケンスアーキテクチャを使用して言語入力と画像出力の関係を学習します。

このアプローチの重要なコンポーネントは、各画像を個別の単位のシーケンスに変換する画像タグ付け機能です。たとえば、DALL-E と CogView はこのアイデアを採用しました。

もう 1 つは、最近急速に進歩したルート、つまり DALL-E 2 や Imagen などの拡散ベースのテキストから画像へのモデルです。

彼らは画像タグ付けを放棄し、拡散モデルを採用して画像を直接生成しました。これらのモデルは、より高品質の画像を生成し、MS-COCO でより優れたゼロショット FID スコアを持つことがわかります。

Parti モデルの成功は、自己回帰モデルを使用してテキストから画像を生成する効果を改善できることを証明しています。

同時に、Parti は新しいベンチマークである PartiPrompts も導入し、リリースしました。これは、12 のカテゴリと 11 の課題におけるモデルの機能を測定するために使用されます。

しかし、Parti にはまだいくつかの制限があり、研究者らはいくつかのバグも実証しています。

例えば、否定を記述する方法はありません〜

バナナのない皿と、その横にオレンジジュースのないグラス。

不合理なスケーリングなど、常識的な間違いもいくつか発生します。たとえば、この写真では、ロボットはレーシングカーよりも数倍高いです。

レーシングスーツと黒いバイザーを着た光沢のあるロボットが、F1カーの前に誇らしげに立っています。街並みに太陽が沈みます。漫画本のイラスト。

Googleが自ら展開

この調査は Google Research が実施したもので、チームメンバーの大半は中国人です。

中核研究スタッフには、Yuanzhong Xu、Thang Luongなどが含まれており、いずれも現在GoogleでAI関連の研究に携わっています。

(Thang Luong は Google Scholar で 20,000 件以上の引用があります)

△左：徐元中、右：タン・ルオン

しかし興味深いのは、単語を少し言うだけで AI が絵を描ける Google アプリである Imagen が、実は Parti と密接に関連しているということです。

これは Parti の GitHub プロジェクトドキュメントに記載されています。

Imagen のリリース前に、最新の完全な結果を共有してくれた Imagen チームに感謝します。
CF ガイダンスに関する彼らの重要な発見は、最終的な Parti モデルに特に役立ちました。

そして、『Imagen』の著者の一人である Burcu Karagol Ayan 氏も Parti 氏のプロジェクトに参加しました。

（Googleが「巻き上げ」ているように感じる）

それだけでなく、お隣のDALL-E 2の作者であるAditya Ramesh氏もParti氏とMS-COCOの評価について議論しました。

また、Parti データの作業にも協力してくれた DALL-Eval の著者にも感謝します。

もう一つ

正直に言うと、「テキストから画像を生成する」という概念は、研究者だけが好むものではありません。

ネットユーザーも「遊んで」楽しんでいます（想像力を働かせすぎないでくださいね）。

少し前にImagenさんに宋代の「虎装VR」を描いてもらったのですが、そのままAIお絵かきバトルに発展しました。

△写真：イマージェン絵画

DALL·E、MidJourneyらもこのニュースを聞いて急いで参加した。

△ アート：DALL E

Wordle と DALL-E 2 を組み合わせたものもあります。

…

しかし、このPartiに戻ると、楽しかったものの、一部のネットユーザーは依然として「心を打つ」疑問を投げかけている。

いつ商品化されるのでしょうか？一人で「ドアを閉めて遊ぶ」だけではつまらない。

党紙アドレス:

https://parti.research.google/

GitHub プロジェクトアドレス:

https://github.com/google-research/parti

参考リンク:

[1]https://twitter.com/lmthang/status/1539664610596225024[2]https://gizmodo.com/new-browser-game-combines-dall-e-mini-and-wordle-1849105289[3]https://imagen.research.google/

<<: 自動運転システムにおけるエッジコンピューティング技術

>>: AI顧客サービス指標について話す

ブログ

機械学習の理論的基礎はどの程度しっかりしているのでしょうか?

ブログ

ディープラーニングを理解するための鍵 – 啓蒙

ブログ

認知知能を業界の奥深くまで導くWAIC Baiduが言語と知識技術の完全なレイアウトを公開

Google の新しい AI が話題に！世界で最も長い単語を描くことができる

200億のパラメータまで拡張可能：より現実的で、より「インテリジェント」

すべてのコンポーネントはトランスフォーマーです

Googleが自ら展開

もう一つ

機械学習の理論的基礎はどの程度しっかりしているのでしょうか?

ディープラーニングを理解するための鍵 – 啓蒙

認知知能を業界の奥深くまで導くWAIC Baiduが言語と知識技術の完全なレイアウトを公開

AI エージェントが GPT-4 と連携して人間のディレクターを排除します。「サウスパーク」はスタンフォード大学のウエストワールドを模倣して撮影された

大規模ウェブサイトのアルゴリズムとアーキテクチャについての簡単な説明（パート 2）

人工知能と機械学習が進化する10の方法

推薦する

調査によると、ヨーロッパ人はロボットに対してますます懐疑的になっている

顔認識を完了するための3行のPythonコード

顔認識ブームを冷静に考える：倫理的・道徳的問題は熟考する価値がある

ついに誰かが「組み込み人工知能」を明らかにした

AI as a Serviceが不可欠な理由

今後10年間の主要な投資の方向性を予測して、あなたは未来に向けて準備ができていますか?

YouTube 動画推奨アルゴリズムを破る方法

数日間GitHubのホットリストを独占した後、Colossal-AIが正式にリリースされました

MuskxAIの創設メンバーが中国で最初の声明を発表: ChatGPTの時代では「困難な時代に英雄が現れる」、次のステップはより多くの数理科学データトレーニングを使用することです

AIには意識があるのでしょうか？意識の定義から始めましょう

Python コードを書くことができる人工知能 Kite が Linux のサポートを発表。プログラマーは職を失うことになるのでしょうか?

初心者のためのデータ学習: Python でシンプルな教師あり学習アルゴリズムを実装する方法を学習します