DeepMindは、オートエンコーダに「自己修正」を教える「SUNDAE」と呼ばれる言語モデルを提案している。

DeepMindは、オートエンコーダに「自己修正」を教える「SUNDAE」と呼ばれる言語モデルを提案している。

[[440946]]

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

自己回帰モデル(AR) は、テキスト生成タスクにおいて常に優れたパフォーマンスを発揮してきました。

現在、DeepMind は、オートエンコーダに「自己修正」を学習させることで、 SUNDAEと呼ばれる非自己回帰モデルを提案しています。

これは、WMT'14 英語 - ドイツ語翻訳タスクにおいて非自己回帰モデルの中で SOTA を達成するだけでなく、自己回帰モデルと同等のパフォーマンスも示します。

さらに驚くべきことは、自己回帰モデルではできないこと、つまりテキスト補完を簡単に実行できることです。

ご存知のとおり、非自己回帰モデルは常に不人気でした。

この「サンデー」のテキスト補完機能は、人間と機械が共同でテキストを編集、作成する新しい方法も提供します。

非自己回帰言語モデル「サンデー」

「Sundae」の正式名称は「Step-unrolled Denoising Autoencoder」(SUNDAE) です。新しいテキスト生成モデルであるため、従来の自己回帰モデルに依存しません。

ノイズ除去拡散と同様に、Sundae はトレーニング中にアンロールされたノイズ除去を使用し、ランダムな入力から始めて収束するまで毎回改善しながら、一連のトークンに繰り返し適用します。

これは「自己修正」プロセスと呼ばれるものです。

次の図は、単一のノイズ低減と拡張ノイズ低減の違いを示しています。

最初の行は元のテキストで、ランダムに「破損」して新しいテキスト(2 行目)が生成されます。緑のトークンは「汚染されていない」テキストを表し、赤のトークンは「汚染された」テキストを表します。

この中間テキストはノイズ除去(生成モデルからサンプリング)され、下部に別の「汚染された」テキストが生成されます。

標準的なノイズ除去オートエンコーダーは中央のテキストから上のテキストへのマッピングのみを学習しますが、プログレッシブ アンローリング ノイズ除去オートエンコーダー (「Sundae」) は下から上へのマッピングを学習します。

テキスト生成中に、ネットワークが遭遇するテキストのほとんどは、上の図の中央のようなものではなく、下部のようなものであるので、拡張ノイズ除去は非常に役立ちます。

さらに、研究者らは、ノイズ除去拡散技術よりも少ない反復で収束を達成しながら、自然言語データセット上で質的に優れたサンプルを生成できる単純な改善演算子を提案しました。

端的に言えば、「Sundae」が採用した方式は、テキスト合成の品質と速度を制御可能にします。

機械翻訳やテキスト生成タスクでのパフォーマンスはいかがでしょうか?

「サンデー」の具体的なパフォーマンスを見てみましょう。

研究者らはまず、機械翻訳ベンチマークでSundaeを評価した。

BLEU スコアを基準として使用し、WMT’14 ドイツ語-英語翻訳タスクにおける「Sundae」の翻訳品質を自己回帰 (AR) モデルおよび非 AR モデルと比較します。

結果によると、シーケンスレベルの知識蒸留などの技術を使用しなくても、「Sundae」のパフォーマンスは AR モデルとほぼ同等であり、すべての非 AR モデルを上回っています。

次は、テキスト生成タスクにおける Sundae の評価です。

研究者らは、大規模で高品質な公開データセットである Colossal Clean Common Crawl (C4) を使用して Sundae をトレーニングしました。

このモデルには、合計 335M のパラメータ、24 層、埋め込みサイズ 1024、非表示サイズ 4096、およびアテンション ヘッド 16 個が含まれています。バッチ サイズ 4096 の Adam オプティマイザーを使用して、最大 400,000 ステップにわたってトレーニングされました。

結果のテキストは、 cherry picking なしで次のようになります。

これら 10 個の文のうち、4 番目の文を除いて、すべて非常に合理的です。

ただし、C4 データセットはインターネットから取得されるため、トレーニング セットと最終的に生成された結果の両方に改行が多数あります。

さらに、「サンデー」モデルの非自己回帰的な性質のため、研究者らはテキストの「修復」能力もテストしました。

ご存知のとおり、左から右へ順番にしか生成できない AR モデルでは、これは単純に不可能です

結果は次のとおりです(厳選):

  • C4 データセット
  • GitHub 上の Python プログラムのデータセット

この効果についてどう思いますか?構文とロジックには問題はないようです。

詳しいデータや内容については、以下のリンクをクリックしてください。

論文の宛先:

https://arxiv.org/abs/2112.06749

<<:  人間の運転、交通事故の最大の欠陥 | 自動運転車の交通安全に関する白書が発表

>>:  自動化を推進するAIテストツール

ブログ    
ブログ    
ブログ    

推薦する

あなたの写真を「秘密裏に」使用した顔認識システムはいくつありますか?ツールを使って確認する時が来た

テクノロジー企業が「個人のプライバシーを侵害する」顔認識システムを開発する際、彼らはあなたが予想して...

Alipayの顔認識が「クラック」されましたが、私たちのお金はもう安全ではないのでしょうか?

[[314955]]川沿いを頻繁に歩くと、足が濡れてしまいます。決済の兄貴分であるアリペイも小さな...

AI言語モデルにおける幻覚バイアスのリスク

音声アシスタントからチャットボットまで、人工知能 (AI) はテクノロジーとのやり取りの方法に革命を...

次世代言語モデルパラダイム LAM が登場します! AutoGPTモデルがLLMを席巻、計画、メモリ、ツールの3つの主要コンポーネントの包括的なレビュー

ChatGPT によって開始された AI の波は私たちを人工知能の時代へと導き、言語モデルは日常生活...

AIと宇宙技術が日常生活をどう改善するか

衛星から都市計画まで、人工知能の進歩は新たな洞察をもたらしています。 [[270081]]宇宙技術と...

初心者必読: 5 つの反復レベルから機械学習を理解する

このなぞなぞの答えを推測できますか?機械学習を学べば、どこにでも登場します...プログラマーであれば...

...

...

ロボットはどうやってコーヒーを飲みながら心臓手術を行うのでしょうか?

「2、3年前、アメリカの医師たちが手術室の外に座り、コーヒーを片手にしているのを見ました。彼らはリ...

来年のIT投資の見通しは有望です。成長率はGDPの3倍です。 CIOの75%がAIへの支出を増やす

現在、世界経済の回復は依然として緩やかです。国際通貨基金(IMF)が最近発表した世界経済見通しレポー...

NeO 360: 屋外シーンのスパースビュー合成のためのニューラルフィールド

この記事は、Heart of Autonomous Driving の公開アカウントから許可を得て転...

アリコロニーアルゴリズムの理論と実践ガイド

[[170615]]数年前、私が修士号を取得するために勉強していたとき、大学にアリコロニーアルゴリズ...

このモデルは数十万ドルの費用がかかり、数え切れないほどのプロジェクトを導いたのに、使用されたネガティブサンプルがゼロだったことが判明したのですか?

今日の人気のディープラーニング モデルはブラック ボックスであるとよく言われます。つまり、入力を与え...

...

ビジネス開発における感情AIの重要性

世界が人工知能技術に依存する未来に向かって進むにつれ、人々はこれまで以上に感情を必要としています。人...