AlphaFold2 の原理: 注意メカニズムが畳み込みネットワークに取って代わり、予測精度が 30% 以上向上

AlphaFold2 の原理: 注意メカニズムが畳み込みネットワークに取って代わり、予測精度が 30% 以上向上

[[412540]]

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

最近、DeepMind が AlphaFold2 をオープンソース化し、再び学界に波紋を巻き起こしました。

つまり、かつては一般の研究者が解明するのに数年かかっていたタンパク質構造が、AlphaFold2 を使用すればわずか数時間で計算できるようになったのです。

では、AlphaFold2 はどのようにしてこのような強力な機能を実現しているのでしょうか?

DeepMindチームは詳細な情報をNature誌に公開した。

それでは、AlphaFold2 の魔法がどのように実現されるかを見てみましょう。

畳み込みはなくなり、注目が集まる

論文の中で研究者らは、AlphaFold2はAlphaFoldとは全く異なる新しいモデルであると強調した。

実際、それらは異なるモデル フレームワークを使用しており、これが AlphaFold2 の精度が飛躍的に向上できる主な理由です。

AlphaFold のこれまでの畳み込みニューラル ネットワークはすべてAttentionに置き換えられました。

なぜこれをするのですか?

まず、AlphaFold がどのように動作するかを理解する必要があります。

これは主に、タンパク質内の各アミノ酸ペア間の距離分布と、それらを結ぶ化学結合間の角度を予測し、すべてのアミノ酸ペアの測定値を 2D 距離ヒストグラムにまとめます。

次に、畳み込みニューラル ネットワークを使用してこれらの画像を学習し、タンパク質の 3D 構造を構築します。

△AlphaFoldのメインアーキテクチャ

しかし、これは予測に対する局所的なアプローチであり、タンパク質構造情報の長期的な依存性を無視する可能性があります。

Attention の特性は、まさにこの欠点を補うことができます。これは、人間の注意を模倣し、複数の詳細に同時に焦点を合わせることができるネットワーク アーキテクチャです。

これにより、フレームワークの予測結果がより包括的かつ正確になります。

CASP13では、AlphaFoldの予測精度は60ポイント未満でした。

しかし、CASP14では、AlphaFold2によって精度が直接92.4/100に向上しました。

グラフネットワーク + 注意

具体的には、AlphaFold2 は主に多重配列アライメント (MSA) を使用して、タンパク質構造と生物学的情報をディープラーニング アルゴリズムに統合します。

主にニューラル ネットワークEvoFormer構造モジュールの2 つの部分で構成されます。

EvoFormer では、構造予測は主にグラフ ネットワーク多重配列アライメント(MSA) を組み合わせることによって実現されます。

グラフ ネットワークは、物事の相関関係をうまく表現できます。ここでは、異なるアミノ酸間の距離を表すために、タンパク質関連情報のグラフを構築できます。

研究者らは、Attention メカニズムを使用して、アミノ酸間の関係グラフを処理するための特別な「三角形の自己注意メカニズム」を構築しました。

△三角形の自己注意

次に、このステップからの情報を多重配列アライメントと組み合わせました。

多重配列アライメントの主な目的は、同じ残基の部位を同じ列に配置し、異なる配列間の類似性を明らかにし、それによって異なるタンパク質間の構造と機能の類似性を推測することです。

計算されたアミノ酸関係は MSA と情報を交換し、空間的および進化的関係のペア表現を直接推測できます。

すべての原子の3D構造を予測する

アーキテクチャの 2 番目の部分は構造モジュールであり、その主な役割は、EvoFormer によって取得された情報をタンパク質の 3D 構造に変換することです。

△構造モジュール

ここで研究者らは、タンパク質の各部分を個別に計算できる「不変点注意」メカニズムと呼ばれる注意メカニズムも使用しました。

ある原子を原点として3D参照フィールドを構築し、予測情報に従って回転・平行移動し、構造フレームワークを取得します。

△不変点の注目

次に、Attention メカニズムがすべての原子を予測し、最終的に非常に正確なタンパク質構造を要約します。

さらに研究者らは、AlphaFold2 が「エンドツーエンド」のニューラル ネットワークであることも強調しました。

最終的な損失を出力結果に繰り返し適用し、出力結果を再帰的に適用して、正しい結果に継続的に近づきます。

そうすることで、追加のトレーニングを削減できるだけでなく、予測される構造の精度も大幅に向上します。

タンパク質の折り畳みの謎を解く希望をもたらす

Alphafold2 の出現により、タンパク質と分子の結合確率をより正確に予測できるようになり、新薬の研究開発の効率が大幅に向上します。

Alphafold2 のオープンソースは科学コミュニティをさらに発展させるでしょう。

DeepMindは現在、スイスのいくつかの研究チームと協力して、タンパク質構造を予測することで医薬品の研究を行っているとみられる。

実際、Alphafold2 予測プログラム自体を研究することで、タンパク質構造の折り畳みの原理を探求する希望も生まれます。

シカゴ大学の計算生物学者ジンボ・シュー氏はこう語った。

これらのツールはオープンソースであるため、科学コミュニティはそれらに基づいてさらに強力なソフトウェアを開発できます。

論文の宛先:
https://www.nature.com/articles/s41586-021-03819-2_reference.pdf

補足資料:
https://static-content.springer.com/esm/art%3A10.1038%2Fs41586-021-03819-2/MediaObjects/41586_2021_3819_MOESM1_ESM.pdf*

<<:  ICML賞を受賞したばかりの機械学習の専門家マックス・ウェリング氏がマイクロソフトに入社し、分子シミュレーションに注力

>>:  人工知能による画像認識では、データのラベル付けはどのように機能するのでしょうか?

推薦する

VB.NET 暗号化アルゴリズムの基本概念の分析

プログラミング言語の場合、その機能性を評価する上で最も重要な要素の 1 つはセキュリティ評価です。 ...

COVID-19パンデミックの影響を受けて、世界のエッジAIソフトウェア市場は急速な発展を遂げている

MarketsandMarkets は、エッジ AI ソフトウェア市場が 2019 年から 2021...

医師は患者のがん治療を支援するためにディープラーニングアルゴリズムを使用している

▲ 液体生検は費用対効果が高く、生検全体のプロセスを大幅に簡素化できます。 Wikipedia によ...

機械学習があなたの好きな音楽を発見する方法: パーソナライズされた音楽推奨の背後にある科学

今週の月曜日も、他の月曜日と同様に、Spotify の 1 億人を超えるユーザー全員に新しいプレイリ...

ディープラーニングを超える新しいAIプログラミング言語Genについて1つの記事で学びましょう

AI の急速な発展は多くの人々の学習意欲をかき立てていますが、初心者にとっては大量の手動プログラミン...

...

TensorFlow を使用したコンテキスト チャットボットの実装

日常のチャットでは、文脈が重要です。 TensorFlow を使用してチャットボット フレームワーク...

...

「チューリップ」は、感染症予防・抑制期間中に政府情報へのアクセスを容易にするためのインテリジェントな質疑応答アシスタントを作成します。

突然の感染拡大に直面し、国民は情報の適時性、透明性、伝達効率にさらに注目するようになった。このような...

AI テクノロジーはワイヤレス ネットワークのインテリジェンスに何をもたらすのでしょうか?

ワイヤレス ネットワークのインテリジェンスは、インターネット業界の発展における新たなトレンドとなって...

人工知能は産業の発展を促進し、産業構造のアップグレードを加速する

トップレベルの設計を継続的に改善し、コンピュータービジョン、音声認識、機械学習、ナレッジグラフなどの...

ニューラルネットワークはなぜそれほど強力なのでしょうか?

普遍近似定理ニューラル ネットワークは非常に強力であることが知られており、ほぼすべての統計学習問題を...

...

...