Google は、DQN と同等で、より優れた一般化パフォーマンスを備えた 2 つの新しい強化学習アルゴリズムを実装しました。

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

強化学習 (RL) アルゴリズムは進化し続けています…

Google Research の研究者は、 AutoMLのグラフ表現と最適化手法を使用して、解析可能で一般化可能な新しい RL アルゴリズムを学習できることを実証しました。

彼らが発見したアルゴリズムのうち 2 つは、視覚的な観察を伴う Atari ゲームなど、より複雑な設定に一般化できます。

この成果により、RL アルゴリズムはますます改善されます。

「優れている」ことの詳細については、以下を参照してください。

損失関数は計算グラフとして表現される

まず、強化学習アルゴリズムの研究の難しさに関して、研究者たちはメタ学習法を設計することが解決策になると考えています。

このアプローチにより、さまざまなタスクに自動的に一般化される新しい RL アルゴリズムの設計が可能になります。

ニューラルネットワーク構造を表すグラフ空間内を検索するNeural Architecture Search（NAS）のアイデアに触発され、研究者は損失関数を計算グラフとして表現することでRLアルゴリズムをメタ学習します。

損失関数は、入力、演算子、パラメーター、出力をそれぞれ表すノードを持つ有向非巡回グラフを使用して表されます。

この表現には多くの利点があり、一般的には、新しい、解析可能で一般化可能な RL アルゴリズムを学習するために使用できます。

そして、この表現を実装するには PyGlove ライブラリを使用します。

進化に基づくメタ学習法

次に、研究者たちは進化に基づくメタ学習アプローチを使用して、関心のある RL アルゴリズムを最適化しました。

プロセスはおおよそ次のようになります。

提案されたアルゴリズムは、より困難な環境のセットでトレーニングする前に、まず障害物環境で良好なパフォーマンスを発揮する必要があります。アルゴリズムのパフォーマンスが評価され、集団の更新に使用され、パフォーマンスの優れたアルゴリズムがさらに新しいアルゴリズムに変化します。トレーニングの最後に、最もパフォーマンスの高いアルゴリズムがテスト環境で評価されます。

この実験における集団の規模は約 300 エージェントであり、研究者は 20,000 ～ 50,000 回の突然変異の後、候補損失関数の進化には約 3 日間のトレーニングが必要であることを観察しました。

トレーニングコストをさらに制御するために、DQN (Deep Q Learning Algorithm) などの人間が設計した RL アルゴリズムを最初のグループに埋め込みました。