ドーパミンが来る! Google が新しい強化学習フレームワーク Dopamine を発表

ドーパミンが来る! Google が新しい強化学習フレームワーク Dopamine を発表

Google は、TensorFlow をベースとし、柔軟性、安定性、再現性、高速ベンチマークを提供する最新の強化学習フレームワーク Dopamine を紹介するブログを公開しました。

GitHub リポジトリ: https://github.com/google/dopamine

過去数年間で、強化学習の研究は多くの面で大きな進歩を遂げました。これらの進歩により、エージェントは人間を超えたレベルでゲームをプレイできるようになり、注目すべき例としては、DeepMind の DQN による Atari ゲーム、AlphaGo、AlphaGoZero、Open AI Five のパフォーマンスが挙げられます。具体的には、DQN にリプレイ メモリを導入することでエージェントは過去の経験を活用できるようになり、大規模な分散トレーニングによりエージェントは学習プロセスを複数のワーカーに分散できるようになり、分散アプローチによりエージェントは期待値だけでなく分布全体をモデル化できるため、環境の完全な状況を把握できるようになります。この進歩は、アルゴリズムによってこれらの進歩が可能になり、ロボット工学などの他の分野でも使用できるため重要です。

通常、このような進歩を遂げるには、既存のアプローチの構造を破壊する設計の迅速な反復(多くの場合、明確な指示なし)が必要です。しかし、既存の強化学習フレームワークのほとんどは、研究者が RL 手法を効率的に反復できるようにする柔軟性と安定性の両方を備えていないため、新しい研究の方向性を模索しても、短期的には大きな利益が得られない可能性があります。さらに、既存のフレームワークの結果を再現するには時間がかかりすぎることが多く、科学的な再現性の問題につながる可能性があります。

Google は本日、強化学習の研究者や関連担当者に、柔軟で安定した再現性のあるツールを提供することを目的とした、TensorFlow をベースとした新しいフレームワークを発表しました。このフレームワークは、脳内の報酬動機行動の主要成分であるドーパミンにヒントを得たもので、神経科学と強化学習研究の密接なつながりを反映しており、大きな発見につながる可能性のある推測的研究をサポートするように設計されています。 Google は、フレームワークの使用方法を説明するために、関連する Colab (https://github.com/google/dopamine/blob/master/dopamine/colab/README.md) のセットもリリースしました。

使いやすさ

このフレームワークの設計では、明瞭性とシンプルさが 2 つの重要な考慮事項でした。 Google が提供するコードはコンパクト (Python ファイル約 15 個) で、ドキュメントも充実しています。その理由は、Google の研究者が、成熟した、よく理解されているベンチマークである Arcade Learning Environment (ALE) と、4 つの価値ベースのエージェント (DQN、C51、Rainbow エージェントの慎重に設計された簡易版、および Implicit Quantile Network エージェント (先月の ICML カンファレンスで発表されたばかり)) に焦点を当てたためです。 Google は、このシンプルさにより、研究者がエージェントの内部の仕組みを理解しやすくなり、新しいアイデアをすぐに試せるようになることを期待しています。

再現性

Google は強化学習研究における再現性を非常に重視しています。そのため、Google はコードに対して完全なテストを提供しており、これらのテストはドキュメントに記載されています。さらに、Google の実験フレームワークは、ALE を使用した標準化された経験的評価に関する Machado ら (2018) の推奨事項に従っています。

ベンチマーク

新しい研究者にとって、自分のアイデアを素早くベンチマークすることは非常に重要です。 Google は、ALE でサポートされている 60 のゲームを含む 4 つのエージェントの完全なトレーニング データを、Python ピクル ファイル (Google のフレームワークを使用してトレーニングされたエージェント用) と JSON データ ファイル (他のフレームワークを使用してトレーニングされたエージェントとの比較用) の形式で提供しています。 Google は、研究者が全 60 のゲームで提供されたすべてのエージェントのトレーニング実行をすばやく視覚化できる Web サイトも提供しています。下の写真は、Google のエージェント 4 人が Seaquest (ALE がサポートする Atari 2600 ゲームの 1 つ) のトレーニングをしているところです。

Google の 4 人のエージェントのトレーニングは Seaquest で実行されます。 x 軸は反復を表し、各反復は 100 万ゲーム フレーム (リアルタイム ゲームプレイで 4.5 時間) です。y 軸はゲームごとに得られる平均スコアです。網掛け部分は 5 回の独立した実行からの信頼区間を表します。

Google は、これらのエージェントを使用してトレーニングされたディープ ネットワーク、生の統計ログ、Tensorboard 視覚化用の TensorFlow イベント ファイルも提供しています。

関連アドレス: https://github.com/google/dopamine/tree/master/docs#downloads

Google は、このフレームワークの柔軟性と使いやすさが研究者による新しいアイデアの試行に役立つことを期待している。 Google は研究でこのフレームワークを使用し、多くのアイデアを非常に柔軟に迅速に反復できることを発見しました。 Google は、コミュニティがこのフレームワークを使用するのを楽しみにしています。

<<:  子どもたちがロボットに出会うと、彼らの社会的交流はどのように変化するのでしょうか?

>>:  視覚畳み込みニューラルネットワークモデルを習得し、画像認識技術の分野を探索します。

ブログ    
ブログ    
ブログ    

推薦する

...

多くの場所でAI顔認識の使用が制限されており、監視は技術開発のペースに追いついています

最近、南京、江蘇省、天津などではAI顔認識技術の使用を禁止し始めている。 11月末、南京市のある男性...

...

汎用聴覚AIのロックを解除します!清華大学電子工学部とVolcano Voiceが共同で新しい認知指向の聴覚言語モデルをオープンソース化

最近、清華大学電子工学部と Volcano Voice チームが協力して、認知指向のオープンソース聴...

コロナウイルスを分類する機械学習はわずか数分で完了

物理学者協会のウェブサイトが28日に伝えたところによると、カナダのコンピューター科学者と生物学者は、...

...

...

人工知能は人類にユートピアをもたらすのか、それともディストピアをもたらすのか?

[[187202]]ロボットはユートピアをもたらすのか、それともディストピアをもたらすのか?作家ピ...

ICLR 2020 におけるナレッジグラフ研究の包括的な概要

この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式...

Facebook Cityは楽しいです!ドローンで遠隔地の山岳地帯にモバイルネットワークを提供

[51CTO.comからのオリジナル記事] Facebookは、インド政府および通信会社と協議し、太...

...

Googleが絵画におけるAI使用の権利を取り戻す、ネットユーザー「DALL・E 2は発売からわずか1ヶ月で時代遅れ?」

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

Microsoft OpenAI はヒューマノイドロボットに 1 億ドルを投資する予定です。ネットユーザーはマスク氏に叫んだ

今年初め、マイクロソフトとOpenAIがヒューマノイドロボットのスタートアップに多額の資金を投資して...

...