ドーパミンが来る! Google が新しい強化学習フレームワーク Dopamine を発表

ドーパミンが来る! Google が新しい強化学習フレームワーク Dopamine を発表

Google は、TensorFlow をベースとし、柔軟性、安定性、再現性、高速ベンチマークを提供する最新の強化学習フレームワーク Dopamine を紹介するブログを公開しました。

GitHub リポジトリ: https://github.com/google/dopamine

過去数年間で、強化学習の研究は多くの面で大きな進歩を遂げました。これらの進歩により、エージェントは人間を超えたレベルでゲームをプレイできるようになり、注目すべき例としては、DeepMind の DQN による Atari ゲーム、AlphaGo、AlphaGoZero、Open AI Five のパフォーマンスが挙げられます。具体的には、DQN にリプレイ メモリを導入することでエージェントは過去の経験を活用できるようになり、大規模な分散トレーニングによりエージェントは学習プロセスを複数のワーカーに分散できるようになり、分散アプローチによりエージェントは期待値だけでなく分布全体をモデル化できるため、環境の完全な状況を把握できるようになります。この進歩は、アルゴリズムによってこれらの進歩が可能になり、ロボット工学などの他の分野でも使用できるため重要です。

通常、このような進歩を遂げるには、既存のアプローチの構造を破壊する設計の迅速な反復(多くの場合、明確な指示なし)が必要です。しかし、既存の強化学習フレームワークのほとんどは、研究者が RL 手法を効率的に反復できるようにする柔軟性と安定性の両方を備えていないため、新しい研究の方向性を模索しても、短期的には大きな利益が得られない可能性があります。さらに、既存のフレームワークの結果を再現するには時間がかかりすぎることが多く、科学的な再現性の問題につながる可能性があります。

Google は本日、強化学習の研究者や関連担当者に、柔軟で安定した再現性のあるツールを提供することを目的とした、TensorFlow をベースとした新しいフレームワークを発表しました。このフレームワークは、脳内の報酬動機行動の主要成分であるドーパミンにヒントを得たもので、神経科学と強化学習研究の密接なつながりを反映しており、大きな発見につながる可能性のある推測的研究をサポートするように設計されています。 Google は、フレームワークの使用方法を説明するために、関連する Colab (https://github.com/google/dopamine/blob/master/dopamine/colab/README.md) のセットもリリースしました。

使いやすさ

このフレームワークの設計では、明瞭性とシンプルさが 2 つの重要な考慮事項でした。 Google が提供するコードはコンパクト (Python ファイル約 15 個) で、ドキュメントも充実しています。その理由は、Google の研究者が、成熟した、よく理解されているベンチマークである Arcade Learning Environment (ALE) と、4 つの価値ベースのエージェント (DQN、C51、Rainbow エージェントの慎重に設計された簡易版、および Implicit Quantile Network エージェント (先月の ICML カンファレンスで発表されたばかり)) に焦点を当てたためです。 Google は、このシンプルさにより、研究者がエージェントの内部の仕組みを理解しやすくなり、新しいアイデアをすぐに試せるようになることを期待しています。

再現性

Google は強化学習研究における再現性を非常に重視しています。そのため、Google はコードに対して完全なテストを提供しており、これらのテストはドキュメントに記載されています。さらに、Google の実験フレームワークは、ALE を使用した標準化された経験的評価に関する Machado ら (2018) の推奨事項に従っています。

ベンチマーク

新しい研究者にとって、自分のアイデアを素早くベンチマークすることは非常に重要です。 Google は、ALE でサポートされている 60 のゲームを含む 4 つのエージェントの完全なトレーニング データを、Python ピクル ファイル (Google のフレームワークを使用してトレーニングされたエージェント用) と JSON データ ファイル (他のフレームワークを使用してトレーニングされたエージェントとの比較用) の形式で提供しています。 Google は、研究者が全 60 のゲームで提供されたすべてのエージェントのトレーニング実行をすばやく視覚化できる Web サイトも提供しています。下の写真は、Google のエージェント 4 人が Seaquest (ALE がサポートする Atari 2600 ゲームの 1 つ) のトレーニングをしているところです。

Google の 4 人のエージェントのトレーニングは Seaquest で実行されます。 x 軸は反復を表し、各反復は 100 万ゲーム フレーム (リアルタイム ゲームプレイで 4.5 時間) です。y 軸はゲームごとに得られる平均スコアです。網掛け部分は 5 回の独立した実行からの信頼区間を表します。

Google は、これらのエージェントを使用してトレーニングされたディープ ネットワーク、生の統計ログ、Tensorboard 視覚化用の TensorFlow イベント ファイルも提供しています。

関連アドレス: https://github.com/google/dopamine/tree/master/docs#downloads

Google は、このフレームワークの柔軟性と使いやすさが研究者による新しいアイデアの試行に役立つことを期待している。 Google は研究でこのフレームワークを使用し、多くのアイデアを非常に柔軟に迅速に反復できることを発見しました。 Google は、コミュニティがこのフレームワークを使用するのを楽しみにしています。

<<:  子どもたちがロボットに出会うと、彼らの社会的交流はどのように変化するのでしょうか?

>>:  視覚畳み込みニューラルネットワークモデルを習得し、画像認識技術の分野を探索します。

ブログ    
ブログ    

推薦する

AIが新たな成長エンジンに。アマゾン ウェブ サービスの技術的手法に耳を傾けてみよう

AI は数年前にテクノロジーの世界で人気を博しましたが、今では何千もの業界で革新と徹底的な応用が行わ...

...

騒ぎの裏で、2020年はケータリングロボットにとって楽な年になるだろうか?

最近、ロボットに特化したレストランが広州に正式にオープンしました。客の出迎えから調理まで、一連の作業...

...

...

自動運転L2が登場、運転はもっと楽になるのか?

現在、人間による自動運転シリーズの進捗状況はどうなっていますか? 最終エピソードが完成するまでにどれ...

企業がチャットボットの自然言語処理について学ぶべき理由は何ですか?

自然言語処理 (NLP) により、チャットボットは会話のメッセージを理解してそれに応じて応答できるよ...

この履歴書はAIの助けを借りて作成されたことが判明しました。 !

秋の就職活動は静かに過ぎ去りましたが、信頼できるインターンシップ先を見つけたい大学生にとって、すべて...

月給5万ドルでこのホットなAI分野をマスターするには、これらの9冊の本を読むだけで十分です

はじめに:国内の求人検索サイトのデータによると、2019年現在、上海の自然言語処理(NLP)関連職種...

IBM: ワトソン人工知能システムをすべてのクラウドプラットフォームに公開

米国のテクノロジーメディアの報道によると、IBMは本日、ワトソンブランドの人工知能サービスを自社のク...

さらに混沌です!ソラになりすました実在の人物の動画がすでに存在し、ウィル・スミスがパスタを食べながらミームを演じる

今日、「ウィル・スミスがパスタを食べている」というビデオがソーシャルメディアで話題になっている。動画...

ASRU2019コンペティションが終了、中国語と英語の混合音声認識技術における新たなブレークスルー

2019 IEEE 自動音声認識および理解ワークショップ (ASRU) は、2019 年 12 月 ...

SQLデータベースに基づくアルゴリズムを学ぶ

データベースは、データを保存し、大規模な計算を実行する場所です。現実世界の問題を解決するために、デー...

自動運転における車線逸脱警報システムの技術サポート

無人運転技術にはまだ改善の余地があるものの、ますます成熟しつつあることは認めざるを得ません。車線逸脱...

海外メディアがFacebookのコンテンツクリーンアップ作業を暴露:AIでも完了できない作業

AI は見たものからしか学習できません。シュローファー氏と150人以上のエンジニアリング専門家からな...