定量評価、アルゴリズム拡張:強化学習研究の10原則

定量評価、アルゴリズム拡張:強化学習研究の10原則

[[252430]]

ビッグデータダイジェスト制作

編纂者:江宝尚

今年 9 月に開催された Deep Learning Indaba 2018 Summit では、多くの有益な情報が得られました。昨日、自然言語処理に関する 27 人の著名人からの素晴らしい質問と回答をまとめました。今日は、強化学習の 10 の原則のリストをまとめます。これらは強化学習に役立つだけでなく、機械学習の研究にも参考になります。

これらの 10 の原則は、インサイト データ解析研究センターの博士課程の学生であるセバスチャン ルーダー氏が、カンファレンス中のデビッド シルバー氏の報告に基づいてまとめたものです。ルーダー氏は独自の分析に加え、自ら撮影した写真も公開しました。

1. 評価が進歩を促す

定量的な評価が進歩を促進します。評価報酬の選択によって、進捗の方向が決まります。評価基準が目標と密接に関連していること、および主観的な評価(人間の被験者など)を避けることが重要です。もう 1 つのポイントは、二重 Q 学習は単一 Q 学習よりも優れているということです。これは、後者の方がバイアスを削減できるためです。

2. アルゴリズムのスケーラビリティが成功を左右する

パフォーマンスの上限を回避するには、アルゴリズムのスケーリング方法が非常に重要です。ディープラーニングは効率的に拡張できるため優れていますが、サンプル効率も同様に重要です。

アルゴリズムのスケーラビリティはリソースに依存し、アルゴリズムのスケーラビリティがアルゴリズムの成功を決定します。では、リソースが増えるとパフォーマンスはどのように向上するのでしょうか。ここでのリソースとは、コンピューティング、メモリ、またはデータを指すことに注意してください。

3. 汎用性、つまり他のタスクにおけるアルゴリズムのパフォーマンスが非常に重要である

重要なのは、挑戦的なタスクのセットを設計することです。つまり、さまざまな新しいタスクを評価する必要があります。現在のタスクをやり過ぎないようにしてください。

4. エージェントの経験を信頼する

人間の専門知識に頼らず、設計された機能にも頼らないでください。データが限られている場合、ドメインの専門知識と帰納的バイアスは非常に重要です。

いくつかのタスクは完了不可能に思えるかもしれませんが、そこから多くのことを学ぶことができるはずです。この種のタスクまたはプロジェクトは通常、次の 3 つのポイントを満たします。

  • RL の根本的な問題を受け入れるのは難しいです。
  • AIの根本的な問題
  • 努力する価値は十分あります

5. ステータスは主観的であるべき

状態は、環境の観点から定義されるのではなく、モデルの状態、つまり RNN の隠し状態として確立される必要があります。エージェントの主観的な世界観だけが重要です。達成される効果は非常に限られるため、外部の現実について推論しないでください。

6. 制御フロー

エージェントはデータフローとエクスペリエンスに影響します。エージェントは制御環境にアクセスできる必要があります。重要なのは、報酬を最大化するだけでなく、フローに対する制御を確立することです。

7. 価値関数が世界を形作る

価値関数は、現在の状況と将来の状況を効果的に要約します。多値関数を使用すると、世界のさまざまな側面をモデル化できます。フロー制御に役立ちます。

8. 想像上の経験から学ぶ

次に何を計画しますか? 同様に、RL アルゴリズムは、Alphago の MCTS や価値関数の使用など、想像上の経験から学習できます。

9. 関数近似値の使用

アルゴリズムの複雑さはニューラル ネットワーク アーキテクチャに統合でき、MCTS、階層制御なども NN を使用してモデル化できます。次に、モデルから何を学んだのかを本当に理解する必要があります。

10. 学ぶことを学ぶ

メタ学習を習得すれば、ネットワーク アーキテクチャを手動で設定する必要がなくなり、すべてがエンドツーエンドの学習になります。つまり、ニューラル ネットワークは、人間の介入をできるだけ少なくして物事を処理することを目的としています。ただし、帰納的バイアスは依然として有用であるはずです。

関連レポート:

https://twitter.com/seb_ruder/status/1040235236284669952?utm_campaign=NLP%20News&utm_medium=email&utm_source=Revue%20newsletter

[この記事は51CTOコラムBig Data Digest、WeChatパブリックアカウント「Big Data Digest(id: BigDataDigest)」のオリジナル翻訳です]

この著者の他の記事を読むにはここをクリックしてください

<<:  アンドリュー・ン氏が AI 変革ガイドをリリース: CEO に 5 つのステップで AI 変革を呼びかける

>>:  2018 年の人工知能の商業化に関する 5 つの洞察

ブログ    

推薦する

...

AI初心者ガイド: MLとAIの違いを理解する

[51CTO.com クイック翻訳] 人工知能は現在、さまざまなハイテク分野で話題になっています。初...

YOLOはまだ死んでいません! YOLOv9がリリースされました:パフォーマンスと速度SOTA〜

この記事は、Heart of Autonomous Driving の公開アカウントから許可を得て転...

SQL Server 2005 のデータ マイニング アルゴリズム拡張メソッド

SSAS は 9 つのデータ マイニング アルゴリズムを提供していますが、実際の問題に基づいて適切な...

インターネットの罪:Google がいかにして私たちを愚かにしているのか

[[322291]]オリジナル記事はThe Atlantic、著者ニコラス・カーよりこの記事のハイラ...

...

人工知能に置き換えられる可能性が最も高い職業トップ10。今年の転職ではこの罠に陥らないように!

[[220405]]今の時代、就職市場は戦場です。人工知能とロボットの発達は職場に衝撃を与えた。従...

【専門家がここにいるエピソード6】インタラクションのための人工知能

[51CTO.comからのオリジナル記事] 今回のライブ番組「ビッグネームがやってくる」のゲストは、...

...

...

研究によると、人工知能が書いたツイートに騙される可能性が高くなる

6月29日のニュースによると、新たな研究によると、人間が書いたツイートよりも、人工知能の言語モデルに...

...

...

貪欲アルゴリズムについて質問するのはやめてください。

[[323204]]序文三角形の最短経路と和を求めるとき、貪欲アルゴリズムを使用して解決できますか...