定量評価、アルゴリズム拡張:強化学習研究の10原則

定量評価、アルゴリズム拡張:強化学習研究の10原則

[[252430]]

ビッグデータダイジェスト制作

編纂者:江宝尚

今年 9 月に開催された Deep Learning Indaba 2018 Summit では、多くの有益な情報が得られました。昨日、自然言語処理に関する 27 人の著名人からの素晴らしい質問と回答をまとめました。今日は、強化学習の 10 の原則のリストをまとめます。これらは強化学習に役立つだけでなく、機械学習の研究にも参考になります。

これらの 10 の原則は、インサイト データ解析研究センターの博士課程の学生であるセバスチャン ルーダー氏が、カンファレンス中のデビッド シルバー氏の報告に基づいてまとめたものです。ルーダー氏は独自の分析に加え、自ら撮影した写真も公開しました。

1. 評価が進歩を促す

定量的な評価が進歩を促進します。評価報酬の選択によって、進捗の方向が決まります。評価基準が目標と密接に関連していること、および主観的な評価(人間の被験者など)を避けることが重要です。もう 1 つのポイントは、二重 Q 学習は単一 Q 学習よりも優れているということです。これは、後者の方がバイアスを削減できるためです。

2. アルゴリズムのスケーラビリティが成功を左右する

パフォーマンスの上限を回避するには、アルゴリズムのスケーリング方法が非常に重要です。ディープラーニングは効率的に拡張できるため優れていますが、サンプル効率も同様に重要です。

アルゴリズムのスケーラビリティはリソースに依存し、アルゴリズムのスケーラビリティがアルゴリズムの成功を決定します。では、リソースが増えるとパフォーマンスはどのように向上するのでしょうか。ここでのリソースとは、コンピューティング、メモリ、またはデータを指すことに注意してください。

3. 汎用性、つまり他のタスクにおけるアルゴリズムのパフォーマンスが非常に重要である

重要なのは、挑戦的なタスクのセットを設計することです。つまり、さまざまな新しいタスクを評価する必要があります。現在のタスクをやり過ぎないようにしてください。

4. エージェントの経験を信頼する

人間の専門知識に頼らず、設計された機能にも頼らないでください。データが限られている場合、ドメインの専門知識と帰納的バイアスは非常に重要です。

いくつかのタスクは完了不可能に思えるかもしれませんが、そこから多くのことを学ぶことができるはずです。この種のタスクまたはプロジェクトは通常、次の 3 つのポイントを満たします。

  • RL の根本的な問題を受け入れるのは難しいです。
  • AIの根本的な問題
  • 努力する価値は十分あります

5. ステータスは主観的であるべき

状態は、環境の観点から定義されるのではなく、モデルの状態、つまり RNN の隠し状態として確立される必要があります。エージェントの主観的な世界観だけが重要です。達成される効果は非常に限られるため、外部の現実について推論しないでください。

6. 制御フロー

エージェントはデータフローとエクスペリエンスに影響します。エージェントは制御環境にアクセスできる必要があります。重要なのは、報酬を最大化するだけでなく、フローに対する制御を確立することです。

7. 価値関数が世界を形作る

価値関数は、現在の状況と将来の状況を効果的に要約します。多値関数を使用すると、世界のさまざまな側面をモデル化できます。フロー制御に役立ちます。

8. 想像上の経験から学ぶ

次に何を計画しますか? 同様に、RL アルゴリズムは、Alphago の MCTS や価値関数の使用など、想像上の経験から学習できます。

9. 関数近似値の使用

アルゴリズムの複雑さはニューラル ネットワーク アーキテクチャに統合でき、MCTS、階層制御なども NN を使用してモデル化できます。次に、モデルから何を学んだのかを本当に理解する必要があります。

10. 学ぶことを学ぶ

メタ学習を習得すれば、ネットワーク アーキテクチャを手動で設定する必要がなくなり、すべてがエンドツーエンドの学習になります。つまり、ニューラル ネットワークは、人間の介入をできるだけ少なくして物事を処理することを目的としています。ただし、帰納的バイアスは依然として有用であるはずです。

関連レポート:

https://twitter.com/seb_ruder/status/1040235236284669952?utm_campaign=NLP%20News&utm_medium=email&utm_source=Revue%20newsletter

[この記事は51CTOコラムBig Data Digest、WeChatパブリックアカウント「Big Data Digest(id: BigDataDigest)」のオリジナル翻訳です]

この著者の他の記事を読むにはここをクリックしてください

<<:  アンドリュー・ン氏が AI 変革ガイドをリリース: CEO に 5 つのステップで AI 変革を呼びかける

>>:  2018 年の人工知能の商業化に関する 5 つの洞察

ブログ    
ブログ    

推薦する

ChatGPT を成功させるための 26 のスーパーヒント

今日は、実際の戦闘でよく使われる26のヒントを紹介します。これにより、出力がより効果的になります。見...

マイクロソフトとグーグルのAIジレンマ:お金を稼ぐにはもっとお金を使う必要がある

7月26日のニュースによると、将来、人工知能はマイクロソフトやアルファベットなどのテクノロジー大手に...

テーラーメイド:ChatGPTカスタム指示がAIパーソナライゼーション革命をリード

1. 概要カスタム指示「カスタム指示」は ChatGPT の新機能です。カスタム指示を使用すると、自...

なぜビッグデータは十分にスマートではないのでしょうか?機械が強力な人工知能へと進化する方法

なぜビッグデータは十分にスマートではないのでしょうか?確率の言語よりも強力な思考ツールは何でしょうか...

...

1 つの記事で RNN (リカレント ニューラル ネットワーク) の基礎を理解する

[[211628]] 1. ニューラルネットワークの基礎ニューラル ネットワークは、あらゆる関数に適...

生成AI技術を使用した企業リスク管理

近年、急速に進化する生成型AI技術が広く注目を集めており、多方面に大きな影響を与えると期待されていま...

...

これはボストンダイナミクスのロボットエンジニアの一日です

[[401177]]ボストン・ダイナミクスは誰もが知っていますが、同社の従業員の仕事や生活について知...

...

SaaS アプリケーションで AI スノーボールはどのように大きくなるのでしょうか?

Shopify の不正防止機械学習から Salesforce の Einstein まで、過去数年...

この線虫は単純ではありません!脳は高精度に修復され、ダイナミックに前進できる

最高精度の「線虫脳」、ここに登場。この「脳」は、Caenorhabditis elegans 線虫の...

...