定量評価、アルゴリズム拡張:強化学習研究の10原則

定量評価、アルゴリズム拡張:強化学習研究の10原則

[[252430]]

ビッグデータダイジェスト制作

編纂者:江宝尚

今年 9 月に開催された Deep Learning Indaba 2018 Summit では、多くの有益な情報が得られました。昨日、自然言語処理に関する 27 人の著名人からの素晴らしい質問と回答をまとめました。今日は、強化学習の 10 の原則のリストをまとめます。これらは強化学習に役立つだけでなく、機械学習の研究にも参考になります。

これらの 10 の原則は、インサイト データ解析研究センターの博士課程の学生であるセバスチャン ルーダー氏が、カンファレンス中のデビッド シルバー氏の報告に基づいてまとめたものです。ルーダー氏は独自の分析に加え、自ら撮影した写真も公開しました。

1. 評価が進歩を促す

定量的な評価が進歩を促進します。評価報酬の選択によって、進捗の方向が決まります。評価基準が目標と密接に関連していること、および主観的な評価(人間の被験者など)を避けることが重要です。もう 1 つのポイントは、二重 Q 学習は単一 Q 学習よりも優れているということです。これは、後者の方がバイアスを削減できるためです。

2. アルゴリズムのスケーラビリティが成功を左右する

パフォーマンスの上限を回避するには、アルゴリズムのスケーリング方法が非常に重要です。ディープラーニングは効率的に拡張できるため優れていますが、サンプル効率も同様に重要です。

アルゴリズムのスケーラビリティはリソースに依存し、アルゴリズムのスケーラビリティがアルゴリズムの成功を決定します。では、リソースが増えるとパフォーマンスはどのように向上するのでしょうか。ここでのリソースとは、コンピューティング、メモリ、またはデータを指すことに注意してください。

3. 汎用性、つまり他のタスクにおけるアルゴリズムのパフォーマンスが非常に重要である

重要なのは、挑戦的なタスクのセットを設計することです。つまり、さまざまな新しいタスクを評価する必要があります。現在のタスクをやり過ぎないようにしてください。

4. エージェントの経験を信頼する

人間の専門知識に頼らず、設計された機能にも頼らないでください。データが限られている場合、ドメインの専門知識と帰納的バイアスは非常に重要です。

いくつかのタスクは完了不可能に思えるかもしれませんが、そこから多くのことを学ぶことができるはずです。この種のタスクまたはプロジェクトは通常、次の 3 つのポイントを満たします。

  • RL の根本的な問題を受け入れるのは難しいです。
  • AIの根本的な問題
  • 努力する価値は十分あります

5. ステータスは主観的であるべき

状態は、環境の観点から定義されるのではなく、モデルの状態、つまり RNN の隠し状態として確立される必要があります。エージェントの主観的な世界観だけが重要です。達成される効果は非常に限られるため、外部の現実について推論しないでください。

6. 制御フロー

エージェントはデータフローとエクスペリエンスに影響します。エージェントは制御環境にアクセスできる必要があります。重要なのは、報酬を最大化するだけでなく、フローに対する制御を確立することです。

7. 価値関数が世界を形作る

価値関数は、現在の状況と将来の状況を効果的に要約します。多値関数を使用すると、世界のさまざまな側面をモデル化できます。フロー制御に役立ちます。

8. 想像上の経験から学ぶ

次に何を計画しますか? 同様に、RL アルゴリズムは、Alphago の MCTS や価値関数の使用など、想像上の経験から学習できます。

9. 関数近似値の使用

アルゴリズムの複雑さはニューラル ネットワーク アーキテクチャに統合でき、MCTS、階層制御なども NN を使用してモデル化できます。次に、モデルから何を学んだのかを本当に理解する必要があります。

10. 学ぶことを学ぶ

メタ学習を習得すれば、ネットワーク アーキテクチャを手動で設定する必要がなくなり、すべてがエンドツーエンドの学習になります。つまり、ニューラル ネットワークは、人間の介入をできるだけ少なくして物事を処理することを目的としています。ただし、帰納的バイアスは依然として有用であるはずです。

関連レポート:

https://twitter.com/seb_ruder/status/1040235236284669952?utm_campaign=NLP%20News&utm_medium=email&utm_source=Revue%20newsletter

[この記事は51CTOコラムBig Data Digest、WeChatパブリックアカウント「Big Data Digest(id: BigDataDigest)」のオリジナル翻訳です]

この著者の他の記事を読むにはここをクリックしてください

<<:  アンドリュー・ン氏が AI 変革ガイドをリリース: CEO に 5 つのステップで AI 変革を呼びかける

>>:  2018 年の人工知能の商業化に関する 5 つの洞察

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

ヘルスケアがビッグデータの恩恵を受ける6つの方法

テクノロジーは常に世界を変えています。人工知能とビッグデータが融合し、人々にさまざまな恩恵をもたらし...

AI開発と倫理におけるリアリズムの役割

人工知能(AI)は、最初のコンピュータが発明されて以来、長い道のりを歩んできました。今日、人工知能は...

...

マイクロソフト、中小企業向けにCopilot AIアシスタントを導入、個人向けにプレミアムサービスを開始

マイクロソフトは火曜日、中小企業が同社の生産性向上アプリ内で仮想アシスタント「Copilot」を利用...

人工知能がビジネスに進出

人工知能は、時間の経過とともに改良を続け、世界中の人々から賞賛されてきた、人間の設計の驚異です。 T...

DAMOアカデミーが最新の量子コンピューティングの成果を発表、新しいプラットフォームは2ビットゲート精度99.72%を達成

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

機械学習モデルの品質を保証し、その有効性を評価する方法

[[396139]]近年、機械学習モデルアルゴリズムは、ますます多くの産業実践に実装されるようになり...

プログラマーが面接でアルゴリズムについて素早く準備する方法

序文短い記事を書こうと決めたので、これがそれです。私がこの記事を書こうと思った理由は、Weibo 上...

315人の完全なリストが公開: インターネットの蛮行は終結すべき

2022 315 ガラは、3 月 15 日午後 8 時に予定通り開催されます。今年の315ガラは「...

AI + スマート交通が全体のアップグレードと調整を実現

[[353150]]人工知能は、人間のように知覚、認識、決定、実行できる人工プログラムまたはシステム...

2020年にスパムはなくなるでしょうか?

16 年前、ビル・ゲイツはスパムの問題は 2006 年までに解決すると約束しました。 2020 年...

百度が新製品「小度」を発売、マルチラウンド対話と子供向けモードを追加

昨日の午後、百度は新製品発表会で「小度」スマートスピーカーを発表しました。このスマートスピーカーは百...

...

在庫 | 2019 年に最も注目された人工知能と機械学習のスタートアップ 10 社

ベンチャーキャピタル投資に関する最新データが示すところによれば、投資家は人工知能や機械学習のスタート...

製造業の変革を促進、産業改革のためのAI主導ソリューション

製造業において、インダストリー 4.0 は単なる流行語ではなく、新たな現実となっています。新型コロナ...