ドーパミンが来る! Google が新しい強化学習フレームワーク Dopamine を発表

ドーパミンが来る! Google が新しい強化学習フレームワーク Dopamine を発表

Google は、TensorFlow をベースとし、柔軟性、安定性、再現性、高速ベンチマークを提供する最新の強化学習フレームワーク Dopamine を紹介するブログを公開しました。

GitHub リポジトリ: https://github.com/google/dopamine

過去数年間で、強化学習の研究は多くの面で大きな進歩を遂げました。これらの進歩により、エージェントは人間を超えたレベルでゲームをプレイできるようになり、注目すべき例としては、DeepMind の DQN による Atari ゲーム、AlphaGo、AlphaGoZero、Open AI Five のパフォーマンスが挙げられます。具体的には、DQN にリプレイ メモリを導入することでエージェントは過去の経験を活用できるようになり、大規模な分散トレーニングによりエージェントは学習プロセスを複数のワーカーに分散できるようになり、分散アプローチによりエージェントは期待値だけでなく分布全体をモデル化できるため、環境の完全な状況を把握できるようになります。この進歩は、アルゴリズムによってこれらの進歩が可能になり、ロボット工学などの他の分野でも使用できるため重要です。

通常、このような進歩を遂げるには、既存のアプローチの構造を破壊する設計の迅速な反復(多くの場合、明確な指示なし)が必要です。しかし、既存の強化学習フレームワークのほとんどは、研究者が RL 手法を効率的に反復できるようにする柔軟性と安定性の両方を備えていないため、新しい研究の方向性を模索しても、短期的には大きな利益が得られない可能性があります。さらに、既存のフレームワークの結果を再現するには時間がかかりすぎることが多く、科学的な再現性の問題につながる可能性があります。

Google は本日、強化学習の研究者や関連担当者に、柔軟で安定した再現性のあるツールを提供することを目的とした、TensorFlow をベースとした新しいフレームワークを発表しました。このフレームワークは、脳内の報酬動機行動の主要成分であるドーパミンにヒントを得たもので、神経科学と強化学習研究の密接なつながりを反映しており、大きな発見につながる可能性のある推測的研究をサポートするように設計されています。 Google は、フレームワークの使用方法を説明するために、関連する Colab (https://github.com/google/dopamine/blob/master/dopamine/colab/README.md) のセットもリリースしました。

使いやすさ

このフレームワークの設計では、明瞭性とシンプルさが 2 つの重要な考慮事項でした。 Google が提供するコードはコンパクト (Python ファイル約 15 個) で、ドキュメントも充実しています。その理由は、Google の研究者が、成熟した、よく理解されているベンチマークである Arcade Learning Environment (ALE) と、4 つの価値ベースのエージェント (DQN、C51、Rainbow エージェントの慎重に設計された簡易版、および Implicit Quantile Network エージェント (先月の ICML カンファレンスで発表されたばかり)) に焦点を当てたためです。 Google は、このシンプルさにより、研究者がエージェントの内部の仕組みを理解しやすくなり、新しいアイデアをすぐに試せるようになることを期待しています。

再現性

Google は強化学習研究における再現性を非常に重視しています。そのため、Google はコードに対して完全なテストを提供しており、これらのテストはドキュメントに記載されています。さらに、Google の実験フレームワークは、ALE を使用した標準化された経験的評価に関する Machado ら (2018) の推奨事項に従っています。

ベンチマーク

新しい研究者にとって、自分のアイデアを素早くベンチマークすることは非常に重要です。 Google は、ALE でサポートされている 60 のゲームを含む 4 つのエージェントの完全なトレーニング データを、Python ピクル ファイル (Google のフレームワークを使用してトレーニングされたエージェント用) と JSON データ ファイル (他のフレームワークを使用してトレーニングされたエージェントとの比較用) の形式で提供しています。 Google は、研究者が全 60 のゲームで提供されたすべてのエージェントのトレーニング実行をすばやく視覚化できる Web サイトも提供しています。下の写真は、Google のエージェント 4 人が Seaquest (ALE がサポートする Atari 2600 ゲームの 1 つ) のトレーニングをしているところです。

Google の 4 人のエージェントのトレーニングは Seaquest で実行されます。 x 軸は反復を表し、各反復は 100 万ゲーム フレーム (リアルタイム ゲームプレイで 4.5 時間) です。y 軸はゲームごとに得られる平均スコアです。網掛け部分は 5 回の独立した実行からの信頼区間を表します。

Google は、これらのエージェントを使用してトレーニングされたディープ ネットワーク、生の統計ログ、Tensorboard 視覚化用の TensorFlow イベント ファイルも提供しています。

関連アドレス: https://github.com/google/dopamine/tree/master/docs#downloads

Google は、このフレームワークの柔軟性と使いやすさが研究者による新しいアイデアの試行に役立つことを期待している。 Google は研究でこのフレームワークを使用し、多くのアイデアを非常に柔軟に迅速に反復できることを発見しました。 Google は、コミュニティがこのフレームワークを使用するのを楽しみにしています。

<<:  子どもたちがロボットに出会うと、彼らの社会的交流はどのように変化するのでしょうか?

>>:  視覚畳み込みニューラルネットワークモデルを習得し、画像認識技術の分野を探索します。

ブログ    
ブログ    

推薦する

...

「デジタルマン」もリストに載っているので、怖いのかと聞いてみたいのですが

冬季オリンピックが本格的に開幕。新たなトップスター「ビン・ドゥエンドゥエン」のほか、競技場内外を支え...

...

...

人工知能を活用するメリットと課題

人工知能 (AI) は、世界中の家庭や企業において、未来の夢から現代の現実へと変化しました。 AI ...

バックトラッキングアルゴリズム - ロボットの動作範囲

[[415476]]この記事はWeChatの公開アカウント「Magic Programmer K」か...

...

人工知能が人間に取って代わり、多くの人が失業することになるのでしょうか?

人工知能とは何ですか? AI と呼ばれる人工知能は、コンピュータ サイエンスの一分野です。このテクノ...

AIが高性能鋼材の設計を支援:破壊強度と破壊寿命を正確に予測

機械学習技術は、ヘルスケアから高エネルギー物理学に至るまでのさまざまな分野の進歩を推進しています。現...

知っておくべき6つのオープンソースAIツール

[[236435]]誰でも使用できる無料のオープンソース AI ツールをいくつか見てみましょう。オー...

WOT2019 検索推奨アルゴリズムフォーラム: さまざまな分野における AI ベースの検索推奨の実用化

6月21日、WOT2019グローバルテクノロジーサミットとグローバル人工知能テクノロジーサミットが北...

汎用人工知能の時代が到来

さまざまな状況情報を記憶し、推論できるパーソナル AI アシスタントは、常にすぐそこまで来ているよう...

ショッピングをもっと便利に:Mogujie ビジュアル検索テクノロジーアーキテクチャの実践

[51CTO.com からのオリジナル記事] 周知のとおり、画像検索はコンピューター ビジョン分野に...

AI業界は大きな変化を遂げています。AI科学者がMVPになるには

20 年前、人工知能の研究に興味を持つ人は、主に大学や非営利の AI 研究所に限られていました。 A...

IBM、GPUに匹敵する新しいニューラルネットワークチップを開発

本日 Nature 誌に掲載された論文で、IBM Research のポスドク研究員 Stefano...