Google は、TensorFlow をベースとし、柔軟性、安定性、再現性、高速ベンチマークを提供する最新の強化学習フレームワーク Dopamine を紹介するブログを公開しました。 GitHub リポジトリ: https://github.com/google/dopamine 過去数年間で、強化学習の研究は多くの面で大きな進歩を遂げました。これらの進歩により、エージェントは人間を超えたレベルでゲームをプレイできるようになり、注目すべき例としては、DeepMind の DQN による Atari ゲーム、AlphaGo、AlphaGoZero、Open AI Five のパフォーマンスが挙げられます。具体的には、DQN にリプレイ メモリを導入することでエージェントは過去の経験を活用できるようになり、大規模な分散トレーニングによりエージェントは学習プロセスを複数のワーカーに分散できるようになり、分散アプローチによりエージェントは期待値だけでなく分布全体をモデル化できるため、環境の完全な状況を把握できるようになります。この進歩は、アルゴリズムによってこれらの進歩が可能になり、ロボット工学などの他の分野でも使用できるため重要です。 通常、このような進歩を遂げるには、既存のアプローチの構造を破壊する設計の迅速な反復(多くの場合、明確な指示なし)が必要です。しかし、既存の強化学習フレームワークのほとんどは、研究者が RL 手法を効率的に反復できるようにする柔軟性と安定性の両方を備えていないため、新しい研究の方向性を模索しても、短期的には大きな利益が得られない可能性があります。さらに、既存のフレームワークの結果を再現するには時間がかかりすぎることが多く、科学的な再現性の問題につながる可能性があります。 Google は本日、強化学習の研究者や関連担当者に、柔軟で安定した再現性のあるツールを提供することを目的とした、TensorFlow をベースとした新しいフレームワークを発表しました。このフレームワークは、脳内の報酬動機行動の主要成分であるドーパミンにヒントを得たもので、神経科学と強化学習研究の密接なつながりを反映しており、大きな発見につながる可能性のある推測的研究をサポートするように設計されています。 Google は、フレームワークの使用方法を説明するために、関連する Colab (https://github.com/google/dopamine/blob/master/dopamine/colab/README.md) のセットもリリースしました。 使いやすさこのフレームワークの設計では、明瞭性とシンプルさが 2 つの重要な考慮事項でした。 Google が提供するコードはコンパクト (Python ファイル約 15 個) で、ドキュメントも充実しています。その理由は、Google の研究者が、成熟した、よく理解されているベンチマークである Arcade Learning Environment (ALE) と、4 つの価値ベースのエージェント (DQN、C51、Rainbow エージェントの慎重に設計された簡易版、および Implicit Quantile Network エージェント (先月の ICML カンファレンスで発表されたばかり)) に焦点を当てたためです。 Google は、このシンプルさにより、研究者がエージェントの内部の仕組みを理解しやすくなり、新しいアイデアをすぐに試せるようになることを期待しています。 再現性Google は強化学習研究における再現性を非常に重視しています。そのため、Google はコードに対して完全なテストを提供しており、これらのテストはドキュメントに記載されています。さらに、Google の実験フレームワークは、ALE を使用した標準化された経験的評価に関する Machado ら (2018) の推奨事項に従っています。 ベンチマーク新しい研究者にとって、自分のアイデアを素早くベンチマークすることは非常に重要です。 Google は、ALE でサポートされている 60 のゲームを含む 4 つのエージェントの完全なトレーニング データを、Python ピクル ファイル (Google のフレームワークを使用してトレーニングされたエージェント用) と JSON データ ファイル (他のフレームワークを使用してトレーニングされたエージェントとの比較用) の形式で提供しています。 Google は、研究者が全 60 のゲームで提供されたすべてのエージェントのトレーニング実行をすばやく視覚化できる Web サイトも提供しています。下の写真は、Google のエージェント 4 人が Seaquest (ALE がサポートする Atari 2600 ゲームの 1 つ) のトレーニングをしているところです。 Google の 4 人のエージェントのトレーニングは Seaquest で実行されます。 x 軸は反復を表し、各反復は 100 万ゲーム フレーム (リアルタイム ゲームプレイで 4.5 時間) です。y 軸はゲームごとに得られる平均スコアです。網掛け部分は 5 回の独立した実行からの信頼区間を表します。 Google は、これらのエージェントを使用してトレーニングされたディープ ネットワーク、生の統計ログ、Tensorboard 視覚化用の TensorFlow イベント ファイルも提供しています。 関連アドレス: https://github.com/google/dopamine/tree/master/docs#downloads Google は、このフレームワークの柔軟性と使いやすさが研究者による新しいアイデアの試行に役立つことを期待している。 Google は研究でこのフレームワークを使用し、多くのアイデアを非常に柔軟に迅速に反復できることを発見しました。 Google は、コミュニティがこのフレームワークを使用するのを楽しみにしています。 |
<<: 子どもたちがロボットに出会うと、彼らの社会的交流はどのように変化するのでしょうか?
>>: 視覚畳み込みニューラルネットワークモデルを習得し、画像認識技術の分野を探索します。
将来的には、考えただけでロボットに家事を任せることができるようになるかもしれません。スタンフォード大...
[[428985]] [51CTO.com クイック翻訳]今日の人工知能の繁栄は、人工ニューラルネッ...
「Qwen-72Bモデルは11月30日に発売されます。」数日前、Xプラットフォームのネットユーザー...
2021年以降、企業内部者によるデータ侵害、損失、盗難は月平均28%増加しており、回答者の85%は今...
近年、人件費の継続的な上昇に伴い、産業分野では「機械が人に取って代わる」という現象が一般的になり、産...
過去2年間、人々の注目は5Gにますます集まっているものの、人工知能の発展と人気は少しも衰えていません...
ディープラーニングを使用して株価を予測することは、以前は少し神秘的に思えたかもしれませんが、新しいこ...
なぜビッグデータは十分にスマートではないのでしょうか?確率の言語よりも強力な思考ツールは何でしょうか...
数学は科学の基礎として、常に研究と革新の重要な分野となってきました。最近、プリンストン大学と他の 7...