AI ゲームの分野では、人工知能の進歩はボードゲームを通じて実証されることが多いです。ボードゲームは、制御された環境で人間と機械がどのように戦略を立て、実行するかを測定および評価できます。数十年にわたり、事前に計画を立てる能力は、チェス、チェッカー、将棋、囲碁などの完全情報ゲーム、およびポーカーやスコットランドヤードなどの不完全情報ゲームにおける AI の成功の鍵となってきました。 これらの理由から、Stratego は大規模な政策相互作用を研究するための挑戦的なベンチマークを提供します。ほとんどのボードゲームと同様に、ストラテゴは、比較的ゆっくりと、慎重に、論理的に決定を順番に下す能力をテストします。ゲームの構造が非常に複雑なため、AI研究コミュニティはほとんど進歩しておらず、人工知能エージェントはアマチュアの人間プレイヤーのレベルにしか到達できません。したがって、Stratego のような不完全な情報の下で、人間のデモンストレーション データなしで、エンドツーエンドの戦略を学習して最適な決定を下すエージェントをゼロから開発することは、AI 研究における大きな課題の 1 つとなっています。 論文アドレス: https://arxiv.org/pdf/2206.15378.pdf. DeepNash は本質的には、研究者が正規化ナッシュダイナミクス (R-NaD) と呼ぶ、構造化されたモデルフリーの強化学習アルゴリズムです。 DeepNash は R-NaD とディープ ニューラル ネットワーク アーキテクチャを組み合わせ、ナッシュ均衡に収束します。つまり、インセンティブ競争下でプレイすることを学習し、それを悪用しようとする競合他社に対して堅牢です。 研究者らは、学習アルゴリズムにいかなる検索方法も導入することなく、AIアルゴリズムが複雑なボードゲームで初めて人間の専門家のレベルに到達できたと述べ、また、AIがストラテゴのゲームで人間の専門家レベルを達成したのも初めてだった。 方法の概要DeepNash は、エンドツーエンドの学習戦略を使用して Stratego を実行し、ゲームの開始時にボード上に駒を戦略的に配置します (図 1a を参照)。ゲームプレイ段階では、研究者は統合されたディープ RL とゲーム理論のアプローチを使用します。エージェントは自己プレイを通じて近似的なナッシュ均衡を学習することを目指します。 この研究では、探索なしの直交パスを採用し、自己ゲームにおけるモデルフリー強化学習とゲーム理論アルゴリズムのアイデアである正規化ナッシュダイナミクス(RNaD)を組み合わせた新しい方法を提案します。 正規化ナッシュダイナミクスアルゴリズムDeepNash で使用される R-NaD 学習アルゴリズムは、収束を達成するための正規化の考え方に基づいています。R-NaD は、下の図 2b に示すように、3 つの主要なステップに依存しています。 DeepNashは、(1)コアトレーニングコンポーネントであるR-NaD、(2)モデルが極めて起こりそうもないアクションを取る残余確率を減らすための学習ポリシーの微調整、(3)低確率のアクションを除外してエラーを修正するためのテスト時の後処理の3つのコンポーネントで構成されています。 実験結果DeepNash は、いくつかの既存の Stratego コンピュータ プログラムと比較しても評価されました。Probe は 3 年前 (2007、2008、2010) に Computer Stratego World Championship で優勝しました。Master of the Flag は 2009 年に優勝しました。Demon of Ignorance は Stratego のオープン ソース実装です。Asmodeus、Celsius、Celsius1.1、PeternLewis、および Vixen は、2012 年にオーストラリア大学プログラミング コンテストに提出されたプログラムで、PeternLewis が優勝しました。
|
<<: あらゆるビジネスオペレーションに AI を効果的に適用する 10 の方法
>>: 私の世界では、ステーションBのUPホストが世界初の純粋なレッドストーンニューラルネットワークを構築し、チューリング賞を受賞したヤン・ルカンがいいねを転送しました。
Meta Platforms は本日、Meta が社内開発した、200 言語のテキストを翻訳できる人...
大規模言語モデル (LLM) には、これまでにない言語理解および生成機能が備わっていますが、これらの...
人工知能 (AI) には、ビジネス運営に革命を起こす大きな可能性があります。実際、ある調査によると、...
GTA5 は古典的な 3D アドベンチャー ゲームであり、そのスタイルは次のとおりです。写真は現実に...
[[227907]]ここ数カ月、軍事用AIと能動攻撃兵器の問題が話題になっており、多くのAI研究者...
この記事は、Heart of Autonomous Driving の公開アカウントから許可を得て転...
[[255991]]継続的な学習と継続的な開発は、主流の IT 業界のプログラマーにとって日常的な...
Python を使用すると、お客様専用のチャットボット プログラムの構築など、さまざまな目標を達成で...
近年、Transformer に基づく大規模言語モデルは、驚くべきコンテキスト内学習 (ICL) 機...
OpenAIは2022年11月にChatGPTをリリースし、その後Microsoftから100億ド...
ニューヨーク大学の心理学・神経科学教授ゲイリー・マーカス氏と、ディープラーニングの先駆者で2018年...
ヘルスケア分野では、人工知能 (AI) と機械学習 (ML) が患者のケア、診断、治療に大きな進歩を...