AI ゲームの分野では、人工知能の進歩はボードゲームを通じて実証されることが多いです。ボードゲームは、制御された環境で人間と機械がどのように戦略を立て、実行するかを測定および評価できます。数十年にわたり、事前に計画を立てる能力は、チェス、チェッカー、将棋、囲碁などの完全情報ゲーム、およびポーカーやスコットランドヤードなどの不完全情報ゲームにおける AI の成功の鍵となってきました。 これらの理由から、Stratego は大規模な政策相互作用を研究するための挑戦的なベンチマークを提供します。ほとんどのボードゲームと同様に、ストラテゴは、比較的ゆっくりと、慎重に、論理的に決定を順番に下す能力をテストします。ゲームの構造が非常に複雑なため、AI研究コミュニティはほとんど進歩しておらず、人工知能エージェントはアマチュアの人間プレイヤーのレベルにしか到達できません。したがって、Stratego のような不完全な情報の下で、人間のデモンストレーション データなしで、エンドツーエンドの戦略を学習して最適な決定を下すエージェントをゼロから開発することは、AI 研究における大きな課題の 1 つとなっています。 論文アドレス: https://arxiv.org/pdf/2206.15378.pdf. DeepNash は本質的には、研究者が正規化ナッシュダイナミクス (R-NaD) と呼ぶ、構造化されたモデルフリーの強化学習アルゴリズムです。 DeepNash は R-NaD とディープ ニューラル ネットワーク アーキテクチャを組み合わせ、ナッシュ均衡に収束します。つまり、インセンティブ競争下でプレイすることを学習し、それを悪用しようとする競合他社に対して堅牢です。 研究者らは、学習アルゴリズムにいかなる検索方法も導入することなく、AIアルゴリズムが複雑なボードゲームで初めて人間の専門家のレベルに到達できたと述べ、また、AIがストラテゴのゲームで人間の専門家レベルを達成したのも初めてだった。 方法の概要DeepNash は、エンドツーエンドの学習戦略を使用して Stratego を実行し、ゲームの開始時にボード上に駒を戦略的に配置します (図 1a を参照)。ゲームプレイ段階では、研究者は統合されたディープ RL とゲーム理論のアプローチを使用します。エージェントは自己プレイを通じて近似的なナッシュ均衡を学習することを目指します。 この研究では、探索なしの直交パスを採用し、自己ゲームにおけるモデルフリー強化学習とゲーム理論アルゴリズムのアイデアである正規化ナッシュダイナミクス(RNaD)を組み合わせた新しい方法を提案します。 正規化ナッシュダイナミクスアルゴリズムDeepNash で使用される R-NaD 学習アルゴリズムは、収束を達成するための正規化の考え方に基づいています。R-NaD は、下の図 2b に示すように、3 つの主要なステップに依存しています。 DeepNashは、(1)コアトレーニングコンポーネントであるR-NaD、(2)モデルが極めて起こりそうもないアクションを取る残余確率を減らすための学習ポリシーの微調整、(3)低確率のアクションを除外してエラーを修正するためのテスト時の後処理の3つのコンポーネントで構成されています。 実験結果DeepNash は、いくつかの既存の Stratego コンピュータ プログラムと比較しても評価されました。Probe は 3 年前 (2007、2008、2010) に Computer Stratego World Championship で優勝しました。Master of the Flag は 2009 年に優勝しました。Demon of Ignorance は Stratego のオープン ソース実装です。Asmodeus、Celsius、Celsius1.1、PeternLewis、および Vixen は、2012 年にオーストラリア大学プログラミング コンテストに提出されたプログラムで、PeternLewis が優勝しました。
|
<<: あらゆるビジネスオペレーションに AI を効果的に適用する 10 の方法
>>: 私の世界では、ステーションBのUPホストが世界初の純粋なレッドストーンニューラルネットワークを構築し、チューリング賞を受賞したヤン・ルカンがいいねを転送しました。
翻訳者 |ブガッティレビュー | Chonglouこの記事では、無料で使いやすい新しいクラウドIDE...
AI時代においては、セキュリティを早急に再定義する必要があります。人工知能やモノのインターネットなど...
「今年末までに、学覇君は年間売上高10億元を確保するという小さな目標を達成する予定です」と張凱蕾氏は...
マルチモーダル生成型人工知能 (GenAI) は、汎用人工知能の実現に向けた次の大きな進歩と言えます...
昨今、人工知能はますます話題になり、応用されていますが、人工知能、機械学習、マシンビジョンとは一体何...
5月29日、全国科学技術労働者の日が近づく中、アリババDAMOアカデミーのAIによって識別されラベル...
IoT が広く普及したことにより、さまざまな目的のためのスマートな接続型ガジェットの開発が促進され...
あなたの目の前に表示されている画像の人物は現実には存在しません。実は、機械学習モデルによって作成され...
著者 | イー・リアン1. はじめに唯一不変なのは変化です。変化を受け入れる前に、調査し、属性を特定...
つまり、新しい Google 検索アルゴリズムでは、「HTTPS」(Hypertext Transf...
導入参照ビデオ オブジェクト セグメンテーション (RVOS) は、参照テキストに基づいてビデオ シ...