ロボットは騙されることを恐れない

ロボットは騙されることを恐れない

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

四足歩行ロボットが歩行中に突然片方の足を骨折した場合、前進し続けることはできますか?

Google とミシガン大学の最新の結果は、非常に肯定的な答えを示しています。

彼らは、大規模なモデルやニューラルネットワークに依存しないAutoRobotics-Zero (ARZ)と呼ばれる探索アルゴリズムを発明しました。これにより、ロボットは環境の急激な変化に遭遇すると、自動的に行動戦略を変更することができます。

たとえば、足を骨折してもまだ歩ける場合:

比較すると、他のニューラル ネットワーク メソッドはまだ次のようになります(犬の頭) :

NvidiaのAI科学者ジム・ファン氏は次のようにコメントした。

このアプローチは非常に新鮮です。

ロボットはもはや騙されることを恐れない

具体的にどうやって達成するのでしょうか?

足を失ってもロボットが歩き続ける秘密

環境の変化に素早く適応することは、現実世界で展開されるロボットにとって非常に重要なスキルです。

しかし、現在一般的に使用されているリカレントニューラルネットワーク(RNN)テクノロジには、単一の戦略、推論時間の増加につながる大量のパラメータ化、解釈の難しさなどの問題があります。

この目的のために、著者らは直接「ゼロから始めて」、 AutoML Zeroテクノロジーに基づく新しい四足ロボット環境適応戦略である AutoRobotics-Zero (ARZ)を開発しました。

AutoML Zero について、よく知らない方は、以下で詳細を確認してください。

これは、2020年に誕生した「ゼロからの自動機械学習」アルゴリズムです。これは、Google BrainのQuoc V. Le氏と他の専門家によって作成されました。基本的な数学演算のみを基礎として使用し、空のプログラムから開始して、機械学習タスクを解決できるコンピュータープログラムを自動的に発見できます。

ここで著者らは、さまざまなロボットの行動戦略をニューラル ネットワークではなくプログラムとして表現し、基本的な数学演算のみを構成要素として使用して、適応可能な戦略とその初期パラメーターをゼロから進化させます。

時間が経つにつれて、この方法は、環境と対話しながら、感覚運動経験を使用してポリシーパラメータを微調整したり、制御ロジックを変更したり(ランダムな分岐がランダムなタイミングで中断されたときに新しい分岐を実行したりする)できる制御プログラム(下の図に示すような Python コード)を発見できるようになります。最終的には、変化する状況に適応することが可能になります。

具体的には、ARZ のアルゴリズムは、ロボットが環境と相互作用する各フェーズの開始時に実行される StartEpisode() と、メモリ状態(ポリシーは仮想メモリに作用する線形レジスタとして表されるため)の調整とコードの変更を担当する GetAction() という 2 つのコア関数で構成されています。

進化的探索において、ARZ は 2 つの制御アルゴリズムを使用します。多目的探索用の非優越ソート遺伝的アルゴリズム II (NSGA-II)と、単一目的探索用の正規化進化的アルゴリズム(RegEvo)です。

下の図に示すように、進化制御アルゴリズムの評価プロセスでは、単一目的進化探索では平均エピソード報酬をアルゴリズムの適応度として使用し、多目的探索では平均報酬 (最初の戻り値) とエピソードあたりの平均ステップ数 (2 番目の戻り値) の 2 つの適応度指標を最適化します。

著者らが説明しているように、動的な環境における特定の状況に対して最善の行動を予測するためには、ポリシーが現在の状況を過去の状況や行動と比較できなければなりません。

したがって、すべての ARZ 戦略は「ステートフル」になるように設計されています。つまり、メモリの内容はイベントのタイム ステップ内で持続し、それによって適応を実現します。

さらに、この方法では、元の AutoML Zero テクノロジーの教師あり学習モードも削除され、最終的には進化型プログラムが明示的に教師入力(報酬信号など)を受け取ることなく、ライフサイクル全体にわたって調整できるようになります。

ニューラルネットワークよりも効果的

著者らは、Yushu Technology 社の四足ロボットシミュレータ「 Laikago 」を使用して、シミュレーション環境での効果をテストしました。

最終的に、ARZ だけが、前進を維持し、ランダムな脚の骨折に直面しても転倒を回避する適応戦略を進化させることができました。

対照的に、広範なハイパーパラメータ調整と最先端の強化学習手法でトレーニングされた MLP ベースラインと LSTM ベースラインは両方とも失敗しました。

堅牢性がなく、毎回成功できるとは限りません。

あるいは、まったく成功しなかった。

ARZ がMLP や LSTM よりもはるかに少ないパラメータと FLOPSを使用する場合でも、これは当てはまることに注意する必要があります。

下の図は統計データです。どの列の報酬も 400 未満であれば、このレグのほとんどのテストは下降で終わることを意味します。

ここでも、ARZ を除いて、MLP 法のみが右後脚で 1 回成功できることが分かります。

上記に加えて、ARZ は現在の RNN 技術では実現できない解釈可能性も実証しています。

図に示すように、足の骨折のケースで発見されたさまざまな戦略は、次のように表すことができます。

最後に、ARZ は壊れた脚で歩くことに加えて、「ランダムに傾いたトラックを備えたカートポール システム」で自律的にバランスを維持することもできます。

論文の宛先:

https://arxiv.org/abs/2307.16890

<<:  LK-99の完全懸架映像が初めて物議を醸した。ネットユーザー:本当なら画期的

>>:  「編集神ヴィム」の父が死去。ネットユーザー「彼は多くの人の人生を変えた」

ブログ    
ブログ    
ブログ    
ブログ    
ブログ    

推薦する

AI全盛の時代、機械翻訳はどのように革命を起こすのか?

人工知能の長年の目標は、これまで人間のみが実行していたタスクを機械が実行できるようにすることです。し...

人力資源社会保障省は、人工知能トレーナーを含む16の新しい職業を最終候補者に発表する予定である。

Chinanews.com 1月2日(李金磊)人力資源・社会保障部の承認を得て、中国就業訓練技術指...

Quark App、健康検索をアップグレードし、健康モデルアプリ「Quark Health Assistant」をリリース

12月25日、Quark Appは健康検索の全面的なアップグレードを発表し、健康大規模モデルアプリケ...

大規模モデルの微調整には人間のデータに頼らなければならないのでしょうか? DeepMind: フィードバック付きの自己トレーニングの方が優れている

皆さんもご存知のとおり、大規模言語モデル (LLM) はディープラーニングの状況を変えつつあり、人間...

5分間の技術講演 | GET3D生成モデルの簡単な分析

パート01●序文近年、MidjourneyやStable Diffusionに代表されるAI画像生成...

プライベート5GとAI技術は自動化から自律性への移行を加速させる

モノのインターネットとインダストリー 4.0 の登場以来、マシン ビジョン、人工知能、機械学習、ディ...

世界のトップ25の人工知能企業

過去数年間で人工知能の利用は爆発的に増加しており、すでに多くのスタートアップ企業や大手企業が独自の ...

無意味または有害なボットトラフィックは年間最大2億5000万ドルのコストがかかる

Cyber​​news によると、ますます多くの企業が、検出がますます困難になっている悪意のあるボッ...

研究者は、現在のAIトレーニングの効率が低すぎると不満を述べている

海外メディアによると、グーグルの研究者は以前、グーグルが現在検索やその他のテキスト分析製品に使用して...

2021年に自動運転は私たちをどこへ連れて行くのでしょうか?

[[361430]]文/Quiu Yueye 編集/Tan Lu新年、自動運転は私たちをどこへ連れ...

劉強東氏は「10年で8万人を解雇する」という噂を否定するが、人工知能は無人企業を実現できると語る

最近、「JD.comが今後10年間で8万人の従業員を解雇する」というニュースがネット上で広まった。こ...

...

...

モジュラーコンピュータはこうあるべきだ: 1人の人間が作った超小型コンピュータがオタクコミュニティ全体に衝撃を与えた

手を汚すことが好きな人にとって、コンピューターはおもちゃのようなものです。 Raspberry Pi...

顔認識技術の長所と短所

かつては、特に『スタートレック』や『2001年宇宙の旅』などのSF作品では未来の文明の進歩の象徴とみ...