大型モデルがドローンを制御できるように、北京航空航天チームは具現化された知能の新しいアーキテクチャを提案した

マルチモーダル時代突入、大型機種でもドローンを操縦可能！

視覚モジュールが開始条件を捉えれば、大型モデルの「頭脳」が動作指示を生成し、ドローンはそれを迅速かつ正確に実行できるようになります。

北京航空航天大学インテリジェントUAVチームの周耀明教授のチームを含む研究者らは、マルチモーダルな大型モデルに基づく具現化されたインテリジェントボディアーキテクチャを提案した。

現在、このアーキテクチャはドローンの制御に適用されています。

では、この新しいインテリジェントエージェントはどのように機能し、その技術的な詳細はどのようなものでしょうか?

研究チームは、大型モデルのマルチモーダルデータ理解能力を利用して、現実の物理世界からの写真、音、センサーデータなどのマルチソース情報をエネルギー体の知覚に融合し、現実世界のアクチュエータの動作をインテリジェントボディの動作として使用しました。

同時に、チームは「エージェントは大脳、コントローラーは小脳」という制御アーキテクチャを提案しました。

エージェントは、脳と呼ばれる意思決定ジェネレーターとして、高レベルの動作を生成することに重点を置いています。

コントローラーである小脳は、高レベルの動作 (目的のターゲットポイントなど) を低レベルのシステムコマンド (ローター速度など) に変換することに重点を置いたモーターコントローラーです。

具体的には、研究チームはこの成果には3つの大きな貢献があると考えています。

研究チームは、マルチモーダルな大規模モデルに基づく知的エージェントを脳内に具体化し、実際のロボットに適用するための新しいシステムアーキテクチャを提案した。

ロボットの動作プランナーとコントローラーは小脳として視覚化され、ロボットの知覚システムは人間の目、耳、その他の情報収集器に類似しており、ロボットのアクチュエーターは人間の手やその他のアクチュエーターに類似しています。

△ 図1 ハードウェアシステムアーキテクチャ

これらのノードは ROS を介して接続され、ROS 内のメッセージのサブスクリプションとパブリッシュ、またはサービスの要求と応答を介して通信します。これは、従来のエンドツーエンドの大規模ロボットモデル制御とは異なります。

このアーキテクチャにより、エージェントは高レベルのコマンドの生成に集中できるようになり、高レベルのタスクに対してよりインテリジェントになり、実際の実行に対してより堅牢で信頼性の高いものになります。

△ 図2 ソフトウェアシステムアーキテクチャ

このアーキテクチャの下で、著者らは頭脳としてインテリジェントエージェント AeroAgent を構築しました。

エージェントは主に 3 つの部分で構成されます。

マルチモーダル認識・監視機能を備えた自動計画生成モジュールで、スタンバイモードでの緊急インシデント処理にも優れています。
マルチモーダルメモリの検索と反映に使用できるマルチモーダルデータメモリモジュール。エージェントに少量学習の能力を与えます。
具現化されたインテリジェントアクションモジュールは、具現化されたインテリジェントボディとROS上の他のモジュールとの間に安定した制御のためのブリッジを確立することができます。このモジュールは、ブリッジとしての操作を使用してROS上の他のノードにアクセスする機能を提供します。

同時に、アクションの完了には、センサーからアクションの実行に必要なパラメータを取得するための複数の操作の相互作用が必要になる場合があり、エージェントが包括的な状況認識とそれが持つアクチュエータに基づいて安定した具現化されたアクションを出力できることを保証します。

△ 図3 AeroAgentモジュールアーキテクチャ