大規模モデルを路上に展開するための重要なステップ: 世界初の言語 + 自動運転オープンソースデータセットが登場

大規模モデルを路上に展開するための重要なステップ: 世界初の言語 + 自動運転オープンソースデータセットが登場

DriveLM は、データセットとモデルで構成される言語ベースのドライブ プロジェクトです。 DriveLM では、自動運転 (AD) に大規模言語モデルの推論機能を導入し、意思決定を行い、説明可能な計画を確実に実行します。

DriveLM データセットでは、人間が書いた推論ロジックが、認識、予測、計画 (P3) を容易にするための接続として使用されます。私たちのモデルでは、より良い計画結果を生み出すために、マインドマップ機能を備えた AD 視覚言語モデルを提案します。現在、データセットのデモが公開されており、完全なデータセットとモデルは将来的に公開される予定です。

プロジェクトリンク: https://github.com/OpenDriveLab/DriveLM

AD における思考グラフとは何ですか?

データセットの最も興味深い点は、P3 の質問応答 (QA) がグラフ形式の構造で接続されており、各ノードとして QA ペア、エッジとしてオブジェクト関係が使用されていることです。

私たちは、純粋に言語的な思考ツリーやマインドマップよりも、マルチモーダル性を好みます。これを AD ドメインで実行する理由は、生のセンサー入力から最終的な制御アクションまでの各段階で AD タスクが定義されるためです。

DriveLM データセットには何が含まれていますか?

私たちは、主流の nuScenes データセットに基づいてデータセットを構築します。 DriveLM の中核要素は、フレームベースの P3 QA です。知覚の問題では、モデルがシーン内のオブジェクトを認識する必要があります。予測問題では、シーン内の重要なオブジェクトの将来の状態を予測するモデルが必要です。計画問題は、モデルに合理的に計画されたアクションを与え、危険なアクションを回避するように強制します。

キャリブレーションのプロセスはどうなっていますか?

  1. キーフレームの選択。クリップ内のすべてのフレームに基づいて、注釈者は注釈を付ける必要があるキーフレームを選択します。標準では、これらのフレームには、自車両の運動状態の変化(車線変更、急停止、停止後の発進など)が含まれる必要があります。
  2. キーオブジェクトの選択。キーフレームが与えられた場合、注釈者は周囲の 6 つの画像から主要なオブジェクトを選択する必要があります。標準では、これらの物体は車両(信号、道路を横断する歩行者、他の車両)に影響を与えることができる必要があります。
  3. Q&Aノート。これらの主要なオブジェクトが与えられると、認識、予測、計画に関する単一または複数のオブジェクトの質問が自動的に生成されます。詳細については、デモ データをご覧ください。

<<: 

>>:  不確実な環境で自動運転を実現するにはどうすればよいでしょうか?

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

オフライン小売業で AI 自動チェックアウト サービスを構築するにはどうすればよいでしょうか?

翻訳者 | 邱凱校正 | 梁哲、孫淑娟列に並ぶ必要がなく、遅延もなく、便利に購入できるという顧客体験...

...

...

レノボとブラジルのイノベーションセンターCESARは、聴覚障害者が手話を理解できるように人工知能を活用している。

レノボとブラジルのレシフェにある先端研究システムセンター(CESAR)は、聴覚障害者向けに手話を「翻...

大規模モデル幻覚率ランキング:GPT-4は3%と最も低いが、Google Palmは最大27.2%

人工知能は急速に発展していますが、問題も頻繁に発生しています。 OpenAI の新しい GPT ビジ...

4つのPythonソートアルゴリズムをマスターする

プログラミングにおいて、ソートはデータをより速く簡単に見つけるのに役立つ重要なアルゴリズムです。この...

AIが農業用水効率の課題をどう解決するか

[[388190]] • 食糧需要が増加するにつれて、世界は水の使用を管理する必要があります。 • ...

...

エンドツーエンドの自動運転に向けて、Horizo​​n Robotics が Sparse4D アルゴリズムを正式にオープンソース化

Horizo​​n Roboticsは1月22日、純粋な視覚ベースの自動運転アルゴリズムであるSpa...

Huaweiは封鎖を突破し、GoogleのDropout特許をベンチマークし、独自のアルゴリズムDisoutをオープンソース化

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

BAT や他の人たちは人工知能に関してどのようなことを話しましたか?

9月17日、上海の西外灘で2018年世界人工知能大会が正式に開幕した。ジャック・マー、ポニー・マー...

...

2枚の写真でビデオを「計算」できる、Redditのネットユーザーに衝撃

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

コンピュータービジョンはビジネスにどのような変化をもたらすのでしょうか?

コンピューター ビジョンは企業に新たな希望をもたらし、良いスタートが始まったばかりです。視覚入力を視...

TikTokの背後にあるAIの仕組み

エンジニアの視点から TikTok 推奨システムのアーキテクチャを探ります。 TikTok は、ユー...