BEV におけるデータセット間レーダーカメラ融合に関する実験的研究

BEV におけるデータセット間レーダーカメラ融合に関する実験的研究

この記事は、Heart of Autonomous Driving の公開アカウントから許可を得て転載したものです。転載については出典元にお問い合わせください。

原題: 鳥瞰図におけるレーダーとカメラの融合に関するデータセット間実験的研究
論文リンク: https://arxiv.org/pdf/2309.15465.pdf
著者所属機関: オペル自動車株式会社 ラインラント=プファルツ工科大学 カイザースラウテルン=ランダウ ドイツ人工知能研究センター

論文のアイデア:

mmWave レーダーとカメラの融合システムは、補完的なセンサー情報を活用することで、先進運転支援システムや自動運転機能に非常に堅牢で信頼性の高い認識システムを提供できる可能性があります。カメラベースの物体検出における最近の進歩により、ミリ波レーダーカメラと鳥瞰図の特徴マップを融合する新たな可能性が生まれています。本稿では、新しい柔軟な融合ネットワークを提案し、nuScenes と View-of-Delft の 2 つのデータセットでそのパフォーマンスを評価します。私たちの実験では、カメラ部門では大規模で多様なトレーニング データが必要であるのに対し、mmWave レーダー部門では高性能 mmWave レーダーからより多くのメリットが得られることがわかりました。この論文では転移学習を使用して、より小さなデータセットでのカメラのパフォーマンスを向上させます。さらに、私たちの結果は、mmWave レーダーとカメラの融合アプローチが、カメラのみおよび mmWave レーダーのみのベースラインを大幅に上回ることを示しています。

ネットワーク設計:

3D オブジェクト検出における最近の傾向は、画像の特徴を共通の鳥瞰図 (BEV) 表現に変換することです。これにより、複数のカメラ間の融合や距離センサーの使用に使用できる柔軟な融合アーキテクチャが提供されます。本研究では、もともとレーザーカメラ融合に使用されていた BEVFusion 法を拡張して、ミリ波レーダーカメラ融合を実行します。提案された融合方法は、選択された mmWave レーダー データセットでトレーニングおよび評価されます。いくつかの実験で、各データセットの長所と短所について説明します。最後に、本論文では移行を適用してさらなる改善を実現します。

図 1 BEVFusion に基づく BEV ミリ波レーダー カメラ融合フローチャート。生成されたカメラ画像には、投影された mmWave レーダー検出と地上真実境界ボックスが含まれます。

この記事では、BEVFusion の融合アーキテクチャについて説明します。図1は、本論文におけるBEVにおけるミリ波レーダーとカメラの融合のネットワーク概要を示しています。融合は、BEV 内でカメラと mmWave レーダー機能が接続されたときに発生することに注意してください。以下、この記事では各ブロックの詳細について説明します。

A. カメラエンコーダーとカメラからBEVへのビュー変換

カメラエンコーダとビュー変換は[15]のアイデアを採用しており、任意のカメラの外部パラメータと内部パラメータの画像BEV特徴を抽出できる柔軟なフレームワークである。まず、tiny-Swin Transformer ネットワークを使用して各画像から特徴を抽出します。次に、[14]のLiftとSplatのステップを使用して、画像の特徴をBEV平面に変換します。このため、高密度深度予測の後にルールベースのブロックが続き、そこで特徴が疑似ポイント クラウドに変換され、ラスタライズされて BEV グリッドに蓄積されます。

B. レーダーピラー特徴エンコーダ

このブロックの目的は、mmWave レーダー ポイント クラウドを、画像 BEV 機能と同じグリッド上の BEV 機能にエンコードすることです。この目的のために、本論文ではピラー特徴エンコーディング技術[16]を使用して、点群を無限に高いボクセル、いわゆるピラーにラスタライズします。

C. BEVエンコーダ

[5]と同様に、mmWaveレーダーとカメラのBEV機能はカスケード接続で融合されています。融合された特徴は、ジョイント畳み込み BEV エンコーダーによって処理され、ネットワークが空間的なずれを考慮し、異なるモダリティ間の相乗効果を活用できるようになります。

D. 検出ヘッド

この論文では、CenterPoint 検出ヘッドを使用して、各クラスのオブジェクト中心のヒートマップを予測します。さらに回帰ヘッドは、オブジェクトのサイズ、回転、高さ、および nuScenes の速度とクラス属性を予測します。ヒートマップはガウス焦点損失を使用してトレーニングされ、残りの検出ヘッドは L1 損失を使用してトレーニングされます。

実験結果:

引用:

Stäcker, L., Heidenreich, P., Rambach, J., & Stricker, D. (2023). 鳥瞰図におけるレーダーカメラ融合のデータセット間実験研究。ArXiv. /abs/2309.15465

オリジナルリンク: https://mp.weixin.qq.com/s/5mA5up5a4KJO2PBwUcuIdQ

<<:  はるか先へ! BEVHeight++: 道路脇の視覚的な 3D オブジェクト検出のための新しいソリューション!

>>:  Linux サーバー管理のヒント: 効率とセキュリティを向上させる

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

MIT の FrameDiff ツールがリリースされ、AI を使用してタンパク質構造を設計し、医療開発の促進に役立てられるようになりました。

7月13日、 MITの研究者らは、医薬品開発の加速と遺伝子治療の改善を目的として、生成型人工知能を...

...

...

アメリカのAI企業の優位性を打ち破り、AI数学オープンソースモデルでアベルが1位に

ChatGPTに代表される大型モデル製品は新たな産業革命を先導し、国内外の機関が関連技術研究に積極的...

AIがAIを攻撃、サイバーセキュリティ戦争が激化

最近のサイバーセキュリティ会議では、調査対象となった業界専門家100人のうち62人が、AIを活用した...

実践的な知識 | 教師なし学習の基礎に関する包括的な理解

1. 教師なし学習教師なし学習の特徴は、モデルが学習するデータにラベルがないことです。そのため、教師...

携帯電話が1秒で3Dホログラムを生成する、MITチームの新しい研究

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

2024年に期待するAI関連ニュース5選

OpenAIが2022年11月にChatGPTをリリースした後、GPT-4やEU AI法案からAI検...

Google の 15 のオープンソース無料人工知能プロジェクト!開発者: 了解しました

開発者は人工知能に関するオープンソース プロジェクトを数多く目にしてきたと思いますし、Github ...

AIがあなたが何歳で死ぬかを予測?トランスフォーマーの「占い」がネイチャーのサブジャーナルに掲載され、事故死の予測に成功

AIは本当に科学的に占いができるんですね! ?デンマーク工科大学(DTU)の研究者らは、各人の死亡の...

ロボットは独自の言語を作り、将来的には自律的にコミュニケーションできるようになるのでしょうか?

[[187107]]人工知能技術は飛躍的に進歩していますが、人工知能間のコミュニケーションの問題は...

いくつかの名門大学とAdobeは、このオープンソースアルゴリズムを使用して、300年以上前の手紙を「透視」しました。

この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式...

100万個のニューロンをリアルタイムでスキャンできるようになりました。脳細胞活動の画像化における新たなブレークスルーです。

数年前なら、コンピューターが 10,000 個のニューロンの活動を同時に記録していたらニュースになっ...

従来のグラフエンジンから GNN へ: 計算グラフと機械学習の進化

この記事は公開アカウント「Reading Core Technique」(ID: AI_Discov...