この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。 5月20日、アリババDAMOアカデミーXR研究室は、視覚的な位置測定の精度を確保しながら地図を250倍以上に圧縮し、携帯電話などのエンドデバイスに保存できる新しい3D位置測定マップ圧縮アルゴリズムを提案した。関連論文は、コンピュータービジョンのトップカンファレンスであるCVPR 2022に掲載されました。同研究室は独自に開発した3次元アルゴリズムの最適化を継続しており、マッピングや測位などのコア技術モジュールで多くの革新を実現していると報告されている。同研究室の論文の多くはトップクラスの国際会議で発表されている。 3D ビジュアル ポジショニングは、没入型インターネットのコア テクノロジーの 1 つです。標準的な 3D 視覚的位置決め方法では、特定のシーンの 3D マップを事前に構築し、特徴点をカメラで撮影した 2D 画像と照合してユーザーの位置と姿勢を計算する必要があります。しかし、3D マップはサイズが大きく、多くのストレージ容量を必要とするため、メモリや帯域幅が限られている携帯電話などのモバイル デバイスには展開できません。 業界では軽量 3D マップに関する多くの研究が行われてきました。DAMO アカデミーの XR ラボは、これまでの研究に基づいて、3D マップを 250 倍以上圧縮し、精度の低下を小さな範囲内に抑えて、モデル サイズと位置決め精度のバランスを実現する新しい方法、SceneSqueezer を提案しました。 SceneSqueezerは階層化戦略を使用して3Dマップを圧縮します 論文「SceneSqueezer: カメラの再ローカリゼーションのためのシーン圧縮の学習」によると、DAMO アカデミー チームは 3D マップを圧縮するために階層的な戦略を採用しました。まず、データベース イメージはペアの共視認性情報を使用してクラスタ化され、シーンは複数のクラスタに分割されて個別に圧縮されました。次に、最終的なポーズ推定精度に基づいて、チームは各イメージの特徴点を選択することを学習しました。最後に、特徴点の記述は特徴量子化法を使用して圧縮されました。このアルゴリズムは、Cambridge LandmarksやAachen Day-Nightなどの屋外シーン データセットにおいて既存の方法よりも優れたパフォーマンスを発揮します。 DAMOアカデミーXR研究室の上級アルゴリズム専門家である董子龍氏は、XRチームが独自の3次元アルゴリズムシステムを開発し、マッピングやポジショニングなどのコア技術モジュールで多くのブレークスルーを達成したことを紹介しました。今年は、彼らの論文の多くがトップカンファレンスに選ばれました。例えば、Quadtree Attention for Vision Transformerは、視覚タスクに基づいてTransformerモデルのパフォーマンスを向上させる四分木アテンションメカニズムを提案し、トップディープラーニングカンファレンスICLR 2022に選出されました。Neural Window Fully-connected CRFs for Monocular Depth Estimationは、コンシューマーグレードのパノラマカメラを使用して深度推定タスクを完了できる単一カメラ深度推定アルゴリズムを提案し、3次元マッピングのコストを大幅に削減しました。この論文はCVPR 2022に採択されました。 杭州文山街にあるDAMOアカデミーのXRラボが開発した「ARチェックイン」プロジェクト XRラボはDAMOアカデミーが新たに設立した研究所で、次世代のインターネット技術の研究に特化しています。チームが開発したARおよびVR技術は、越境電子商取引やデジタル都市エリアなど、さまざまなシナリオに応用されています。たとえば、杭州文山デジタルライフブロックに1:1復元された3次元「デジタルツイン」が構築され、杭州オリンピックスポーツセンターの10万平方メートルの地下駐車場にARナビゲーションサービスが開発されました。 |
>>: 人工知能のおかげで、赤信号待ちは過去のものになるだろう
01 空間表現深遠な機械学習理論を学ぶ前に、まず機械学習の最も基本的な概念のいくつかを紹介しましょ...
CNN 開発の初期には、脳のニューラル ネットワークから多くのインスピレーションを得ました。現在では...
新型コロナウイルスの感染力が高いため、防疫期間中、一般の人々は、インテリジェント消毒ロボットが医療産...
ほとんどのディープラーニング モデルは Linux システムでトレーニングされていますが、Windo...
近年、AI による絵画のレベルは飛躍的に向上しています。 Midjourney と Adobe ...
導入大規模言語モデルは革命的な技術であることが証明されています。大規模言語モデルの力をベースにした多...
近年、伝統的な自然科学の問題の解決においてますます多くの人工知能手法が活躍しており、いくつかの重要な...
近年、人工知能技術は飛躍的な進歩を遂げ、戦闘指揮の分野で広く応用され、観察・判断・決定・行動(OOD...
AIや5Gなどの新技術がもたらす変化により、顧客サービスシナリオは多様な変化を遂げており、兆レベル...