大規模なカーネル畳み込みを3つのステップに分割し、清華大学の胡世民氏のチームの新しいビジュアルバックボーンが3つの主要なタスクでリストのトップに立った。

大規模なカーネル畳み込みを3つのステップに分割し、清華大学の胡世民氏のチームの新しいビジュアルバックボーンが3つの主要なタスクでリストのトップに立った。

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

視覚タスクでは、CNN と ViT にはそれぞれ長所と短所があります。

そのため、古典的なバックボーンを基礎として、詳細に相互に学習することが、最近注目されている研究方向になっています。

以前、Microsoft のSwinTransformer はCNN のスライディング ウィンドウなどの機能を導入し、ダウンストリーム タスクのリストでトップになり、Marr Prize を受賞しました。

その後、Meta AI のConvNeXT はViT の多くの技術を使用して ResNet を修正し、そのパフォーマンスを上回りました。

現在、新たなバックボーンであるVAN (Visual Attention Network) が再び学界の注目を集めています。

なぜなら、この新モデルは、上記の 2 つを上回り、 3 つの主要な視覚タスクのリストで再びトップになったからです。

VAN は CNN と ViT の両方の利点を取り入れ、シンプルで効率的であり、精度が高く、パラメーターと計算の数が少ないと主張しています。

VAN は、清華大学の Hu Shimin 氏が率いるチームによるものです。彼らは、標準的な大規模カーネル畳み込みを 3 つの部分に分解できると提案しました。

深さ方向畳み込み (DW-Conv)、深さ方向膨張畳み込み (DW-D-Conv)、および 1 × 1 畳み込み (1 × 1 Conv)。

さらに重要なのは、要素ごとの乗算ステップを追加することで、アテンションのような効果を実現できることです。チームは新しい畳み込みモジュールをLarge Kernel Attention (LKA ) と名付けました。

また、論文の最後には、現在の VAN は、慎重に磨き上げられていない、直感的な未加工バージョンに過ぎず、将来的に改善される可能性がまだ大きいことも述べられています。

(コードはオープンソースで、アドレスは記事の最後にあります)

大きなカーネル畳み込みを分解すると注目度を計算できる

注意メカニズムは、入力に基づいて主要な特徴を識別し、ノイズを自動的に無視できる適応型選択プロセスとして理解できます。

重要なステップは、入力データの長期的な依存関係を学習し、注意マップを生成することです。

注意マップを生成する一般的な方法は 2 つあります。

1 つ目は NLP の自己注意メカニズムですが、視覚に使用する場合はまだいくつかの欠点があります。たとえば、画像を 1 次元シーケンスに変換すると、その 2 次元構造は無視されます。

2 つ目は視覚的な大規模カーネル畳み込み法ですが、計算オーバーヘッドが大きすぎます。

上記の問題を克服するために、研究チームは大規模なカーネル畳み込みを 3 つの部分に分解する LKA 法を提案しました。

拡張間隔がdであると仮定すると、 K x K畳み込みは、 K/dx K/d 深さ拡張畳み込み、 (2d − 1) × (2d − 1) 深さ方向畳み込みカーネル、および 1 x 1 ポイント方向畳み込みに分解できます。

△cはチャネル

このようにして、計算オーバーヘッドを節約しながら長距離の依存関係をキャプチャし、さらに注意マップを生成することができます。

LKA メソッドは、畳み込みと自己注意の利点を組み合わせるだけでなく、チャネル適応性も獲得します。

CNN では、LKA 方式はMobileNetの 2 部分解方式に似ており、深度拡張畳み込みの増加により長距離の依存関係を捉えることができます。

ViT と比較すると、高解像度画像の場合、自己注意の二次複雑度の計算コストが高すぎるという問題を解決します。

MLP アーキテクチャのgMLPもアテンション メカニズムを導入していますが、固定解像度の画像のみを処理でき、画像のローカル構造を無視してグローバルな特徴のみに焦点を当てています。

理論的には、LKA 方式はすべての当事者の利点を組み合わせ、上記の欠点を克服します。

では、実際の効果はどうでしょうか?

新しいバックボーンランキングの3つの主要タスク

LKA 方式に従って設計された新しいバックボーン ネットワーク VAN は、従来の 4 段階設計を継承しており、具体的な構成は次のとおりです。

各ステージの構造は図に示されています。ダウンサンプリング レートはステップ サイズによって制御され、CFF は畳み込みフィードフォワード ネットワークを表します。

入力と出力の幅、高さ、チャネル数が等しいと仮定すると、計算の複雑さを計算できます。

畳み込みカーネルサイズ(K)が21の場合、パラメータ数を最小化するために拡張間隔(d)は3となり、これがデフォルト設定として使用されます。

チームは、この構成がグローバルな特徴とローカルな特徴の両方を抽出するのに理想的であると考えています。

最後に、ImageNet 上のさまざまなスケールの VAN の精度は、さまざまな CNN、ViT、MLP の精度を上回りました。

COCO 2017の物体検出タスクでも、VANをバックボーンとした複数の検出手法がリードしています。

ADE20K セマンティックセグメンテーションタスクでも同様です。

そして、前述の通り、VAN は、入念な磨きをかけなくても、すでに 3 つの主要タスクをクリアしており、今後も改善の余地が残っています。

今後の改善については、チームはより大きな畳み込みカーネルを試したり、Res2Net のマルチスケール構造や Inception のマルチブランチ構造を導入したりする可能性があると述べた。

さらに、画像の自己教師学習や転移学習における VAN の使用、さらには NLP に使用できるかどうかについても、さらに調査が必要です。

著者について

この論文は、清華大学コンピュータサイエンス学部のHu Shimin 氏のチームによるものです。

胡世民教授は、清華大学の JiTu フレームワーク チームの責任者です。JiTu フレームワークは、中国の大学がオープンソース化した最初のディープラーニング フレームワークです。

第一著者である博士課程の学生 Guo Menghao 氏は現在、清華大学のコンピュータサイエンス学部で学んでおり、JiTu チームのメンバーでもあります。

この論文のコードはオープンソース化されており、Pytorch バージョンとグラフ フレームワーク バージョンの 2 つのバージョンが提供されています。

研究チームは以前、視覚的注意に関するレビューを発表しており、arXivでヒットとなった。

付随する GitHub リポジトリ Awesome-Vision-Attentions (視覚的注意に関する論文のコレクション) にも 1.2k 個のスターが付いています。

最後に、ちょっとした噂ですが、チームはさまざまな視覚的注意のメカニズムを研究した後に、この新しいアイデアを思いついたのでしょうか?

それも666です。

論文の宛先:
https://arxiv.org/abs/2202.09741

GitHub アドレス:
https://github.com/Visual-Attention-Network

<<:  Baidu の計算生物学研究が Nature のサブジャーナルに掲載されました!スタンフォード大学やMITを上回る成果、製薬分野に進出

>>:  自動運転開発ツールチェーンの現状と動向を20,000語で解説

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

合成データは AI をより良くすることができるでしょうか?

人工知能 (AI) は指数関数的な成長によりさらに進歩していますが、この最新技術には依然として限界が...

人工知能教育の時代が到来。AIは何ができるのか?

[[265994]]最近、国際人工知能教育会議、第3回世界知能会議が相次いで開催され、さまざまなA...

通信産業の発展を後押しし、2つの主要ドローンの価値が強調される

最近、わが国の科学技術分野は新たな躍進を遂げました。ドローンによる「橋渡し」の力を借りて、量子ネット...

自動化された機械学習: よく使われる 5 つの AutoML フレームワークの紹介

AutoML フレームワークによって実行されるタスクは、次のように要約できます。データを前処理して...

Kaggle で競争する方法、全プロセスを解説

導入Kaggle は機械学習のコンペティションで最も有名なウェブサイトです。 Kaggle コンテス...

AI開発と倫理におけるリアリズムの役割

人工知能(AI)は、最初のコンピュータが発明されて以来、長い道のりを歩んできました。今日、人工知能は...

人工知能関連のキャリアと給与に関する 7 つの統計

現在、人手不足で高収入の AI 職種は何でしょうか? 需要が高い職種はどれでしょうか? AI はどれ...

今年のノーベル賞はアルトゥール・エケルト氏が受賞すると見られている。百度研究所の科学者の力を過小評価すべきではない。

2019年のノーベル賞受賞者のリストは、今年10月7日から発表されます。発表日が近づくにつれ、学界...

無料の AI ベスト論文検索ツール: ワンクリックで結果を表示し、数分で論文の表とデータを抽出

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

採血時に血管が見つからない?人工知能には解決策がある

[[318810]]ビッグデータダイジェスト制作出典: rutgers.edu編纂者:張大毓如、夏亜...

AI製品化の鍵はアルゴリズムではなくインフラとデータ

[[187402]]人工知能は現在、魔法のような大流行を経験しています。データは、数字の羅列としてニ...

AIとセキュリティ:繋がる双子

人工知能とセキュリティは、非常に重要かつ興味深い2つの分野です。それぞれの空間について書かれた本はあ...

金融AIの実装は難しいですか?ガートナー: AI のユースケースを 3 倍にするには 4 つのステップが必要

金融分野で AI を適切に導入するには、単に時間や資金を最も多く投資すればよいという問題ではありませ...

人工知能が「骨董品鑑定」の分野に参入、人間の職業に再び影響が及ぶか?

データの「食料」が増え続け、入手が容易になるにつれ、現在の人工知能は機械学習、言語処理、対話機能にお...

...