Yan Shuicheng氏は、Transformerのパワーがそのアーキテクチャから生まれることを証明する「恥ずかしいほどシンプルな」モデルを公開した。

[[436637]]

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

トランスフォーマーはビジョンにおいて大きな成功を収め、その主要な派生型は頻繁にチャートのトップにランクインしています。最も強いのはどれでしょうか?

初期の頃は、注意メカニズムが最も大きな貢献をしたと考えられており、注意モジュールに多くの改良が加えられました。

その後の研究では、注意を空間 MLPに置き換えることもうまく機能し、フーリエ変換モジュールを使用してもパフォーマンスの 97% を維持できることがわかりました。

論争の真っ只中、ヤン・シュイチェン氏のチームによる最新の論文は、異なる見解を示している。

実際、これらの特定のモジュールは重要ではありません。Transformer の成功は、全体的なアーキテクチャによるものです。

彼らは、Transformer の attention モジュールを単純な空間プーリング演算子に置き換え、新しいモデルをPoolFormerと名付けました。

ここでの元の発言は非常に興味深いです。「恥ずかしいほど単純です」...

テスト結果では、PoolFormer は ImageNet-1K で82.1% のトップ 1 精度を達成しました。

(PyTorch バージョンのコードは論文とともに GitHub で公開されており、アドレスはこのツイートの最後で入手できます。)

同じパラメータサイズの場合、単純なプーリングモデルは、アテンション (DeiT など) または MLP モジュール (ResMLP など) を使用した適切に調整されたモデルよりも優れています。

この結果を見て、見ていた CV ユーザーの中にはびっくりする人もいました。

とても興味があるのですが、モデルが恥ずかしくなるにはどれくらいシンプルである必要があるのでしょうか?

プールフォーマー

全体的な構造は他のモデルと似ていますが、PoolFormer ではトークンミキサー部分のみが変更されています。

主な目的は視覚タスクの検証であるため、入力データの形式はチャネルファーストであると想定し、プーリング演算子は次のように記述されます。

PyTorch スタイルの疑似コードはおそらく次のようになります。

プーリング演算子の複雑さは、自己注意や空間 MLP よりも小さく、処理されるシーケンスの長さに線形に関係します。

学習可能なパラメータがないため、従来の CNN と同様の段階的なアプローチを使用してパフォーマンスを最大限に活用できます。このモデルは4 つのステージに分かれています。

合計で L 個の PoolFormer ブロックがあると仮定すると、4 つのステージは L/6、L/6、L/2、および L/6 として割り当てられます。

各ステージの具体的なパラメータは次のとおりです。

PoolFormer の基本を紹介したので、他のモデルとパフォーマンスを比較してみましょう。

1 つ目は画像分類タスクです。比較モデルは 3 つのカテゴリに分かれています。

CNN モデル ResNet と RegNetY
注意モジュールを使用した ViT、DeiT、PVT
MLP-Mixer、ResMLP、Swin-Mixer、および空間MLPを使用したgMLP

ImageNet-1K では、PoolFormer は累積乗算加算演算 (MAC) とパラメータサイズの両方において、同様のサイズの他のモデルよりも優れています。

COCO データセットは、ターゲット検出とインスタンスセグメンテーションのタスクに使用されました。両方のタスクにおいて、PoolFormer はより少ないパラメータで ResNet よりも高いパフォーマンスを達成しました。

△ターゲット検出

△インスタンスセグメンテーション

最後に、ADE20Kセマンティックセグメンテーションタスクでは、PoolFormer は ResNet、ResNeXt、PVT よりも優れたパフォーマンスを発揮しました。

アブレーション実験

上記のように、PoolFormer はいくつかの主要な視覚タスクで競争力のある結果を達成しました。

しかし、これは本論文の冒頭で述べた点を裏付けるには不十分です。

全体的なアーキテクチャは重要ですか?それとも、PoolFormer のプーリングモジュールは、シンプルだが効果的なトークンミキサーなのでしょうか?

チームの検証方法は、プーリングモジュールをアイデンティティマッピングに直接置き換えることです。

結果は驚くべきもので、置換後、ImageNet-1K では 74.3% の Top-1 精度が維持されました。

これを踏まえると、プーリングカーネルのサイズ、正規化方法、および活性化関数を変更してもほとんど影響はありません。

最も重要なのは、4 つのステージで注意や空間完全接続層などのメカニズムを混合しても、パフォーマンスに大きな影響を与えないことです。

特に、最初の 2 つのステージでのプーリングと最後の 2 つのステージでの注意の組み合わせが優れたパフォーマンスを発揮することが観察されています。

この構成では、スケールをわずかに増やすだけで 81% の精度を達成できます。比較すると、ResMLP-B24 モデルでは、同じパフォーマンスを実現するために、パラメータースケールを 7 倍、累積乗算と加算を 8.5 倍必要とします。

最後に、アブレーション実験の結果は、Transformer のトークンミキサー部分に関しては、使用される特定の方法は重要ではないことを示しています。

モデルのサイズを大きくせずにパフォーマンスを向上させるには、ネットワークの全体的な構造が最も重要です。

この全体的な構造はチームによって改良され、 MetaFormerと名付けられました。

NLP でもそれは当てはまるでしょうか?

この研究は、ヤン・シュイチェン氏が率いるSea AI Labとシンガポール国立大学のメンバーによって実施された。

[[436639]]

△ ヤン・シュイチェン

論文の最後で、研究チームは次の研究の方向性として、自己教師学習や転移学習など、より多くのシナリオで検証を続けることを挙げた。

視覚的なタスクに加えて、結論が NLP タスクにも有効かどうかを確認する必要があります。

この論文を発表するもう一つの目的があります。

私たちは、特定のモジュールを磨くことに多くのエネルギーを費やすのではなく、モデルの基本構造を最適化することに研究を集中するよう皆様に呼びかけます。

論文の宛先:
https://arxiv.org/abs/2111.11418

GitHub リポジトリ:
https://github.com/sail-sg/poolformer

<<: Googleの華博士がICCV2021で新モデルを発表、卵を泡立てるだけでパンケーキを作りたいかどうかがわかる

>>: AIと拡張現実が職場でどのように進化しているか

ブログ

ブログ

GTA6のトレーラーは1億回以上再生されており、3人のAI巨人も数秒でGTAギャングに変身できる

ブログ

NSAが設計した暗号化アルゴリズムは停止された

ブログ

Yan Shuicheng氏は、Transformerのパワーがそのアーキテクチャから生まれることを証明する「恥ずかしいほどシンプルな」モデルを公開した。

プールフォーマー

アブレーション実験

NLP でもそれは当てはまるでしょうか?

人工知能と宝くじの出会いは実は詐欺から始まった？

オタクのためのオープンソースドローンプロジェクト4つ

このアリは写真を撮ることができます！プリンストン大学は、50万分の1の大きさに縮小されたミクロンレベルのカメラを開発した。

コンピュータービジョン技術によって変革が期待できる3つの業界

GTA6のトレーラーは1億回以上再生されており、3人のAI巨人も数秒でGTAギャングに変身できる

NSAが設計した暗号化アルゴリズムは停止された

推薦する

人工知能は242万件の医療記録の分析を支援した

あなたの AI モデルにはどのようなセキュリティ上の問題がありますか? AI 攻撃と防御の「辞書」ですべて見つけることができます

GPT-4P がマルチモーダルプロンプトインジェクションイメージ攻撃に対して脆弱なのはなぜですか?

ボストン・ダイナミクスのロボット犬はまもなく腕が生え、走って充電できるようになる

表の数学的推論の正解率は98.78%です！ UCLA が新しい「カメレオン推論フレームワーク」を発表

LLaMA の微調整によりビデオメモリの要件が半分に削減され、清華大学は 4 ビットの最適化を提案

ネットワークにおける機械学習の実際の応用

OpenAIの仮説が覆される！計算量を考慮すると、小さいモデルの方が大きいモデルよりも優れています。Llama 2 のトレーニングは GPU コンピューティングに関連しています。

チャットボットのテスト: フレームワーク、ツール、テクニックの詳細

マイクロソフト、中小企業向けにCopilot AIアシスタントを導入、個人向けにプレミアムサービスを開始