マルチモーダル学習が直面している主な課題の 1 つは、テキスト、オーディオ、ビデオなどの異種のモダリティを統合する必要があることです。マルチモーダル モデルでは、さまざまなソースからの信号を組み合わせる必要があります。ただし、これらのモダリティは特性が異なり、単一のモデルで組み合わせることは困難です。たとえば、ビデオとテキストではサンプリング レートが異なります。 最近、Google DeepMind の研究チームは、マルチモーダル モデルを複数の独立した特殊な自己回帰モデルに分離し、さまざまなモダリティの特性に応じて入力を処理しました。 具体的には、この研究ではマルチモーダルモデル Mirasol3B を提案しました。 Mirasol3B は、時間同期モダリティ (オーディオとビデオ) 用の自己回帰コンポーネントと、コンテキスト モダリティ用の自己回帰コンポーネントで構成されています。これらのモードは必ずしも時間的に揃っているわけではなく、順番に配置されています。 論文アドレス: https://arxiv.org/abs/2311.05698 Mirasol3B は、マルチモーダル ベンチマークで SOTA パフォーマンスを達成し、はるかに大規模なモデルよりも優れたパフォーマンスを発揮します。よりコンパクトな表現を学習し、オーディオビジュアル特徴表現のシーケンス長を制御し、時間的対応に基づいてモデリングすることにより、Mirasol3B はマルチモーダル入力の高い計算要件を効果的に満たすことができます。 方法の紹介Mirasol3B は、オーディオ、ビデオ、テキストのマルチモーダル モデルであり、自己回帰モデリングが、時間的に整合されたモダリティ (オーディオ、ビデオなど) 用の自己回帰コンポーネントと、時間的に整合されていないコンテキスト モダリティ (テキストなど) 用の自己回帰コンポーネントに分離されています。 Mirasol3B は、クロスアテンション重みを使用して、これらのコンポーネントの学習の進行を調整します。この分離により、モデル内のパラメータ分布がより合理的になり、モダリティ (ビデオとオーディオ) に十分な容量が割り当てられ、モデル全体が軽量化されます。 下の図 1 に示すように、Mirasol3B は主に 2 つの学習コンポーネントで構成されています。1 つはビデオ + オーディオなどの (ほぼ) 同期マルチモーダル入力を処理するように設計されており、入力を時間内に組み合わせる自己回帰コンポーネントです。 この研究では、時間的に整合されたモダリティを時間セグメントに分割し、時間セグメント内でオーディオとビデオの共同表現を学習することも提案しています。具体的には、この研究では「コンバイナー」と呼ばれるモーダル共同特徴学習メカニズムを提案しました。 「コンバイナー」は、同じ期間内のモーダル機能を組み合わせて、よりコンパクトな表現を生成します。 「コンバイナー」は、元のモーダル入力から主要な時空間表現を抽出し、ビデオの動的特性をキャプチャして、同時に存在するオーディオ機能と組み合わせます。このモデルは、さまざまなレートでマルチモーダル入力を受信でき、長いビデオを処理するときに優れたパフォーマンスを発揮します。 「コンバイナ」は、効率的かつ情報豊富なモーダル表現の要件を効果的に満たします。ビデオやその他の同時実行モダリティ内のイベントやアクティビティを完全にカバーでき、後続の自己回帰モデルで使用して長期的な依存関係を学習できます。 ビデオ信号とオーディオ信号の両方を処理し、より長いビデオ/オーディオ入力に対応するために、それらは小さな(おおよそ時間的に同期された)チャンクに分割され、コンバイナーを通じて結合されたオーディオビジュアル表現が学習されます。 2 番目のコンポーネントは、コンテキスト、つまり通常は依然として連続しているグローバル コンテキスト情報などの時間的に整列していない信号を処理します。また、自己回帰的であり、結合された潜在空間を交差注意入力として使用します。 ビデオ + オーディオ学習コンポーネントには 3B のパラメータがあり、オーディオなしのコンポーネントは 2.9B です。ほとんどのパラメータは、オーディオ + ビデオ自己回帰モデルに使用されます。 Mirasol3B は通常 128 フレームのビデオを処理しますが、より長い (例: 512 フレーム) ビデオも処理できます。 パーティションと「コンバイナ」モデル アーキテクチャの設計により、フレームを追加したり、ブロックのサイズと数を増やしたりしても、パラメータはわずかに増加するだけなので、長いビデオにはより多くのパラメータと大きなメモリが必要になるという問題が解決されます。 実験と結果この調査では、標準 VideoQA ベンチマーク、長時間ビデオ VideoQA ベンチマーク、およびオーディオ + ビデオ ベンチマークで Mirasol3B を評価しました。 VideoQA データセット MSRVTTQA のテスト結果を表 1 に示します。Mirasol3B は、現在の SOTA モデルや、PaLI-X や Flamingo などのより大規模なモデルを上回っています。 長時間のビデオ質問応答に関しては、ActivityNet-QA および NExTQA データセットで Mirasol3B をテストし、評価しました。結果を以下の表 2 に示します。 最後に、本研究では、オープン世代評価を使用したオーディオビデオベンチマークテストに、KineticsSound、VGG-Sound、Epic-Sound を選択しました。実験結果を以下の表 3 に示します。 興味のある読者は、原著論文を読んで研究内容の詳細を知ることができます。 |
>>: トランスフォーマーの簡易版がここにあります、ネットユーザー:今年の論文
あらゆるものがデータと自動化によって駆動される現代の世界では、人工知能はますます一般的になりつつあり...
2020年の世界産業用ロボット産業の現状と競争環境の分析:アジア太平洋地域が世界最大の市場に1. 世...
この記事は公開アカウント「Reading Core Technique」(ID: AI_Discov...
超AI制御により、機械が自動的に人間の胚のクローンを作成し、培養用の栄養プールに送り込み、人間のバッ...
翻訳者 | 朱 仙中校正 | 梁哲、孫淑娟K 近傍法 (KNN) は、機械学習アルゴリズムにおける回...
現在、より成熟し、広く使用されているインテリジェント テクノロジーにはどのようなものがありますか? ...
クラウドの世界を探ってみましょう。ただし、単なるクラウドではなく、未来のクラウドです。具体的には、2...
高速でメモリ効率に優れたアテンション アルゴリズム、FlashAttention がここにあります。...
この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...
著名なIT技術メディア51CTOが主催する第16回中国企業年次選考活動「IT印象:イノベーションの活...
外科用ロボット、人工知能心理学者、そして一連の「人工知能+」プロジェクト技術の統合が医療分野に急速に...
コペルニクス気候変動サービスによると、2023年は記録上最も暖かい年となっただけでなく、世界の平均表...
AlphaGoが数年前にプロの囲碁プレイヤーに勝利して以来、人工知能はメディアで最もよく使われる言...
[[435977]]現在、AI技術は急速に進歩しており、毎年多くの優れた論文が発表されています。 2...