マルチモーダルディープラーニング:ディープラーニングを用いてさまざまな情報を統合する

マルチモーダルディープラーニング:ディープラーニングを用いてさまざまな情報を統合する

ディープラーニングを使用して、さまざまなソースからの情報を統合します。

マルチモーダルデータ

私たちの世界に対する経験はマルチモーダルです。つまり、私たちは物を見て、音を聞き、質感を感じ、香りを嗅ぎ、味を味わいます。モダリティとは、何かが起こる方法や経験される方法を指し、研究課題が複数のモダリティを包含する場合、それはマルチモーダルとして特徴付けられます。 AI が私たちの周囲の世界を理解する上で進歩を遂げるためには、これらのマルチモーダル信号を同時に解釈できる必要があります。

たとえば、画像はラベルやテキストによる説明と関連付けられることが多く、テキストには記事の中心的なアイデアをより明確に表現するための画像が含まれます。モードによって統計特性が大きく異なります。

マルチモーダルディープラーニング

異なるモダリティや情報タイプを組み合わせて効果を高めることは直感的には魅力的な作業ですが、実際には、異なるノイズ レベルやモダリティ間の競合をどのように組み合わせるかが課題となります。さらに、モデルは予測結果に異なる定量的な影響を及ぼします。実際に最も一般的なアプローチは、異なる入力の高レベルの埋め込みを連結し、ソフトマックスを適用することです。

異なるタイプのニューラル ネットワークを使用して特徴を抽出するマルチモーダル ディープラーニングの例。

このアプローチの問題点は、すべてのサブネットワーク/パターンに同等の重要性を与えることですが、これは現実のシナリオではほとんど起こりません。

すべてのモードが予測に等しく貢献する

ネットワークの重み付け組み合わせ

各入力モダリティが出力予測に対して学習された貢献 (Theta) を行えるように、サブネットワークの加重組み合わせを採用しています。

最適化の問題は次のようになります。

各サブネットワークに Theta 重みを与えた後の損失関数。

サブネットワークに重みを付けた後の出力を予測します。

全部使ってください!

正確性と解釈可能性

私たちは、2 つの現実世界のマルチモーダル データセットで SOTA を達成しました。

マルチモーダル感情強度コーパス (MOSI) データセット - 1 ミリ秒ごとに音声特徴が注釈付けされた 417 本の注釈付きビデオ。注釈付きのデータ ポイントは合計 2199 個あり、感情の強さは -3 から +3 までの線形スケールを使用して、非常に否定的から非常に肯定的まで定義されます。

モードには次のものがあります:

1. テキスト

2. オーディオ

3. 言語

各モダリティの感情予測への貢献

転写開始部位予測 (TSS) データセット - 転写は遺伝子発現の最初のステップであり、特定の DNA セグメントが RNA (mRNA) にコピーされます。転写開始部位は転写が始まる場所です。 DNA 断片のさまざまな部分には、その存在に影響を与えるさまざまな特性があります。 TSS は 3 つの部分に分かれています。

  1. 上流DNA
  2. 下流DNA
  3. TSS の場所

これまでの最先端の結果と比べて 3% という前例のない改善を達成しました。 TATA ボックスの下流の DNA 領域がこのプロセスに最も大きな影響を与えます。

<<:  国際数学オリンピック連続優勝、基礎学問の科学技術戦略価値の分析

>>:  人工知能が詩を書きました。この詩の知的財産権は誰が所有しているのでしょうか?

ブログ    
ブログ    

推薦する

優れたオープンソース音声認識エンジン13選

自動音声認識 (ASR) は、人間とコンピュータの相互作用において重要な役割を果たし、転写、翻訳、デ...

畳み込みニューラル ネットワークの設計を始めたいですか?これは包括的なデザインガイドです

画像分類を始めたいが、どこから始めればよいか分からない。どの事前トレーニング済みネットワークを使用す...

マイクロソフトは、人間と同じようにニュースを翻訳できるAIの画期的な進歩を主張している

米国現地時間3月14日、マイクロソフトの研究者らは、人間と同等の精度でテキストを翻訳できる人工知能を...

スパイラルはリアルタイムの機械学習を使用してFacebookのサービスを自動調整します

[51CTO.com クイック翻訳] Facebook を利用する何十億もの人々にとって、私たちのサ...

...

不動産業界における人工知能のメリットトップ10

人工知能 (AI) は不動産業界に革命をもたらし、データ分析の強化から顧客体験の向上まで、さまざまな...

...

新世代のJVMガベージコレクションアルゴリズムがリリースされました

新世代の JVM ガベージ コレクション アルゴリズムをご存知ですか? ここで皆さんにご紹介しましょ...

AISpeechは多角的な視点からAIエコロジカルバリアを構築し、AIチップはラストマイルを切り開く

最近、シビチェンがチップスを製造しているというニュースが大きな騒ぎを引き起こしました。 [[2547...

...

企業向け人工知能アプリケーション開発ガイド

AI アプリケーション開発プロセスを詳しく調べ始める場合、まずこれらのプロジェクトが通常のアプリケー...

...

機械学習の第一歩、ランダムフォレストのステップバイステップの入門書です

2020 年には、すでに多くの楽しい機械学習チュートリアルが見つかります。この記事では、最も人気のあ...

中国の自動運転分類の国家基準が正式に発表され、来年3月に施行される予定

自動車の電動化や知能化が進む中、自動運転は人々の日常生活にますます近づきつつあります。現在、市場に出...

25倍のパフォーマンス向上: RustはCとC++に取って代わり、機械学習のPythonバックエンドとして好まれるようになると期待されています。

機械学習開発の分野では、全体像を見て細かい詳細をすべて取り除くと、機械学習開発における不変の 2 つ...