情報理論に基づくキャリブレーション技術により、マルチモーダル機械学習の信頼性が向上

情報理論に基づくキャリブレーション技術により、マルチモーダル機械学習の信頼性が向上

マルチモーダル機械学習は、さまざまなシナリオで目覚ましい進歩を遂げています。しかし、マルチモーダル学習モデルの信頼性については、詳細な研究が不足しています。 「情報によって不確実性が排除される」というマルチモーダル機械学習の本来の意図はこれと一致しており、追加されたモダリティによって予測の精度と信頼性を高めることができます。しかし、ICML2023で最近発表された論文「マルチモーダル学習の調整」では、現在のマルチモーダル学習方法がこの信頼性の仮定に違反していることが判明し、詳細な分析と修正が行われました。

写真


  • アルクシブ: https://arxiv.org/abs/2306.01265
  • コード GitHub: https://github.com/QingyangZhang/CML

現在のマルチモーダル分類方法は信頼性が低いという問題を抱えています。つまり、一部のモードが削除されると、モデルはより高い信頼性を生み出す可能性があり、「情報から不確実性が排除される」という情報理論の基本原則に違反しています。この問題に対処するために、本論文では、キャリブレーションマルチモーダル学習法を提案します。この方法は、さまざまなマルチモーダル学習パラダイムに展開して、マルチモーダル学習モデルの合理性と信頼性を向上させることができます。

写真

この研究は、現在のマルチモーダル学習方法には予測の信頼性が低いという問題があり、既存のマルチモーダル機械学習モデルは信頼性を推定するために部分的なモダリティに依存する傾向があることを指摘しています。特に、この研究では、特定のモードが破損すると、現在のモデル推定値の信頼性が実際に高まることがわかりました。この不合理な問題に対処するために、著者らは直感的なマルチモーダル学習原理を提案しました。つまり、モダリティが削除されると、モデル予測の信頼性は増加しないはずです。しかし、現在のモデルは、すべてのモードを公平に考慮するのではなく、一部のモードを信じる傾向があり、そのモードの影響を受けやすいです。これはモデルの堅牢性にさらに影響を及ぼします。つまり、一部のモードが破損するとモデルが簡単に影響を受けます。

上記の問題に対処するために、現在のいくつかの方法では、温度スケーリングやベイズ学習法などの既存の不確実性校正方法を採用しています。これらの方法は、従来のトレーニング/推論アプローチよりも正確な信頼性の推定を構築できます。しかし、これらの方法は、最終的な融合結果の信頼度推定値を精度と一致させるだけであり、モーダル情報量と信頼度の関係を明示的に考慮していないため、マルチモーダル学習モデルの信頼性を根本的に向上させることはできません。

著者らは、「Calibration Multimodal Learning (CML)」と呼ばれる新しい正規化手法を提案しました。この手法では、予測の信頼性と情報量の間の一貫性を実現するために、モデルが予測の信頼性を情報量と一致させるように強制するペナルティ項を追加します。この手法は、モダリティを削除すると予測の信頼性が低下する(または少なくとも増加しない)という自然な直感に基づいており、信頼性のキャリブレーションを本質的に改善することができます。具体的には、1 つのモダリティが削除されたときに予測の信頼性が増加するサンプルにペナルティを追加することで、モデルに直感的な順序関係を学習させる単純な正規化項が提案されています。

上記の制約は正規化された損失であり、モーダル情報除去の信頼性が高まった場合のペナルティとして機能します。

実験結果は、CML 正則化によって既存のマルチモーダル学習方法の予測信頼性が大幅に向上することを示しています。さらに、CML は分類精度を向上させ、モデルの堅牢性を高めることができます。

マルチモーダル機械学習はさまざまなシナリオで目覚ましい進歩を遂げていますが、マルチモーダル機械学習モデルの信頼性は依然として対処が必要な問題です。この論文では、広範な実証的研究を通じて、現在のマルチモーダル分類法は予測の信頼性が低く、情報理論の原則に違反していることが判明しました。この問題に対処するため、研究者らは CML 正則化手法を提案しました。この手法は既存のモデルに柔軟に導入でき、信頼性の調整、分類精度、モデルの堅牢性の点でパフォーマンスを向上させることができます。この新しい技術は、将来のマルチモーダル学習において重要な役割を果たし、機械学習の信頼性と実用性を向上させると信じています。

<<:  トヨタ・リサーチ・インスティテュート、AIを活用した自動車設計ツールを発表

>>:  ChatGPT「おばあちゃんの抜け穴」がまた人気です!亡くなった祖母のふりをして、寝る前に物語を語り、Win11 のシリアル番号をだます

ブログ    

推薦する

プリンストン DeepMind は数学を使用して、LLM はランダムなオウムではないことを証明します。 「規模が大きいほど能力が強くなる」には理論的根拠がある

今日の物語の主人公は、サンジーヴ・アローラとアニルド・ゴヤルという二人の科学者です。アローラ氏はプリ...

人工知能が建設業界にもたらす変化

[[349273]] AI は情報を活用して、プロジェクトの初期段階で建築家にとって重要な決定を下し...

...

次世代の AI 人材をどう育成するか?

AI 人材とプロジェクト パイプラインを構築するには、教育的価値だけでなく技術的価値も必要です。そ...

...

マッキンゼーのパートナー、カレル・エルート氏:「3×Simpler」は産業用ロボットのユーザーエクスペリエンスを向上させます

2年前、イタリアのテノール歌手アンドレア・ボチェッリがイタリアのピサにあるヴェルディ劇場でルッカ・フ...

ブロックチェーンが人工知能に力を与える方法

現在、データはデジタル環境に残っており、共有する動機はほとんどありません。これにより、Google、...

...

配達員に代わるドローン配達は、人々に「嫌われるのではなく愛される」ようになる

現在、人々の生活や仕事のペースはますます加速し、インターネット電子商取引プラットフォームは急速に発展...

日常生活における生体認証技術の応用

デジタル時代では、ほとんどの人が生活の大部分をモバイル デバイスで過ごすため、セキュリティの必要性は...

...

茅面映画の李明輝氏:興行収入予測における機械学習の実用化

[51CTO.comより引用] 近年、わが国の興行収入市場は飛躍的に成長し、2011年には150億ド...

...