情報理論に基づくキャリブレーション技術により、マルチモーダル機械学習の信頼性が向上

情報理論に基づくキャリブレーション技術により、マルチモーダル機械学習の信頼性が向上

マルチモーダル機械学習は、さまざまなシナリオで目覚ましい進歩を遂げています。しかし、マルチモーダル学習モデルの信頼性については、詳細な研究が不足しています。 「情報によって不確実性が排除される」というマルチモーダル機械学習の本来の意図はこれと一致しており、追加されたモダリティによって予測の精度と信頼性を高めることができます。しかし、ICML2023で最近発表された論文「マルチモーダル学習の調整」では、現在のマルチモーダル学習方法がこの信頼性の仮定に違反していることが判明し、詳細な分析と修正が行われました。

写真


  • アルクシブ: https://arxiv.org/abs/2306.01265
  • コード GitHub: https://github.com/QingyangZhang/CML

現在のマルチモーダル分類方法は信頼性が低いという問題を抱えています。つまり、一部のモードが削除されると、モデルはより高い信頼性を生み出す可能性があり、「情報から不確実性が排除される」という情報理論の基本原則に違反しています。この問題に対処するために、本論文では、キャリブレーションマルチモーダル学習法を提案します。この方法は、さまざまなマルチモーダル学習パラダイムに展開して、マルチモーダル学習モデルの合理性と信頼性を向上させることができます。

写真

この研究は、現在のマルチモーダル学習方法には予測の信頼性が低いという問題があり、既存のマルチモーダル機械学習モデルは信頼性を推定するために部分的なモダリティに依存する傾向があることを指摘しています。特に、この研究では、特定のモードが破損すると、現在のモデル推定値の信頼性が実際に高まることがわかりました。この不合理な問題に対処するために、著者らは直感的なマルチモーダル学習原理を提案しました。つまり、モダリティが削除されると、モデル予測の信頼性は増加しないはずです。しかし、現在のモデルは、すべてのモードを公平に考慮するのではなく、一部のモードを信じる傾向があり、そのモードの影響を受けやすいです。これはモデルの堅牢性にさらに影響を及ぼします。つまり、一部のモードが破損するとモデルが簡単に影響を受けます。

上記の問題に対処するために、現在のいくつかの方法では、温度スケーリングやベイズ学習法などの既存の不確実性校正方法を採用しています。これらの方法は、従来のトレーニング/推論アプローチよりも正確な信頼性の推定を構築できます。しかし、これらの方法は、最終的な融合結果の信頼度推定値を精度と一致させるだけであり、モーダル情報量と信頼度の関係を明示的に考慮していないため、マルチモーダル学習モデルの信頼性を根本的に向上させることはできません。

著者らは、「Calibration Multimodal Learning (CML)」と呼ばれる新しい正規化手法を提案しました。この手法では、予測の信頼性と情報量の間の一貫性を実現するために、モデルが予測の信頼性を情報量と一致させるように強制するペナルティ項を追加します。この手法は、モダリティを削除すると予測の信頼性が低下する(または少なくとも増加しない)という自然な直感に基づいており、信頼性のキャリブレーションを本質的に改善することができます。具体的には、1 つのモダリティが削除されたときに予測の信頼性が増加するサンプルにペナルティを追加することで、モデルに直感的な順序関係を学習させる単純な正規化項が提案されています。

上記の制約は正規化された損失であり、モーダル情報除去の信頼性が高まった場合のペナルティとして機能します。

実験結果は、CML 正則化によって既存のマルチモーダル学習方法の予測信頼性が大幅に向上することを示しています。さらに、CML は分類精度を向上させ、モデルの堅牢性を高めることができます。

マルチモーダル機械学習はさまざまなシナリオで目覚ましい進歩を遂げていますが、マルチモーダル機械学習モデルの信頼性は依然として対処が必要な問題です。この論文では、広範な実証的研究を通じて、現在のマルチモーダル分類法は予測の信頼性が低く、情報理論の原則に違反していることが判明しました。この問題に対処するため、研究者らは CML 正則化手法を提案しました。この手法は既存のモデルに柔軟に導入でき、信頼性の調整、分類精度、モデルの堅牢性の点でパフォーマンスを向上させることができます。この新しい技術は、将来のマルチモーダル学習において重要な役割を果たし、機械学習の信頼性と実用性を向上させると信じています。

<<:  トヨタ・リサーチ・インスティテュート、AIを活用した自動車設計ツールを発表

>>:  ChatGPT「おばあちゃんの抜け穴」がまた人気です!亡くなった祖母のふりをして、寝る前に物語を語り、Win11 のシリアル番号をだます

ブログ    
ブログ    

推薦する

ビッグモデルの「錯覚」、この記事を読んでください

ビッグモデルの「幻想」がついに体系的にレビューされました! 49 ページの記事では、幻覚の定義、分類...

災害後、ウェイモブは独自のデータベースの構築を断念し、商人に1億5000万元を支払った。

[[316623]] 【51CTOオリジナル記事】先週、WeMallは大規模なシステム障害に見舞わ...

分散ストレージシステムのデータ分散アルゴリズムを簡単に見てみましょう。

序文分散ストレージ システムが直面する主な問題は、大量のデータを異なるストレージ ノードに分散する方...

1日1,000個以上の星を生成したテスラのAIディレクターがGPT Pytorchトレーニングライブラリを作成した

GPT モデルが無敵の戦艦だとすると、minGPT はおそらく風や波に乗れる小型ヨットでしょう。最近...

...

中国電子科技大学の博士号取得者は、2年でネイチャーとサイエンスに論文を発表して有名になった。

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

...

人工知能がコロナウイルスを終わらせる

人工知能と新型コロナウイルスには共通点がないように思えますが、本質的には同じものです。 [[4391...

...

DALL·E 3のベンチマーク!メタ最強の文豪エミュの技術レポートを公開

数日前、OpenAIはDALL·E 3をリリースしたばかりで、ビジュアルイメージは再び新たな段階に上...

人工知能が製造業のデジタル変革を推進

製造業における人工知能がデジタル変革を推進製造業における人工知能はデジタル変革を可能にし、より効果的...

...

オンライン学習の次の波: 現代の学習システムにおける人工知能

[[375015]]世界的な流行により、ほぼすべての大学が授業をオンライン学習プラットフォームに移行...

無料の Python 機械学習コース パート 2: 多重線形回帰

Python で任意の数の変数に対する多重線形回帰をゼロから開発する方法を学びます。線形回帰はおそら...

公共の安全とスマートシティ:AIがどのように役立つか

近年、人工知能の進歩により、私たちのコミュニティの安全性は大幅に向上しました。この技術は、緊急管理者...