ICLR 2022: AI が「目に見えないもの」を認識する方法

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

今回、領域外物体検出の分野で新しいモデルVOSが発表されました。協力チームはウィスコンシン大学マディソン校で、論文はICLR 2022に掲載されています。

このモデルは、ターゲット検出と画像分類の両方で最高のパフォーマンスを達成し、FPR95 インデックスは以前の最高結果よりも 7.87% 低くなっています。

ディープネットワークにとって、未知の状況に対処することは常に難しい問題であったことを知っておくことは重要です。

たとえば、自動運転では、既知の物体（車、一時停止標識など）を認識する検出モデルが、馬をシマウマと間違えて、領域外（OOD）物体について高い信頼度の予測を行うことがよくあります。

たとえば、下の写真のヘラジカは、Faster-RCNN モデルによって 89% の信頼度で歩行者として識別されました。

したがって、ドメイン外オブジェクトの検出は、間違いなく AI セキュリティにおける非常に重要なトピックとなっています。

このモデルがドメイン外のオブジェクトについてどのように判断するかを見てみましょう。

VOSがドメイン外オブジェクトを検出する方法

VOS を理解する前に、ドメイン外オブジェクトの検出が難しい理由について説明する必要があります。

実際、それは理解しやすいことです。結局のところ、ニューラルネットワークはトレーニングとテスト中にデータを学習するだけで、これまで見たことのないものに遭遇したときには当然それを認識することはないのです。

この問題を解決するには、ネットワークに「未知の」ものを認識させる方法を見つける必要があります。これについてどうすればいいでしょうか?

VOS が考え出した解決策は、モデルが学習するためのドメイン外のオブジェクトをシミュレートすることです。

たとえば、下の図の検出状況では、3 つの灰色の点がターゲットです。領域外のオブジェクトがシミュレートされていない場合(左) 、モデルは広い領域内でのみターゲットを囲むことができます。

シミュレートされたドメイン外オブジェクト(右)を使用してトレーニングした後、モデルはターゲットをコンパクトかつ正確にロックし、より合理的な決定境界を形成できます。

ターゲットがより正確にロックされると、この範囲外の他のオブジェクトはドメイン外オブジェクトとして判断できます。

この考えに基づいて、VOS チームは次のフレームワークを構築しました。

Faster-RCNN ネットワークに基づいて、シミュレートされたドメイン外オブジェクトのデータの一部が分類ヘッドに追加され、トレーニングセットのデータと組み合わせられ、標準化された不確実性損失関数が共同で構築されます。

これらのシミュレートされたドメイン外オブジェクトのデータはどこから来るのでしょうか?構造図を見ると、これらの点はすべて、可能性の低い領域であるターゲット領域(青い点、黄色の四角い点、緑の三角の点) の周囲からのものであることがわかります。

最後に、信頼度の計算に基づいて、青はターゲット検出データを表し、緑はドメイン外のオブジェクトを表します。

このようにして、画像内の車とヘラジカを識別できます。

他の多くの領域外オブジェクト検出方法と比較すると、VOS の利点がわかります。

各指標において、下向き矢印はデータが小さいほど良いことを意味し、逆に下向き矢印はデータが大きいほど良いことを意味します。

その中で最も有名なのは FPR95 で、OOD サンプルの分類精度が 95% の場合に OOD サンプルが ID サンプルに誤分類される確率を表します。

この結果は、これまでの最高結果から 7.87% 低下したものです。

他の既存の方法と比較しても、VOS には利点があります。

一般的な学習フレームワークとして、オブジェクト検出と画像分類の両方のタスクに適用できます。これまでの方法は主に画像分類によって行われていました。

このモデルは現在、GitHub でオープンソース化されています。

著者について

このモデルは主にDu Xuefeng、Cai Muらによって提案されました。

Du Xuefeng 氏は西安交通大学で学士号を取得し、現在はウィスコンシン大学マディソン校でコンピューターサイエンスの博士号取得を目指しています。

主な研究方向は、ドメイン外オブジェクトの検出、敵対的堅牢性、ノイズラベル学習などを含む信頼できる機械学習です。

蔡穆氏も西安交通大学を卒業し、学士号を取得しており、現在はウィスコンシン大学マディソン校でコンピューターサイエンスの博士課程2年目に在籍しています。

彼の研究の関心は、ディープラーニング、コンピュータービジョン、特に 3D シーン理解(ポイントクラウド検出)と自己教師あり学習に焦点を当てています。

この論文の責任著者は、現在ウィスコンシン大学マディソン校のコンピューターサイエンスの助教授であり、以前はFacebook AIの研究員であったSharon Yixuan Li氏です。

<<: ICLRは深層生成モデルに関する大きな議論を開催し、ウェリングとAAAIの百万ドル賞受賞者が来場する。

>>: 機械学習の錬金術の理論的根拠はどれほど強固なのでしょうか?

BAIRは、3種類のモデルフリー強化学習アルゴリズムを組み合わせたRLコードライブラリrlpytをオープンソース化しました。

ブログ

ICLR 2022: AI が「目に見えないもの」を認識する方法

VOSがドメイン外オブジェクトを検出する方法

著者について

BAIRは、3種類のモデルフリー強化学習アルゴリズムを組み合わせたRLコードライブラリrlpytをオープンソース化しました。

Giskard: AI モデル向けのオープンソース品質管理

ICCV 2023 | DetZero: Waymo 3D Detection Challengeで第1位、オフラインラベリングのパフォーマンスは手動アノテーションに匹敵します!

Nature の論文が xAI の目標を検証、人間の認知 AI が宇宙の本質を探る、マスク氏: 黙ってろ、金やるぞ!

すべてのピクセルに教師なしラベル付け！ 1時間のビデオに800時間を費やす必要はもうありません

エッジコンピューティングが企業のコスト削減と効率向上にどのように役立つか

GPT-4 MATHの精度は84.3%まで上昇しました！香港中文大学や清華大学を含むトップ7大学が新たなCSV方式を提案

2020 年の国内トップ 10 の人工知能イベントのレビュー: 政策と規制、技術的成果、産業への応用などを網羅。

推薦する

機械学習、ディープラーニング、強化学習の関係と違いは何ですか?

T1000が実現：我が国は液体金属駆動ロボットを開発中

シングルを保存: このオブジェクトジェネレーターは、将来のオブジェクトがどのように見えるかを確認するのに役立ちます

人工知能産業の急速な発展により、2021年以降、人工知能セキュリティの市場スペースは巨大になるでしょう。

人工知能による空中戦闘の時代が到来し、エースパイロットは職を失うことになるのだろうか？

人工知能はどれくらい怖いのでしょうか？アメリカはAI兵器を開発し、イランの科学者は死亡した

C++ の巨匠、ジョン・カーマック氏: 心配しないでください、私は汎用 AI に取り組むつもりです!

AIへの幻滅？ AIの発展を妨げる8つのトレンド

AIはCOVID-19検査の欠陥を明らかにし、647のAIツールが臨床使用に適していないことが研究で判明

OpenAIの創設者サム・アルトマンが解雇されてから24時間後

LLaMA 2 エンドツーエンド推論が利用可能になりました。中国チームより

パフォーマンスが最大120倍向上！ Didiのインターンは、自動構造化分岐削減および圧縮アルゴリズムフレームワークを提案した。

囲碁をプレイするのはとても簡単です。AlphaZero は量子コンピューティングをプレイし始めます!