初めて人間を超えた！「絵を読んで意味を理解する」ことに関しては、AIは人間の目よりも優れている

[[417746]]

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

AIは人間を超えるという新たな一歩を踏み出した。

最近、国際的に権威のあるマシンビジョンの質問回答リストVQA Leaderboard がデータを更新しました。

「絵を読んで意味を理解する」というタスクでは、AIの精度は81.26％に達しました。

初めて人間を超えた！「絵を読み取り、意味を理解する」ことに関しては、AI は人間の目よりも優れています | DAMO アカデミー">

ご存知のとおり、このタスクにおける私たち人間の基準値はわずか80.83%です。

この成果は、Alibaba DAMO Academy チームのAliceMind-MMUによって達成されました。

この動きは、AI が 2015 年と 2018 年にそれぞれ視覚認識とテキスト理解で人間を上回った後、マルチモーダル技術でも飛躍的な進歩を遂げたことを意味します。

この AI は画像を読み取るのがどのくらい得意ですか?

理解するには次の例を見てください。

AIに「これらのおもちゃは何に使うのですか？」と尋ねると、

小さなクマが着ているドレスに応じて答えます。

結婚式。

初めて人間を超えた！「絵を読み取り、意味を理解する」ことに関しては、AI は人間の目よりも優れています | DAMO アカデミー">

AIに別の質問をします。「男性のサッカー帽子はどのチームを表していますか？」

帽子の中の文字「B」に基づいて答えます。

ボストンチーム。

初めて人間を超えた！「絵を読み取り、意味を理解する」ことに関しては、AI は人間の目よりも優れています | DAMO アカデミー">

チャレンジを増やして、別のチャレンジに挑戦してみましょう。

「写真のおもちゃの男のIPはどの映画のものですか？」

この時、写真に写っているおもちゃや戦闘シーンなどの情報をもとにAIが推論を行います。

しかし、結局、答えは正確でした。

スターウォーズ。

初めて人間を超えた！「絵を読み取り、意味を理解する」ことに関しては、AI は人間の目よりも優れています | DAMO アカデミー">

たとえば、次の例では、AI が写真の詳細な情報をキャプチャして、質問に正確に答えます。

初めて人間を超えた！「絵を読み取り、意味を理解する」ことに関しては、AI は人間の目よりも優れています | DAMO アカデミー">

まあ、丁寧とも言えるでしょう。

おそらく、上記のケースは人間にとってそれほど難しいことではないかもしれません。

しかし、AIにとってそれは簡単な作業ではありません。

主な難しさは次のとおりです。

単一のモダリティを正確に理解した上で、共同推論と認知を行うためにマルチモーダル情報を統合し、最終的にはクロスモーダル理解を実現する必要があります。

どうやって破るの？

Alibaba DAMO Academy は、多数の革新的なアルゴリズムを組み込んだ AI ビジュアルテキスト推論システムを体系的に設計しました。

初めて人間を超えた！「絵を読み取り、意味を理解する」ことに関しては、AI は人間の目よりも優れています | DAMO アカデミー">

具体的には、大きく分けて以下の4つの内容に分けられます。

多様な視覚的特徴表現: 画像のローカルおよびグローバルな意味情報をあらゆる側面から記述し、領域、グリッド、パッチなどの視覚的特徴表現を使用して、より正確な単一モーダル理解を実現します。
大量のグラフィックデータと多粒度の視覚的特徴に基づくマルチモーダル事前トレーニング: マルチモーダル情報の融合とセマンティックマッピングをより適切に実行するために、SemVLP、Grid-VLP、E2E-VLP、Fusion-VLP などの事前トレーニングモデルが提案されています。
適応型クロスモーダルセマンティックフュージョンおよびアライメントテクノロジー: マルチモーダル事前トレーニングモデルに Learning to Attend メカニズムを追加して、クロスモーダル情報の効率的で深い融合を実行します。
Mixture of Experts (MOE) テクノロジー: 知識主導のマルチスキル AI 統合。

初めて人間を超えた！「絵を読み取り、意味を理解する」ことに関しては、AI は人間の目よりも優れています | DAMO アカデミー">

このモデルに使われている技術は専門家からも認められているようです。

例えば、マルチモーダル事前トレーニングモデル E2E-VLP は、トップクラスの国際会議 ACL2021 に採択されました。

初めて人間を超えた！「絵を読み取り、意味を理解する」ことに関しては、AI は人間の目よりも優れています | DAMO アカデミー">