GPT-4 はグラフィカル推論を実行できないのですか? 「手放す」後も、正解率は33%にとどまる

GPT-4 はグラフィカル推論を実行できないのですか? 「手放す」後も、正解率は33%にとどまる

GPT-4 のグラフィカル推論能力は人間の半分以下?

米国のサンタフェ研究所の調査によると、 GPT-4 がグラフィック推論問題を解く際の精度はわずか 33% です

マルチモーダル GPT-4v のパフォーマンスはさらに悪く、質問の 25% しか正しく回答できませんでした。

点線は 16 個のタスクの平均パフォーマンスを表します。

この実験の結果が発表されると、YC 上ですぐに広範囲にわたる白熱した議論が巻き起こりました。

この結果に同意するネットユーザーは、GPTは確かに抽象的なグラフィックス処理が苦手であり、「位置」や「回転」などの概念を理解するのがより難しいと述べました。

しかし一方で、多くのネットユーザーもこの結論に疑問を抱いている。簡単に言えば、

間違っているとは言えませんが、完全に正しいと言うのも説得力がありません。

具体的な理由については、引き続き読み進めてください。

GPT-4の精度はわずか33%

これらのグラフィックの質問に対する人間と GPT-4 のパフォーマンスを評価するために、研究者らは今年 5 月に自らの機関が立ち上げた ConceptARC データセットを使用しました。

ConceptARC には、グラフィック推論問題の 16 のサブカテゴリ (各カテゴリに 30 問、合計 480 問) が含まれています。

これら 16 のサブカテゴリは、位置関係、形状、操作、比較などの複数の側面をカバーします。

具体的には、これらの質問はピクセルブロックで構成されており、人間と GPT は与えられた例に基づいてパターンを見つけ、画像を同じように処理した後に結果を分析する必要があります。

著者は、論文の中で、これらの 16 のサブカテゴリについて、カテゴリごとに 1 つずつ、具体的な質問例を示しています。



結果によると、451人の被験者の平均正解率は各サブ項目で83%以上であり、16のタスクの平均は91%に達した。

しかし、GPT-4(単一サンプル)で質問を3回試行(1回正解すれば正解とみなす)した場合、最高正解率は60%を超えず、平均は33%にとどまります。

以前、この実験に関わったConceptARCベンチマークの著者らも同様の実験を行ったが、GPT-4ではゼロサンプルテストが行​​われ、16のタスクの平均精度はわずか19%だった。

マルチモーダル GPT-4v の精度率はさらに低くなります。48 の質問で構成される小規模な ConceptARC データセットでは、ゼロショット テストとシングルショット テストの精度率はそれぞれわずか 25% と 23% です。

研究者らは、誤答をさらに分析した結果、人間が犯した間違いの一部は「不注意」によって引き起こされたと思われる一方で、GPTは単に質問のパターンを理解できなかったことを発見した。

ネットユーザーは一般的にこれらのデータについて疑問を抱いていないが、この実験を非常に疑問視しているのは、募集された被験者とGPTの入力方法である。

被験者の選定方法が疑問視された

当初、研究者らはアマゾンのクラウドソーシングプラットフォームで被験者を募集した。

研究者らは、入門レベルのテストとしてデータセットからいくつかの簡単な質問を選択しました。被験者は、正式なテストに進む前に、ランダムに選ばれた 3 つの質問のうち少なくとも 2 つに正しく答える必要があります

その結果、研究者らは、入学試験の結果から、一部の人はただお金が欲しかっただけで、要求された質問に答えなかったことがわかったことを発見した。

最後の手段として、研究者らはテスト参加の基準を、プラットフォーム上で少なくとも2,000のタスクを完了し、合格率が99%になるように引き上げた

しかし、著者は合格率で選抜しているものの、具体的な能力に関しては、英語力があることを条件としているほか、グラフィックなどの他の専門能力については「特別な要件はない」としている

研究者らはデータを多様化するために、実験の後半段階で被験者募集作業を別のクラウドソーシングプラットフォームに移管し、最終的に合計415人の被験者が実験に参加した。

それにもかかわらず、実験のサンプルが「十分にランダムではなかった」と疑問を呈する人もいた。

他のネットユーザーは、研究者が被験者を募集するために使用するアマゾンのクラウドソーシングプラットフォームに、人間のふりをした巨大なモデルが存在すると指摘した。

GPT の動作を見てみましょう。マルチモーダル バージョンは比較的簡単です。画像をアップロードして、次のプロンプト ワードを使用するだけです。

ゼロサンプルテストでは、対応するEXAMPLE部分を削除するだけです。

ただし、マルチモーダル性のないGPT-4のプレーンテキスト版(0613)では、画像をグリッドポイントに変換し、色の代わりに数字を使用する必要があります。

この作戦に反対する人もいた。

画像をデジタルマトリックスに変換すると、概念は完全に変わります。数字で表された「グラフィック」は、人間でも理解できない場合があります。

もう一つ

偶然にも、スタンフォード大学の中国人博士課程学生であるジョイ・スー氏も、幾何学データセットを使用して、GPT-4v のグラフィックス理解能力をテストしました。

このデータセットは、大規模モデルのユークリッド幾何学の理解をテストすることを目的として昨年公開されました。GPT-4v が公開された後、Hsu 氏はこのデータセットを使用して再度テストを行いました。

結果は、GPT-4v がグラフィックスを理解する方法が「人間とはまったく異なる」ように見えることを示しました。

データの観点から見ると、これらの幾何学の質問に対する GPT-4v の回答も人間に比べて大幅に劣っています。

論文の宛先:
[1] https://arxiv.org/abs/2305.07141
[2] https://arxiv.org/abs/2311.09247

<<: 

>>:  交渉は失敗しました!ウルトラマンはOpenAIへの復帰に失敗し、Twitchの創設者が新CEOに就任

ブログ    
ブログ    

推薦する

20倍速くなります! Google AIがスマートカーに役立つTensorFlow 3Dを発表

Google AI は TensorFlow 3D をリリースしました。これは TensorFlow...

OpenAI CEOがGPT-5の開発中であることを明らかに

11月14日、海外メディアの報道によると、OpenAIはGPT-5の構築を開始した。同社のCEOサム...

この国産トランスフォーマーは自動変形、音声制御、プログラミングが可能。外国人は狂ったように気に入っている

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

シンプルで強力な顔認識プロジェクトがGitHubのトレンドリストに登場

最近、face_recognitionという顔認識プロジェクトがGitHubのトレンドリストに掲載さ...

中飛愛威CEO曹飛氏:自動化からインテリジェンスへ、ドローン検査をよりスマートに

[51CTO.comよりオリジナル記事] 農業、電力、航空写真撮影など、多くの分野でドローンが活躍す...

知っておくべき 10 個の機械学習 API

[[257117]] [51CTO.com クイック翻訳] 今日では、携帯電話の写真ストリーム認識...

レポートの解釈: 企業の 91% が 2023 年に AI がビジネスの成長を促進すると予想

[[245538]]人工知能 (AI) により、早期導入メーカーはすでに分析、ビジネス インテリジェ...

...

...

Waymo - 自動運転技術の解説

[[437828]]今日は、Google の自動運転車 Waymo がどのようにそれを実現するかを見...

強化学習は2020年にブレークスルーを達成するでしょうか?

強化学習は AI/ML の目標を達成するために不可欠ですが、克服すべきハードルがまだいくつかあります...

2021年の世界トップ10の画期的テクノロジー:TikTokアルゴリズムと北斗ナビゲーションがリストに

[[384967]]最近、アメリカの「MITテクノロジーレビュー」は、2021年の世界のトップ10の...

AIツールはリモートワーク中のチームの生産性向上に役立ちます

[[385429]]人工知能は、自宅からリモートで仕事をしながら生産性を維持したい労働者にとって重要...

...