GPT-4 はグラフィカル推論を実行できないのですか? 「手放す」後も、正解率は33%にとどまる

GPT-4 はグラフィカル推論を実行できないのですか? 「手放す」後も、正解率は33%にとどまる

GPT-4 のグラフィカル推論能力は人間の半分以下?

米国のサンタフェ研究所の調査によると、 GPT-4 がグラフィック推論問題を解く際の精度はわずか 33% です

マルチモーダル GPT-4v のパフォーマンスはさらに悪く、質問の 25% しか正しく回答できませんでした。

点線は 16 個のタスクの平均パフォーマンスを表します。

この実験の結果が発表されると、YC 上ですぐに広範囲にわたる白熱した議論が巻き起こりました。

この結果に同意するネットユーザーは、GPTは確かに抽象的なグラフィックス処理が苦手であり、「位置」や「回転」などの概念を理解するのがより難しいと述べました。

しかし一方で、多くのネットユーザーもこの結論に疑問を抱いている。簡単に言えば、

間違っているとは言えませんが、完全に正しいと言うのも説得力がありません。

具体的な理由については、引き続き読み進めてください。

GPT-4の精度はわずか33%

これらのグラフィックの質問に対する人間と GPT-4 のパフォーマンスを評価するために、研究者らは今年 5 月に自らの機関が立ち上げた ConceptARC データセットを使用しました。

ConceptARC には、グラフィック推論問題の 16 のサブカテゴリ (各カテゴリに 30 問、合計 480 問) が含まれています。

これら 16 のサブカテゴリは、位置関係、形状、操作、比較などの複数の側面をカバーします。

具体的には、これらの質問はピクセルブロックで構成されており、人間と GPT は与えられた例に基づいてパターンを見つけ、画像を同じように処理した後に結果を分析する必要があります。

著者は、論文の中で、これらの 16 のサブカテゴリについて、カテゴリごとに 1 つずつ、具体的な質問例を示しています。



結果によると、451人の被験者の平均正解率は各サブ項目で83%以上であり、16のタスクの平均は91%に達した。

しかし、GPT-4(単一サンプル)で質問を3回試行(1回正解すれば正解とみなす)した場合、最高正解率は60%を超えず、平均は33%にとどまります。

以前、この実験に関わったConceptARCベンチマークの著者らも同様の実験を行ったが、GPT-4ではゼロサンプルテストが行​​われ、16のタスクの平均精度はわずか19%だった。

マルチモーダル GPT-4v の精度率はさらに低くなります。48 の質問で構成される小規模な ConceptARC データセットでは、ゼロショット テストとシングルショット テストの精度率はそれぞれわずか 25% と 23% です。

研究者らは、誤答をさらに分析した結果、人間が犯した間違いの一部は「不注意」によって引き起こされたと思われる一方で、GPTは単に質問のパターンを理解できなかったことを発見した。

ネットユーザーは一般的にこれらのデータについて疑問を抱いていないが、この実験を非常に疑問視しているのは、募集された被験者とGPTの入力方法である。

被験者の選定方法が疑問視された

当初、研究者らはアマゾンのクラウドソーシングプラットフォームで被験者を募集した。

研究者らは、入門レベルのテストとしてデータセットからいくつかの簡単な質問を選択しました。被験者は、正式なテストに進む前に、ランダムに選ばれた 3 つの質問のうち少なくとも 2 つに正しく答える必要があります

その結果、研究者らは、入学試験の結果から、一部の人はただお金が欲しかっただけで、要求された質問に答えなかったことがわかったことを発見した。

最後の手段として、研究者らはテスト参加の基準を、プラットフォーム上で少なくとも2,000のタスクを完了し、合格率が99%になるように引き上げた

しかし、著者は合格率で選抜しているものの、具体的な能力に関しては、英語力があることを条件としているほか、グラフィックなどの他の専門能力については「特別な要件はない」としている

研究者らはデータを多様化するために、実験の後半段階で被験者募集作業を別のクラウドソーシングプラットフォームに移管し、最終的に合計415人の被験者が実験に参加した。

それにもかかわらず、実験のサンプルが「十分にランダムではなかった」と疑問を呈する人もいた。

他のネットユーザーは、研究者が被験者を募集するために使用するアマゾンのクラウドソーシングプラットフォームに、人間のふりをした巨大なモデルが存在すると指摘した。

GPT の動作を見てみましょう。マルチモーダル バージョンは比較的簡単です。画像をアップロードして、次のプロンプト ワードを使用するだけです。

ゼロサンプルテストでは、対応するEXAMPLE部分を削除するだけです。

ただし、マルチモーダル性のないGPT-4のプレーンテキスト版(0613)では、画像をグリッドポイントに変換し、色の代わりに数字を使用する必要があります。

この作戦に反対する人もいた。

画像をデジタルマトリックスに変換すると、概念は完全に変わります。数字で表された「グラフィック」は、人間でも理解できない場合があります。

もう一つ

偶然にも、スタンフォード大学の中国人博士課程学生であるジョイ・スー氏も、幾何学データセットを使用して、GPT-4v のグラフィックス理解能力をテストしました。

このデータセットは、大規模モデルのユークリッド幾何学の理解をテストすることを目的として昨年公開されました。GPT-4v が公開された後、Hsu 氏はこのデータセットを使用して再度テストを行いました。

結果は、GPT-4v がグラフィックスを理解する方法が「人間とはまったく異なる」ように見えることを示しました。

データの観点から見ると、これらの幾何学の質問に対する GPT-4v の回答も人間に比べて大幅に劣っています。

論文の宛先:
[1] https://arxiv.org/abs/2305.07141
[2] https://arxiv.org/abs/2311.09247

<<: 

>>:  交渉は失敗しました!ウルトラマンはOpenAIへの復帰に失敗し、Twitchの創設者が新CEOに就任

ブログ    
ブログ    

推薦する

AI顔認識:スマート監視を開発する方法

顔認識技術は継続的に発展しており、スマート監視システムの開発に貢献しています。これらのシステムにより...

単一のニューロンでも DNN 機能を実現でき、画像分類の精度は 98% です。

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

サイバーセキュリティにおける AI の 4 つの主要なユースケースを理解する

サイバーセキュリティは、おそらく今日すべての企業が直面している最大の脅威です。これらの課題は新しいも...

機械学習の収益は2023年までに803億ドルに達すると予想されている

機械学習を活用したソリューションとプロセスは、医療、情報技術 (IT)、農業、教育、エレクトロニクス...

Java プログラミング スキル - データ構造とアルゴリズム「循環リンク リストとジョセフ問題」

[[386837]]ジョセフ問題1、2、...n と番号が付けられた n 人が輪になって座り、番号...

人工知能と機械学習の違いと影響は何ですか?

人工知能と機械学習は、意思決定を行うコンピューターが部署や課全体に取って代わる世界を思い起こさせます...

...

ディープラーニングフレームワークの競争: TNN vs. MNN、NCNNは依然として定番

近年、「オープンソース」は開発者コミュニティにおける新たなトレンドとなっています。特にディープラーニ...

人工知能教師が将来果たす8つの役割

人工知能の急速な発展は目まぐるしく、教育、特に教師への影響は甚大です。人工知能は、退屈で面倒な仕事に...

元従業員が内部事情を暴露: 10年経っても、なぜGoogleはナレッジグラフを解明できないのか?

[[258183]]この記事はWeChatの公開アカウント「AI Front」(ID: ai-fr...

...

マイクロソフトのAI研究者が、クラウドストレージリンクの設定ミスにより、大量の内部データを誤って公開した。

9月19日、サイバーセキュリティ企業の最新調査によると、マイクロソフトの人工知能研究チームがソフト...

...