GPT-4 はグラフィカル推論を実行できないのですか? 「手放す」後も、正解率は33％にとどまる

GPT-4 のグラフィカル推論能力は人間の半分以下？

米国のサンタフェ研究所の調査によると、 GPT-4 がグラフィック推論問題を解く際の精度はわずか 33% です。

マルチモーダル GPT-4v のパフォーマンスはさらに悪く、質問の 25% しか正しく回答できませんでした。

点線は 16 個のタスクの平均パフォーマンスを表します。

この実験の結果が発表されると、YC 上ですぐに広範囲にわたる白熱した議論が巻き起こりました。

この結果に同意するネットユーザーは、GPTは確かに抽象的なグラフィックス処理が苦手であり、「位置」や「回転」などの概念を理解するのがより難しいと述べました。

しかし一方で、多くのネットユーザーもこの結論に疑問を抱いている。簡単に言えば、

間違っているとは言えませんが、完全に正しいと言うのも説得力がありません。

具体的な理由については、引き続き読み進めてください。

GPT-4の精度はわずか33%

これらのグラフィックの質問に対する人間と GPT-4 のパフォーマンスを評価するために、研究者らは今年 5 月に自らの機関が立ち上げた ConceptARC データセットを使用しました。

ConceptARC には、グラフィック推論問題の 16 のサブカテゴリ (各カテゴリに 30 問、合計 480 問) が含まれています。

これら 16 のサブカテゴリは、位置関係、形状、操作、比較などの複数の側面をカバーします。

具体的には、これらの質問はピクセルブロックで構成されており、人間と GPT は与えられた例に基づいてパターンを見つけ、画像を同じように処理した後に結果を分析する必要があります。

著者は、論文の中で、これらの 16 のサブカテゴリについて、カテゴリごとに 1 つずつ、具体的な質問例を示しています。

結果によると、451人の被験者の平均正解率は各サブ項目で83%以上であり、16のタスクの平均は91%に達した。

しかし、GPT-4（単一サンプル）で質問を3回試行（1回正解すれば正解とみなす）した場合、最高正解率は60％を超えず、平均は33％にとどまります。

以前、この実験に関わったConceptARCベンチマークの著者らも同様の実験を行ったが、GPT-4ではゼロサンプルテストが行われ、16のタスクの平均精度はわずか19％だった。

マルチモーダル GPT-4v の精度率はさらに低くなります。48 の質問で構成される小規模な ConceptARC データセットでは、ゼロショットテストとシングルショットテストの精度率はそれぞれわずか 25% と 23% です。

研究者らは、誤答をさらに分析した結果、人間が犯した間違いの一部は「不注意」によって引き起こされたと思われる一方で、GPTは単に質問のパターンを理解できなかったことを発見した。

ネットユーザーは一般的にこれらのデータについて疑問を抱いていないが、この実験を非常に疑問視しているのは、募集された被験者とGPTの入力方法である。

被験者の選定方法が疑問視された

当初、研究者らはアマゾンのクラウドソーシングプラットフォームで被験者を募集した。

研究者らは、入門レベルのテストとしてデータセットからいくつかの簡単な質問を選択しました。被験者は、正式なテストに進む前に、ランダムに選ばれた 3 つの質問のうち少なくとも 2 つに正しく答える必要があります。

その結果、研究者らは、入学試験の結果から、一部の人はただお金が欲しかっただけで、要求された質問に答えなかったことがわかったことを発見した。

最後の手段として、研究者らはテスト参加の基準を、プラットフォーム上で少なくとも2,000のタスクを完了し、合格率が99%になるように引き上げた。

しかし、著者は合格率で選抜しているものの、具体的な能力に関しては、英語力があることを条件としているほか、グラフィックなどの他の専門能力については「特別な要件はない」としている。

研究者らはデータを多様化するために、実験の後半段階で被験者募集作業を別のクラウドソーシングプラットフォームに移管し、最終的に合計415人の被験者が実験に参加した。

それにもかかわらず、実験のサンプルが「十分にランダムではなかった」と疑問を呈する人もいた。

他のネットユーザーは、研究者が被験者を募集するために使用するアマゾンのクラウドソーシングプラットフォームに、人間のふりをした巨大なモデルが存在すると指摘した。

GPT の動作を見てみましょう。マルチモーダルバージョンは比較的簡単です。画像をアップロードして、次のプロンプトワードを使用するだけです。

ゼロサンプルテストでは、対応するEXAMPLE部分を削除するだけです。

ただし、マルチモーダル性のないGPT-4のプレーンテキスト版（0613）では、画像をグリッドポイントに変換し、色の代わりに数字を使用する必要があります。

この作戦に反対する人もいた。

画像をデジタルマトリックスに変換すると、概念は完全に変わります。数字で表された「グラフィック」は、人間でも理解できない場合があります。

もう一つ

偶然にも、スタンフォード大学の中国人博士課程学生であるジョイ・スー氏も、幾何学データセットを使用して、GPT-4v のグラフィックス理解能力をテストしました。

このデータセットは、大規模モデルのユークリッド幾何学の理解をテストすることを目的として昨年公開されました。GPT-4v が公開された後、Hsu 氏はこのデータセットを使用して再度テストを行いました。

結果は、GPT-4v がグラフィックスを理解する方法が「人間とはまったく異なる」ように見えることを示しました。

データの観点から見ると、これらの幾何学の質問に対する GPT-4v の回答も人間に比べて大幅に劣っています。

論文の宛先:
[1] https://arxiv.org/abs/2305.07141
[2] https://arxiv.org/abs/2311.09247

<<:

>>: 交渉は失敗しました！ウルトラマンはOpenAIへの復帰に失敗し、Twitchの創設者が新CEOに就任

TENSORFLOW を使用してリカレントニューラルネットワーク言語モデルをトレーニングする

ブログ

AI 株神: 機械学習を使って株価を予測するには?

ブログ

調査によると、米国の公共部門のIT意思決定者の70%にとってAIは「ミッションクリティカル」

ブログ

GPT-4 はグラフィカル推論を実行できないのですか? 「手放す」後も、正解率は33％にとどまる

GPT-4の精度はわずか33%

被験者の選定方法が疑問視された

もう一つ

TENSORFLOW を使用してリカレントニューラルネットワーク言語モデルをトレーニングする

8つのソートアルゴリズムのPython実装

UdeskブランドアップグレードWofeng TechnologyはAIコア技術を深化させ、5つの主要製品ラインでトップ1または2戦略を全面的に推進

人工知能の時代において、中国語と英語のどちらがAIの母国語になるのでしょうか？

機械学習アルゴリズムと機械学習モデルの開発方法について知っておくべきことは何ですか?

AI 株神: 機械学習を使って株価を予測するには?

調査によると、米国の公共部門のIT意思決定者の70%にとってAIは「ミッションクリティカル」

推薦する

人工知能やロボットが新たなスターとなった分野はどこでしょうか？

【専門家がここにいるエピソード3】大量ログ分析とインテリジェントな運用・保守

科学者らが自己再生材料に使える3Dプリント「生きたインク」を開発

AIの新興企業が胡潤富豪リストに名を連ねる：「CVの4人の小さなドラゴン」の創業者3人がリスト入り

Dota2 チャンピオン OG はどのようにして AI に打ち負かされたのでしょうか? OpenAIは3年間の蓄積を経てついに完全な論文を公開した

Python 向けトップ 3 機械学習ライブラリ

大規模モデルはなぜこんなに遅いのか？考えすぎだったことが判明：新しい方向性は、人間と同じ思考アルゴリズムを使用することです

人工知能が世界をより安全な場所にする4つの方法

調査結果: 回答者の 64% が生成 AI による作業の功績を認めている

大規模言語モデルはウォール街に勝てるか？株式選択における AI の可能性を明らかにする

貧困が私を訓練した

自動運転は安全試験に合格するのが難しい。自動車メーカー、サプライヤー、規制当局は協力を強化すべき