GPT-4 の王冠は落ちていません!クロード3アリーナの人間投票結果が発表されました: 3位のみ

クロード 3 のアリーナランクがついに登場:

わずか 3 日間で 20,000 票が集まり、リストのトラフィックが前例のないレベルに達しました。

最終的に、Claude 3 の最強の「Big Cup」モデル Opus が 1233 点を獲得し、GPT-4-Turbo と競争できる最初のプレーヤーになりました。

「中」の Sonnet も、GPT-4 の 2 つの古いバージョンと同等で、かなり優れています。

写真

しかし、全体的には、GPT-4 シリーズが依然として優位に立っています。

クロード3号のパフォーマンスは宣伝されていたものとは少し違っていました。ネットユーザーは次のようにまとめている。

GPT-4 は依然として大規模モデルの王様です!

しかし、無料の「中」の Claude 3 (Sonnet) はさらにコストパフォーマンスに優れていました。

写真

アリーナの大型模型が公開、「新王者」は3位に

Claude 3 がリリースされたとき、公式の宣伝では、あらゆる面で GPT-4 を上回っているとされていましたが、それが GPT-4 のどのバージョンであるかについては言及されていませんでした。

写真

アリーナリーダーボード (LMSYS チャットボットアリーナリーダーボード) の最新アップデートにより、そのことが分かります。

詳細を見てみましょう。

1位は、昨年11月にOpenAIがリリースしたGPT-4 Turboです。

GPT-4-1106-プレビュー。

より強力かつ安価で、128,000 のコンテキストがあり、トレーニングデータは 2021 年 9 月から 2023 年 4 月まで更新されます。

1位は今年1月にリリースされたGPT-4 Turboの最新バージョンです。

GPT-4-0125-プレビュー。

トレーニングデータはより広範囲にわたり、2023 年 12 月まで延長されます。

両者とも1251点を獲得しました。

次はクロード3号（トレーニングデータは2023年8月まで）です。

最も強力なバージョンである Opus のスコアは 1233 で、GPT-4 Turbo より 18 ポイント低い結果となりました。

写真

このギャップは比較するとそれほど大きくありません。結局のところ、下を見てください。

これは、GPT-4 の 2 つのバージョン (0314 と 0613) よりもそれぞれ 48 ポイントと 72 ポイント高い値です。

中程度のパフォーマンスの Claude 3 Sonnet は、GPT-4 の 2 つのバージョンの間で 6 位にランクされています。

しかし、0314版より5ポイント低いだけであり、一気に追い抜く可能性は大きい。

写真

したがって、一般的に、公式の宣伝には何ら問題はありません。すべての面で GPT-4 の旧バージョンを上回っていますが、GPT-4 Turbo からはまだ少し離れていますが、それほど遠くはありません。

——このリストの評価メカニズムなどから判断すると、その結果は業界でかなり認知されているようですね。

これは「Vicuna」の著者チームによって開始されました。

しかし、審査員は「ラマ」や GPT-4 ではなく、人間の好みに基づいています。

詳細には、2 つの匿名モデルにランダムに任意の質問をし、それぞれの回答を評価して、より良い回答に投票します。

写真

1 ラウンドで投票できない場合は、質問を続けることもできます。チャット中にモデルが誤って自分の身元を明らかにした場合、投票は無効になります。

特に、スコアリングルールでは公平性を確保するために Elo メカニズムが使用されます (King of Glory をプレイしている友人はこれをよく知っています)。

たとえば、モデルが負けた場合、そのモデル自体が弱いため、スコアが必ずしも低くなるわけではありません。これは予想どおりです。

これまでのところ、このリストは非常に人気があり、世界中から73人のモデルがチャレンジに参加し、ネットユーザーから37万票以上を獲得しています。

同義千文がトップ10入り

クロード3号に加えて、好成績を収めた他の選手も見てみましょう。

まず最初に言及すべきは、Gemini Pro をベースにした Bard で、GPT-4Turbo と Claude 3 に次いで 4 位にランクされています。

写真

ちょっと意外とも言えるかもしれません。

ネットユーザーは冗談を言った。

Google は文字通りランキングに穴を開けてしまいました。

彼はすぐにジェフ・ディーンとディープマインドのトップをタグ付けした。「おい、もっと頑張れよ（王仔）」

写真

次に、Alitong Yi Qianwen（バージョン 1.5、先月リリース）についてお話しします。

このランキングではトップ10入りし、9位タイとなり、国内プレーヤーの中では最高の成績を収めました。

写真

他の国内プレーヤーに加え、Claude 2、Gemini Pro、GPT-3.5なども残しています。

完全なリスト: https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard
参考リンク: https://twitter.com/lmsysorg/status/1765774296000172289

<<: AR/VRが製造業の自動化とロボット工学の発展を促進する方法

>>: アルトマンの巨大な AI 帝国を深く探ります。核融合プラントから不死技術センターまで、その規模は驚異的です。

これらの仕事は今後5年以内に機械に置き換えられる可能性があり、8500万人が解雇される危険にさらされている。

ブログ

人工知能：この冷たい水はちょうどいいタイミングで注がれます！

ブログ

Hive でサポートされているファイル形式と圧縮アルゴリズム

ブログ

IoT、エッジコンピューティング、AIプロジェクトが企業にもたらす利益

ブログ

IDC、2021年以降のITトレンドトップ10を発表

ブログ

人工知能の知られざる12の秘密

ブログ

ルカン氏の論文は「盗作」と非難されたのか？ LSTMの父は怒りの投稿を投稿しました：私をコピーした人はオリジナルにもマークを付けてください

ブログ

新しい世代の AI 人材はどこから生まれ、どこに向かうべきでしょうか?

ブログ

GPT-4 の王冠は落ちていません!クロード3アリーナの人間投票結果が発表されました: 3位のみ

アリーナの大型模型が公開、「新王者」は3位に

同義千文がトップ10入り

これらの仕事は今後5年以内に機械に置き換えられる可能性があり、8500万人が解雇される危険にさらされている。

人工知能：この冷たい水はちょうどいいタイミングで注がれます！

Hive でサポートされているファイル形式と圧縮アルゴリズム

IoT、エッジコンピューティング、AIプロジェクトが企業にもたらす利益

IDC、2021年以降のITトレンドトップ10を発表

人工知能の知られざる12の秘密

ルカン氏の論文は「盗作」と非難されたのか？ LSTMの父は怒りの投稿を投稿しました：私をコピーした人はオリジナルにもマークを付けてください

新しい世代の AI 人材はどこから生まれ、どこに向かうべきでしょうか?

推薦する

AIは人間に取って代わるでしょうか？シリコンバレーの大物が人工知能の将来の発展の傾向を解説

AIは奥が深いので、早く田舎へ行きましょう

話題の論文「14行のコードがBERTを打ち負かす」に逆転の兆し！バグを修正すると、パフォーマンスは数秒で最悪になります

人工知能の責任ある使用のための10の原則

Tフロントライン | テンセントAILabとの独占インタビュー：「点」から「線」へ、実験室は単なる実験以上のもの

公正な AI システムを構築するにはどうすればよいでしょうか?

5G、人工知能、音声技術…2020年に注目すべき6つのテクノロジートレンド

ビッグデータの機械理解の秘密：クラスタリングアルゴリズムの詳細な説明

インテルがモービルアイを買収、自動運転市場は3社間の競争の幕開けか

マイクロソフト、AIアシスタントCopilotを搭載したWindows 11のメジャーアップデートをリリース