ChatGPTを超える最初のオープンソースモデルが登場？ネットユーザーはそれを信じない

大型モデルが人気となり、毎日さまざまな「ビッグ」ニュースを目にするようになりました。

写真

今日、もう一つ大きなニュースがあります。新しくオープンソースになった大規模モデルが ChatGPT を上回りました。

それは正確には何ですか?

OpenLLM は、極めて小規模で多様性に富んだ高品質のマルチターン会話データセットに基づいて微調整されたオープンソース言語モデルのファミリーです。

過去 2 日間で、著者らはこの一連のモデルを更新し、OpenChat モデルが AlpacaEval で 80.9% の勝率を達成し、Vicuna GPT-4 評価ではパフォーマンスが ChatGPT の 105% に達したことを発表しました。

写真

つまり、上記の Twitter スクリーンショットでは、2 人のブロガーが主張するオープンソースモデルが ChatGPT/GPT-3.5 を上回っています。

OpenLLM は、LLaMA オープンソースモデルに基づくモデルを備えており、わずか 6,000 個の GPT4 ダイアログのデータセットで微調整され、非常に優れた結果が得られています。

更新されたモデルとレビュー結果は次のとおりです。

OpenChat: LLaMA-13B に基づくと、コンテキストの長さは 2048 です。
Vicuna GPT-4評価でChatGPTスコアの105.7%を達成。
AlpacaEvalで勝率80.9%を達成しました。
OpenChat-8192: LLaMA-13B に基づいており、コンテキストの長さが 8192 に拡張されています。
Vicuna GPT-4評価でChatGPTスコアの106.6%を達成。
AlpacaEvalで勝率79.5%を達成しました。

つまり、どちらのモデルも Vicuna GPT-4 評価リストで ChatGPT を上回りました。

しかし、このレビュー＋宣伝という手法は、すべての人に認知されているわけではないようです。

ネットユーザー：誇張

Twitterでの議論では、一部のネットユーザーがこれは誇張だと指摘した。

写真

この「ビッグ」ニュースが発表されると、ビクーニャの関係者もすぐに反応した。

実際、Vicuna ベンチマークは廃止され、より高度な MT-bench ベンチマークが採用されています。このベンチマークは、より困難なタスクでテストされ、gpt4 評価のバイアスと制限に対処します。

MT-benchでは、OpenChatのパフォーマンスはwizardlm-13bと同様です。つまり、オープンソースモデルと GPT-3.5 の間にはまだ一定のギャップが存在します。これはまさに MT-bench が強調していることです。オープンソースモデルは完璧ではありませんが、これによりチャットボットの評価が向上します。

写真

先日、Machine Heart さんが「アルパカたちはどこまで来たのか？」というコンテンツを報告しました。研究によれば、最高のものは GPT-4 のパフォーマンスの 68% を達成できる」とされており、オープンソースモデルのパフォーマンスも評価しています。

また、この評価では、どの評価においても、最良モデルの平均パフォーマンスは ChatGPT の 83%、GPT-4 の 68% に達することが示されており、このギャップを縮めるには、より優れたベースモデルと命令チューニングデータをさらに構築する必要があることを示しています。

興味のある読者は原文を確認してください。

<<: 大規模言語モデルと知識グラフに関する共同研究のレビュー：2つの相補的な技術的利点

>>: 大きな言語モデルに目を向けると、その画像認識性能は CLIP を超えています。スタンフォードのような新しい方法では、マルチモーダル事前トレーニングは不要である

Java プログラミングスキル - データ構造とアルゴリズム「シーケンシャルバイナリツリー」

ChatGPTを超える最初のオープンソースモデルが登場？ネットユーザーはそれを信じない

ネットユーザー：誇張

Java プログラミングスキル - データ構造とアルゴリズム「シーケンシャルバイナリツリー」

GPT 1周年深夜の雑談: プログラミングなしで誰もが GPT を定義できる時代が到来!

AIが観測性を高める方法

これが顔認識と画像認識がますます重要になっている理由です

ロボットシェフはトマト入りスクランブルエッグ9品を試食した後、味覚マップを描いた。

どのAIダンスが一番いいですか？ Google の 3D ダンサーが音楽に合わせて踊り、DanceNet に挑戦

推薦する

人工知能の時代では、次の7つの重要な要素を念頭に置く必要があります

450、バックトラッキングアルゴリズムとは何ですか? 一度見れば理解できますが、実際に書いてみると失敗します。

運転教習業界にも「AI」の波が吹き荒れる、普及規模に注目

スマート教育を開発することの価値は何でしょうか? 5GとAIが重要な役割を果たす

機械学習に必須の Python ライブラリトップ 10

SDXL TurboやLCMが次々とリリースされ、AI描画はリアルタイム生成の時代に入り、入力が速いほど描画も速くなります。

Alimama は曲率空間学習フレームワークと連合学習ソリューションをオープンソース化し、共通の進歩のために AI 技術を一般に公開します。

サービス最適化における人工知能の利点と欠点は何ですか?

ジェネレーティブAIは伝統的な医師と患者の関係を破壊している

大きなモデルをベンチマークに騙されないでください!テストセットが事前トレーニングにランダムに挿入され、スコアが人為的に高くなり、モデルが愚かになる

Sitechi スマートオペレーションプラットフォームがスマートシティの求心力を生み出す

すべての最大共通部分列を見つけるためのアルゴリズムの実装

収集する価値のあるAIツールメモ8つ