オープンソースのアルパカ モデル LLaMA コンテキストは、1 つの簡単な変更だけで GPT-4 と同等になります。 Meta AI が提出したばかりの論文によると、LLaMA コンテキスト ウィンドウは、2k から 32k に拡張した後、1000 ステップ未満の微調整しか必要としないことが示されています。 事前トレーニングと比較するとコストはごくわずかです。 コンテキスト ウィンドウを拡張すると、AI の「作業メモリ」容量が増加します。具体的には、次のことが可能になります。
さらに重要な意義は、LLaMA に基づくすべての大規模アルパカ モデル ファミリが低コストでこの方法を採用し、集合的に進化できることです。 Alpaca は現在、最も強力な総合機能を備えたオープンソースの基本モデルであり、完全にオープンソースの商用大規模モデルや垂直産業モデルを数多く生み出してきました。 論文の責任著者である田元東氏も、この新たな進歩を自身のWeChatモーメントで興奮気味に共有した。 RoPEに基づく大規模モデルを使用できるこの新しい方法は位置補間と呼ばれ、RoPE (回転位置エンコーディング) を使用する大規模モデルに適用できます。 RoPE は、2021 年に Zhuiyi Technology チームによって提案され、現在では大規模モデルで最も一般的な位置エンコード方法の 1 つになっています。 ただし、このアーキテクチャで外挿を直接使用してコンテキスト ウィンドウを拡張すると、自己注意メカニズムが完全に破壊されます。 具体的には、事前トレーニングのコンテキストの長さを超える部分では、モデルの困惑度がトレーニングされていないモデルと同じレベルに急上昇します。 新しい方式では、位置インデックスを線形に減らし、前後の位置インデックスと相対距離を揃える範囲を拡大するように変更されています。 両者の違いを示すには、画像を使用する方が直感的です。 実験結果によると、新しい方法は 7B から 65B の範囲の大規模な LLaMA モデルに効果的です。 長いシーケンスの言語モデリング、パスキーの取得、長いドキュメントの要約では、パフォーマンスの大幅な低下は見られません。 実験に加えて、新しい方法の詳細な証明も論文の付録に記載されています。 あと3つコンテキスト ウィンドウは、オープン ソースのビッグ モデルと商用のビッグ モデル間の重大なギャップでした。 たとえば、OpenAI の GPT-3.5 は最大 16k、GPT-4 は 32k、AnthropicAI の Claude は最大 100k をサポートします。 同時に、LLaMA や Falcon などの多くのオープンソースの大規模モデルはまだ 2k のままです。 現在、Meta AI の新たな成果により、このギャップは直接埋められています。 コンテキスト ウィンドウの拡張も、大規模モデル研究の最近の焦点の 1 つです。位置補間法に加えて、業界の注目を集めている他の多くの試みがあります。 1. 開発者の kaiokendev は、技術ブログで LLaMa コンテキスト ウィンドウを 8k に拡張する方法を検討しました。 2. データセキュリティ企業 Soveren の機械学習責任者 Galina Alperovich 氏は、コンテキスト ウィンドウを拡張するための 6 つのヒントを記事にまとめました。 3. Mila、IBM、その他の機関のチームも論文の中で、Transformer の位置エンコーディングを完全に削除しようと試みました。 必要な方は下のリンクをクリックしてご覧ください〜 メタ論文: https://arxiv.org/abs/2306.15595 コンテキストの拡張は難しい…しかし不可能ではないhttps://kaiokendev.github.io/context LLM の 100K コンテキスト ウィンドウの背後にある秘密のソース https://blog.gopenai.com/how-to-speed-up-llms-and-use-100k-context-window-all-tricks-in-one-place-ffd40577b4c 位置エンコーディングなし論文 https://arxiv.org/abs/2305.19466 |
<<: Moka、業界初となるAIネイティブHR SaaS製品「Moka Eva」をリリース、AGI時代を見据えた準備万端
人工知能技術の台頭とエッジデバイスのコンピューティング能力の向上により、マシンビジョンの応用シナリオ...
さあ、手払いについて学んでみましょう〜アマゾンはこのほど、自社が開発した手のひら認識技術「Amazo...
顔認識は、効率、利便性、正確性、非接触という特徴により、セキュリティ、支払い、交通、オフィスなどのシ...
CVPR 2020 に採択された論文「PULSE: 生成モデルの潜在空間探索による自己教師あり写真ア...
2021年の欧州選手権でイングランドはデンマークを破り、初めて欧州選手権決勝に進出した。歴史に名を残...
インターネットとオンラインショッピングの普及は、一部のオフライン業界に前例のない影響をもたらしました...
[[415607]] IDC の最新版「Worldwide Semiannual Artificia...
[[347910]]ビッグデータダイジェスト制作出典: thegradient編集者: フィッシャー...
本稿では、冬季オリンピックで使用されたロボット配送車両を概観し、より多くの消費者層に便利で高品質なサ...
[[198229]]転移学習転移学習とは、ある問題で訓練したモデルを、簡単な調整で新しい問題に適した...
ロイターが入手した情報筋や文書によると、ソフトバンクグループは世界的なロボット事業で人員削減を行い、...
OpenAIのCEOサム・アルトマン氏は先週金曜日に解雇され、もはや同社を率いていない。投資家たち...