AI専門家の周明氏が軽量な「孟子モデル」を作成し、オープンソース化しました！ 10億のパラメータでCLUEリストの3位に到達

[[430068]]

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

わずか10 億のパラメータで中国の自然言語理解CLUEリストのトップ 3 にランクされているMencius モデルが、オープンソースになりました。

これを作成したチーム、蘭州科技創新工場は最近、孟子の普遍モデルに基づいた4つのモデルをオープンソース化すると発表した。

テキスト分類、金融ニュース分類、コピーライティング生成、画像説明などのシナリオで使用できます。

今年7月、AIの専門家である周明氏とそのチームが作成したこの軽量モデルは、リリースされるやいなや皆を驚かせました。

数百億、数千億のパラメータを持つモデルが10億のパラメータで樹立した記録を達成し、CLUEリストがテンセント、Sogou、Huawei、Alibaba Damo Academyによって独占されていた近年のパターンを打ち破りました。

現時点では、Mencius モデルはリストのトップ 5 の中で唯一、巨大企業が発売していないモデルであり、 3 位にランクされています。

CLUE リストは自然言語理解のプレイヤーたちの戦場であり、Tencent、Sogou、Huawei、Alibaba Damo Academy などが順番にリストを独占し、記録を更新しています。

彼らの大規模なモデルは、多くの場合、数千億または数兆のパラメータを持っています。わずか 10 億のパラメータを持つ Mencius モデルは、どのようにして包囲を突破したのでしょうか?

孟子モデルを見てみましょう。

Mencius モデルは、言語情報の統合やトレーニングの加速などの方法に基づいて Lanzhou Technology が開発した一連のモデルです。

BERT との一貫したモデル構造 (Transformer) により、Mencius モデルは既存の事前トレーニング済みモデルをすぐに置き換えることができます。

多言語・マルチモーダルなデータを処理でき、さまざまなテキスト理解やテキスト生成のタスクをサポートし、テキスト分類や読解などのさまざまなタスクで優れたパフォーマンスを発揮します。

具体的には、4 つのオープンソースモデルアーキテクチャは次のとおりです。

さまざまなシナリオに対応して、Mencius モデルは財務タスクで優れたパフォーマンスを発揮します。

マーケティングコピーの生成に関しては、Mencius モデルは GPT よりもはるかに豊富な言語を生成できます。

画像コンテンツの説明もより正確かつ詳細になり、AIの痕跡はほとんど見られません。

他の中国語言語モデルと比較すると、Mencius モデルの最大の特徴は、小型で精密であることです。

軽量なトレーニング戦略を採用し、数十億のパラメータを持つ小さなモデルの構築に取り組んでおり、既存のパラメータの下でのモデルの潜在能力を最大限に活用し、実際のビジネスシナリオを迅速かつ低コストで実装するのに役立ちます。

同時に、Mencius は人間の事前知識を使用してモデルのトレーニングをガイドし、モデルがより効率的に知識を獲得できるようにします。

Menciusモデルの言語理解能力はトップクラスで、権威あるCLUE中国語理解評価の総合ランキングでは84点を超え、人間のベンチマークスコア（85.61）に迫りました。

さらに、T5 スタイルのエンドツーエンドで生成されたトレーニングパラダイムに基づき、BERT スタイルの判断ベースのアーキテクチャを同期的に適応させることで、Mencius モデルは業界のアプリケーションに簡単に適応でき、幅広いビジネスシナリオをカバーできます。

モデルアーキテクチャの面でも、「Mencius」は全面的に改善されました。

具体的な側面は 4 つあります。

モデル構造の面では、意味的役割や品詞タグ付けなどの言語的特徴が埋め込み表現に統合され、構文制約に基づいて注意メカニズムが導入され、それによってモデルの言語知識をモデル化する能力が向上します。
トレーニング戦略の面では、エンティティ知識と談話に基づくマスクメカニズムが導入され、モデルの言語コンポーネントと談話関係の表現が強化されます。
トレーニング効率をさらに向上させるために、大規模モデルの蒸留と小規模モデルの初期化戦略が使用されました。
Mencius モデルを金融やマーケティングなどの垂直分野にうまく適応させるために、ドメインデータを使用してトレーニングを継続し、対応するプロンプトテンプレート (Prompt) を構築し、大幅なパフォーマンスの向上を実現しました。