DeepMindは、オートエンコーダに「自己修正」を教える「SUNDAE」と呼ばれる言語モデルを提案している。

DeepMindは、オートエンコーダに「自己修正」を教える「SUNDAE」と呼ばれる言語モデルを提案している。

[[440946]]

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

自己回帰モデル(AR) は、テキスト生成タスクにおいて常に優れたパフォーマンスを発揮してきました。

現在、DeepMind は、オートエンコーダに「自己修正」を学習させることで、 SUNDAEと呼ばれる非自己回帰モデルを提案しています。

これは、WMT'14 英語 - ドイツ語翻訳タスクにおいて非自己回帰モデルの中で SOTA を達成するだけでなく、自己回帰モデルと同等のパフォーマンスも示します。

さらに驚くべきことは、自己回帰モデルではできないこと、つまりテキスト補完を簡単に実行できることです。

ご存知のとおり、非自己回帰モデルは常に不人気でした。

この「サンデー」のテキスト補完機能は、人間と機械が共同でテキストを編集、作成する新しい方法も提供します。

非自己回帰言語モデル「サンデー」

「Sundae」の正式名称は「Step-unrolled Denoising Autoencoder」(SUNDAE) です。新しいテキスト生成モデルであるため、従来の自己回帰モデルに依存しません。

ノイズ除去拡散と同様に、Sundae はトレーニング中にアンロールされたノイズ除去を使用し、ランダムな入力から始めて収束するまで毎回改善しながら、一連のトークンに繰り返し適用します。

これは「自己修正」プロセスと呼ばれるものです。

次の図は、単一のノイズ低減と拡張ノイズ低減の違いを示しています。

最初の行は元のテキストで、ランダムに「破損」して新しいテキスト(2 行目)が生成されます。緑のトークンは「汚染されていない」テキストを表し、赤のトークンは「汚染された」テキストを表します。

この中間テキストはノイズ除去(生成モデルからサンプリング)され、下部に別の「汚染された」テキストが生成されます。

標準的なノイズ除去オートエンコーダーは中央のテキストから上のテキストへのマッピングのみを学習しますが、プログレッシブ アンローリング ノイズ除去オートエンコーダー (「Sundae」) は下から上へのマッピングを学習します。

テキスト生成中に、ネットワークが遭遇するテキストのほとんどは、上の図の中央のようなものではなく、下部のようなものであるので、拡張ノイズ除去は非常に役立ちます。

さらに、研究者らは、ノイズ除去拡散技術よりも少ない反復で収束を達成しながら、自然言語データセット上で質的に優れたサンプルを生成できる単純な改善演算子を提案しました。

端的に言えば、「Sundae」が採用した方式は、テキスト合成の品質と速度を制御可能にします。

機械翻訳やテキスト生成タスクでのパフォーマンスはいかがでしょうか?

「サンデー」の具体的なパフォーマンスを見てみましょう。

研究者らはまず、機械翻訳ベンチマークでSundaeを評価した。

BLEU スコアを基準として使用し、WMT’14 ドイツ語-英語翻訳タスクにおける「Sundae」の翻訳品質を自己回帰 (AR) モデルおよび非 AR モデルと比較します。

結果によると、シーケンスレベルの知識蒸留などの技術を使用しなくても、「Sundae」のパフォーマンスは AR モデルとほぼ同等であり、すべての非 AR モデルを上回っています。

次は、テキスト生成タスクにおける Sundae の評価です。

研究者らは、大規模で高品質な公開データセットである Colossal Clean Common Crawl (C4) を使用して Sundae をトレーニングしました。

このモデルには、合計 335M のパラメータ、24 層、埋め込みサイズ 1024、非表示サイズ 4096、およびアテンション ヘッド 16 個が含まれています。バッチ サイズ 4096 の Adam オプティマイザーを使用して、最大 400,000 ステップにわたってトレーニングされました。

結果のテキストは、 cherry picking なしで次のようになります。

これら 10 個の文のうち、4 番目の文を除いて、すべて非常に合理的です。

ただし、C4 データセットはインターネットから取得されるため、トレーニング セットと最終的に生成された結果の両方に改行が多数あります。

さらに、「サンデー」モデルの非自己回帰的な性質のため、研究者らはテキストの「修復」能力もテストしました。

ご存知のとおり、左から右へ順番にしか生成できない AR モデルでは、これは単純に不可能です

結果は次のとおりです(厳選):

  • C4 データセット
  • GitHub 上の Python プログラムのデータセット

この効果についてどう思いますか?構文とロジックには問題はないようです。

詳しいデータや内容については、以下のリンクをクリックしてください。

論文の宛先:

https://arxiv.org/abs/2112.06749

<<:  人間の運転、交通事故の最大の欠陥 | 自動運転車の交通安全に関する白書が発表

>>:  自動化を推進するAIテストツール

ブログ    
ブログ    

推薦する

新しい技術が機械学習モデルの推論を人間の推論と比較する

研究者らが開発した新しい技術は、機械学習モデルの推論と人間の推論を比較し、ユーザーがモデルの行動パタ...

AIを活用して都市の建物の特性を識別し、地震などの災害に対するリスクを予測する

ビッグデータダイジェスト制作出典: サイエンスデイリー編集者: ジェーン人工知能は、ビジネスから工業...

人工知能倫理ガバナンスは早急に実践段階へ移行する必要がある

今日の社会では、デジタル工業化と産業のデジタル化により、デジタル世界と物理世界の深い融合と発展が促進...

マイクロソフト、テンセント、インテルがキュウリを栽培する理由:AIのせい

[[249198]]マイクロソフト、テンセント、インテルがキュウリ栽培にAIを活用北京時間11月13...

欧州宇宙機関が初のAI衛星を打ち上げ、AIチップ+アルゴリズムで雲画像をフィルタリング

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

モデル量子化とエッジAIがインタラクションを定義する方法

AI とエッジ コンピューティングの融合により、多くの業界が変革されるでしょう。移植性を向上させ、モ...

マシンビジョンはインダストリー4.0とモノのインターネットの重要な技術です

[51CTO.com クイック翻訳] マシンビジョンは、機械学習と商用グレードのハードウェアを組み合...

...

ほとんどの企業はユーザーの同意を得ずに顔認識機能を使用している

顔認証機能の利用にあたり、利用者の同意を得ていない企業が半数近くあるというデータもある。ビッグデータ...

マルチモーダル大規模モデル機能評価: Bard は必要なものですか?

ChatGPT に続いて、OpenAI のライブ ブロードキャストでは、視覚入力はまだ広く利用可能...

AIダイナミックセキュリティガードデータセンター

最近の世界的な調査によると、企業の事業がハッキングされると莫大な損失が発生し、サイバー攻撃1回あたり...

業界の競争が激化する中、人工知能が経済のデジタル化をどう推進するかを見てみましょう。

新しいインフラストラクチャの配置が加速するにつれて、5G、モノのインターネット、クラウドコンピューテ...

AI初心者ガイド: MLとAIの違いを理解する

[51CTO.com クイック翻訳] 人工知能は現在、さまざまなハイテク分野で話題になっています。初...

...

...