DeepMindは、オートエンコーダに「自己修正」を教える「SUNDAE」と呼ばれる言語モデルを提案している。

[[440946]]

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

自己回帰モデル(AR) は、テキスト生成タスクにおいて常に優れたパフォーマンスを発揮してきました。

現在、DeepMind は、オートエンコーダに「自己修正」を学習させることで、 SUNDAEと呼ばれる非自己回帰モデルを提案しています。

これは、WMT'14 英語 - ドイツ語翻訳タスクにおいて非自己回帰モデルの中で SOTA を達成するだけでなく、自己回帰モデルと同等のパフォーマンスも示します。

さらに驚くべきことは、自己回帰モデルではできないこと、つまりテキスト補完を簡単に実行できることです。

ご存知のとおり、非自己回帰モデルは常に不人気でした。

この「サンデー」のテキスト補完機能は、人間と機械が共同でテキストを編集、作成する新しい方法も提供します。

非自己回帰言語モデル「サンデー」

「Sundae」の正式名称は「Step-unrolled Denoising Autoencoder」(SUNDAE) です。新しいテキスト生成モデルであるため、従来の自己回帰モデルに依存しません。

ノイズ除去拡散と同様に、Sundae はトレーニング中にアンロールされたノイズ除去を使用し、ランダムな入力から始めて収束するまで毎回改善しながら、一連のトークンに繰り返し適用します。

これは「自己修正」プロセスと呼ばれるものです。

次の図は、単一のノイズ低減と拡張ノイズ低減の違いを示しています。

最初の行は元のテキストで、ランダムに「破損」して新しいテキスト（2 行目）が生成されます。緑のトークンは「汚染されていない」テキストを表し、赤のトークンは「汚染された」テキストを表します。

この中間テキストはノイズ除去（生成モデルからサンプリング）され、下部に別の「汚染された」テキストが生成されます。

標準的なノイズ除去オートエンコーダーは中央のテキストから上のテキストへのマッピングのみを学習しますが、プログレッシブアンローリングノイズ除去オートエンコーダー (「Sundae」) は下から上へのマッピングを学習します。

テキスト生成中に、ネットワークが遭遇するテキストのほとんどは、上の図の中央のようなものではなく、下部のようなものであるので、拡張ノイズ除去は非常に役立ちます。

さらに、研究者らは、ノイズ除去拡散技術よりも少ない反復で収束を達成しながら、自然言語データセット上で質的に優れたサンプルを生成できる単純な改善演算子を提案しました。

端的に言えば、「Sundae」が採用した方式は、テキスト合成の品質と速度を制御可能にします。

機械翻訳やテキスト生成タスクでのパフォーマンスはいかがでしょうか?

「サンデー」の具体的なパフォーマンスを見てみましょう。

研究者らはまず、機械翻訳ベンチマークでSundaeを評価した。

BLEU スコアを基準として使用し、WMT’14 ドイツ語-英語翻訳タスクにおける「Sundae」の翻訳品質を自己回帰 (AR) モデルおよび非 AR モデルと比較します。

結果によると、シーケンスレベルの知識蒸留などの技術を使用しなくても、「Sundae」のパフォーマンスは AR モデルとほぼ同等であり、すべての非 AR モデルを上回っています。

次は、テキスト生成タスクにおける Sundae の評価です。

研究者らは、大規模で高品質な公開データセットである Colossal Clean Common Crawl (C4) を使用して Sundae をトレーニングしました。

このモデルには、合計 335M のパラメータ、24 層、埋め込みサイズ 1024、非表示サイズ 4096、およびアテンションヘッド 16 個が含まれています。バッチサイズ 4096 の Adam オプティマイザーを使用して、最大 400,000 ステップにわたってトレーニングされました。

結果のテキストは、 cherry picking なしで次のようになります。

これら 10 個の文のうち、4 番目の文を除いて、すべて非常に合理的です。

ただし、C4 データセットはインターネットから取得されるため、トレーニングセットと最終的に生成された結果の両方に改行が多数あります。

さらに、「サンデー」モデルの非自己回帰的な性質のため、研究者らはテキストの「修復」能力もテストしました。

ご存知のとおり、左から右へ順番にしか生成できない AR モデルでは、これは単純に不可能です。

結果は次のとおりです（厳選）：

C4 データセット

GitHub 上の Python プログラムのデータセット

この効果についてどう思いますか?構文とロジックには問題はないようです。

詳しいデータや内容については、以下のリンクをクリックしてください。

論文の宛先:

https://arxiv.org/abs/2112.06749

<<: 人間の運転、交通事故の最大の欠陥 | 自動運転車の交通安全に関する白書が発表

>>: 自動化を推進するAIテストツール

AI支援プログラミングの現状：AIツールは速度を向上させるが、エラーコードも大幅に増加

DeepMindは、オートエンコーダに「自己修正」を教える「SUNDAE」と呼ばれる言語モデルを提案している。

非自己回帰言語モデル「サンデー」

機械翻訳やテキスト生成タスクでのパフォーマンスはいかがでしょうか?

AI支援プログラミングの現状：AIツールは速度を向上させるが、エラーコードも大幅に増加

人工知能と遠隔監視：宇宙でのマッチング

フェイフェイ・リーのチームの新しい作品: AI 透視眼、障害物を通して見る、そして人体のレンダリングと遮蔽における新たなブレークスルー

GoogleとHuawei、AI市場獲得に向け音声アシスタントの導入を急ぐ

10行のコードで物体検出を実行する方法

本記事では、2019年の産業用ロボット開発業界の現状を解説します！

追加データなしで、ImageNetで初めて87.1%の精度を達成した。Yan ShuichengのチームはVOLOをオープンソース化した。

TensorFlow を使用して Android デバイスでディープラーニング推論を実装する方法

推薦する

新しい技術が機械学習モデルの推論を人間の推論と比較する

AIを活用して都市の建物の特性を識別し、地震などの災害に対するリスクを予測する

人工知能倫理ガバナンスは早急に実践段階へ移行する必要がある

マイクロソフト、テンセント、インテルがキュウリを栽培する理由：AIのせい

欧州宇宙機関が初のAI衛星を打ち上げ、AIチップ＋アルゴリズムで雲画像をフィルタリング

モデル量子化とエッジAIがインタラクションを定義する方法

マシンビジョンはインダストリー4.0とモノのインターネットの重要な技術です

ほとんどの企業はユーザーの同意を得ずに顔認識機能を使用している

マルチモーダル大規模モデル機能評価: Bard は必要なものですか?

AIダイナミックセキュリティガードデータセンター

業界の競争が激化する中、人工知能が経済のデジタル化をどう推進するかを見てみましょう。

AI初心者ガイド: MLとAIの違いを理解する