清華大学の唐潔氏のチームは、ダル・イーよりも優れた成果を挙げた「中国のAIデザイナー」を作成した。

清華大学の唐潔氏のチームは、ダル・イーよりも優れた成果を挙げた「中国のAIデザイナー」を作成した。

[[402579]]

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

2021年にOpenAIで最も注目され、最もクリエイティブな製品といえば、Dall Eでしょう。これは、テキストを与えられれば、必要な画像を生成できる「AIデザイナー」です。しかし残念ながら、Dall·E は中国語をサポートしていません。

さて、最近、清華大学のTang Jie氏のチームは、中国語のテキストを画像に変換できる「Dall·Eの中国版」であるCogViewを開発しました。

CogView は、「山を流れる小川」などの現実世界のシーンを生成できます。

「猫豚」など、存在しない仮想のものを作成することもできます。

時々、「悲しい博士課程の学生」のように、少しブラックユーモアもあります。

CogView は現在、任意のテキストを入力してグラフィックに変換できる試用 Web ページも提供しています。これは、いくつかのキーワード変更オプションしか提供していない OpenAI の Dall E とは異なります。

絵画スタイルや衣服のデザインを指定できる

CogView は、テキストから画像を入力するだけでなく、スタイルの学習、超解像度、テキストと画像のランキング、ファッション デザインなど、さまざまな微調整戦略を使用して下流のタスクを処理することもできます。

CogView を使用する場合、さまざまなスタイル制限を追加して、さまざまなペイント効果を生成できます。微調整中は、画像に対応するテキストも「XX風画像」となります。

CogView がデザインした衣服も非常にリアルで、偽りの痕跡もなく、電子商取引の表示ページのように見えます。

原理

CogView は、VQ-VAE トークナイザーの 40 億のパラメータを持つ Transformer です。全体的な構造は次のとおりです。

CogView は GPT モデルを使用して、個別の辞書上のトークン シーケンスを処理します。学習プロセスは 2 つの段階に分割されます。エンコーダーとデコーダーは再構築損失を最小限に抑えるように学習し、単一の GPT はテキストを連結して 2 つの負の対数尤度 (NLL) 損失を最適化します。

その結果、最初のステージは純粋な離散オートエンコーダーに退化し、画像をラベル付きシーケンスに変換する画像トークナイザーとして機能します。2 番目のステージの GPT は、モデリング タスクの大部分を引き受けます。

画像トークナイザーのトレーニングは非常に重要です。最近傍マッピング、ガンベルサンプリング、ソフトマックス近似の 3 つの方法があります。Dall E は 3 番目の方法を使用していますが、CogView の場合、3 つの方法に大きな違いはありません。

CogView のバックボーンは、48 層、40 個のアテンション ヘッド、40 億個のパラメーター、および 2560 の隠し層サイズを持つ単方向トランスフォーマーです。

トレーニング中に、著者らは CogView にオーバーフロー (NaN 損失を特徴とする) とアンダーフロー (発散損失を特徴とする) という 2 つの不安定性を発見し、それらを解決するために PB-Relax と Sandwich-LN を提案しました。

最後に、CogView は MS COCO で最も低い FID を達成し、以前の GAN ベースのモデルや同様の Dall E を上回りました。

手動評価テストでは、CogView が 37.02% の確率で最良として選択され、他の GAN ベースのモデルをはるかに上回り、Ground Truth (59.53%) と競合できるようになりました。

なお、作者はGitHubプロジェクトページを公開していますが、まだコードはありません。興味のある友人は注目して、コードが公開されるのを待ってください。

論文の宛先:
https://arxiv.org/abs/2105.13290

デモを試す:
https://lab.aminer.cn/cogview/index.html

GitHub ページ:
https://github.com/THUDM/CogView

<<:  毎秒400ペタフロップスの計算能力を備えた最速のAIコンピュータが稼働中です。宇宙最大の3Dマップが構築中

>>:  機械学習の次元削減手法で「次元の呪い」を打破する

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

北京大学の動画モデルが新たなSOTA、AIは数秒で面白いTik Tok動画の面白いポイントを理解できる

AIは面白い動画の何が面白いのかを理解できるようになりました。 AI の回答: このビデオが面白いの...

...

AIとERPが出会うとどんな「化学反応」が起こるのでしょうか?

生成型人工知能 (GenAI) は、マーケティングや販売などのさまざまなビジネス分野で人気が高まって...

大規模ディープラーニングツールの最新動向を詳しく見る

Panos Labropoulos 博士は、Bright Computing のシニア サポート エ...

自動運転車は見たことのない物体を避けることができないのか?問題はトレーニングパイプラインにある

この記事はLeiphone.comから転載したものです。転載する場合は、Leiphone.com公式...

...

PyTorch はどのようにしてデータ並列トレーニングを高速化するのでしょうか?分散型チートが明らかに

[[333298]]現在、チップのパフォーマンスの向上は限られているため、分散トレーニングは超大規模...

Facebook、ロボット開発プラットフォームDroidletをオープンソース化

最近、Facebook は、自然言語処理とコンピューター ビジョンを使用してロボットが周囲の世界を理...

「最もわかりにくい」Paxos アルゴリズムと、データベースの高可用性におけるその使用法をわかりやすい言葉で理解する

最近、Paxos アルゴリズムについてみんなが議論しています。私はオンラインで多くの記事を読みました...

スループットが約30倍に増加しました。田元東チームの最新論文は、大規模モデル展開の問題を解決している

大規模言語モデル (LLM) は今年非常に人気がありました。しかし、その驚異的な効果の背後には、巨大...

時間はお金だというのは本当です!この日本人男性は9日間で5千円を費やして「タイムマシン」を作ったが、1分巻き戻すのにかかる費用はたった1円だ。

子どもたちが小学生の頃、時間を大切にすることを教えるために、大人たちは「時間はお金であり、お金で時間...

5G時代の人工知能のホットスポットとなる業界はどこでしょうか?

このプロセスでは、多くのアプリケーションが継続的に追加されています。たとえば、コンピュータと通信の統...

Google、医療従事者が情報を素早く見つけられるようにAI検索機能を開始

10月10日、海外メディアの報道によると、Google Cloudは最近、医療従事者がさまざまな種類...

IT 業界で最も過小評価されている 6 つのテクノロジーと、まだ廃れていない 1 つのテクノロジー

翻訳者 | ジン・ヤンレビュー | Chonglou 2023 年、生成 AI、具体的には Chat...

建設技術におけるAIは潜在性があるが、まだ現実にはなっていない

建設業界がテクノロジーの導入において他の業界に遅れをとっているのは周知の事実です。 2018年の米国...