Google の新しい AI が話題に!世界で最も長い単語を描くことができる

Google の新しい AI が話題に!世界で最も長い単語を描くことができる

友達、この英語の単語が何だか知っていますか?

超微細珪火山性肺炎。

これは45文字からなる世界最長の単語で、「火山性シリカ粒子が肺に沈着することで起こる病気」(一般に火山性珪肺症として知られている)を意味します。

しかし、単語を綴る代わりに、それを描くように求められたらどうでしょうか?

(読むこともできないのに、どうやって絵を描くの???)

Google の最新 AI である Parti は、このタスクを簡単に処理できます。

この単語を Parti に入力すると、肺疾患の妥当な画像がいくつか生成されます。

しかし、これはPartiの能力を試すための小さなテストに過ぎない。Googleによれば、これは現時点で最も先進的な「テキストから画像へ」AIだという。

たとえば、シドニー オペラハウスとエッフェル塔を組み合わせるように指示すると、出力は次のようになります。

(知らない人は絵だと思うかも)

また、アルゴリズムのアプローチという点でも、Google 独自の Imagen とは異なります。Parti は「AI による絵画」を新たな高みに引き上げたと言えます。

Google AI の責任者であるジェフ・ディーン氏も、とても楽しんでいる様子で、立て続けにツイートを投稿しました。

200億のパラメータまで拡張可能:より現実的で、より「インテリジェント」

実際、Parti の機能はこれを超えています。

一方では、このモデルは 200 億のパラメータまで拡張できるため、生成される画像はより詳細でリアルなものになります。

数語であっても、50 語以上の短い段落であっても、明確に表示できます。

たとえば、バイオリンの背面、バイオリンの背面。

あるいは、ゴッホの「星月夜」に描かれた夜景かもしれません。 p.s.、この段落には 67 語あります。

結果、パルティは全く問題なく、いろんな絵を描いてくれました~

これはパティの2番目に大きな能力でもあります。彼は細部にまで気を配るだけでなく、スタイルも多彩です。

「スーツを着たアライグマ、シルクハット、杖、ゴミ袋」といった奇妙な描写もあり、これもまた、細部を見失うことなく派手さを演出している。

スタイルとしては、ゴッホスタイル、エジプトのファラオスタイル、ピクセルスタイル、伝統的な中国絵画スタイル、抽象スタイルなどがあります...

時にはダジャレを言うこともあります。

(トアデイ)

特にテスト結果に関して言えば、Parti は MS-COCO および Localized Narrative (LN、4 倍長い説明) の FID スコアで最先端の結果を達成しました。

特に、MS-COCOゼロサンプルのFIDスコアはわずか7.23ですが、微調整FIDスコアは3.22であり、これは以前のImagenおよびDALL-E 2を上回っています。

すべてのコンポーネントはトランスフォーマーです

1か月後、GoogleはAIによる絵画制作を新たなレベルに引き上げたが、その秘密は非常にシンプルだと著者は語った。

Parti は、テキストから画像への生成を主にシーケンスからシーケンスへのモデリングと見なしています。これは機械翻訳に多少似ています。機械翻訳では、テキスト トークンがエンコーダーへの入力として使用され、ターゲット出力がテキストから画像に変更されます。

構造的には、すべてのコンポーネントはエンコーダー、デコーダー、イメージ タガーの 3 つの部分のみで構成され、すべて標準の Transformer に基づいています。

まず、Transformer ベースの画像タグ付けツール ViT-VQGAN を使用して、画像を個別のタグ シーケンスにエンコードします。

その後、Transformer エンコード/デコード構造を通じて、パラメータは 200 億に拡張されます。

最も初期の GAN を除いて、テキストから画像への生成に関するこれまでの研究は、おおまかに 2 つのアプローチに分けることができます。

1 つは自己回帰モデルに基づいており、最初にテキスト機能を画像機能にマッピングし、次に Transformer に似たシーケンス アーキテクチャを使用して言語入力と画像出力の関係を学習します。

このアプローチの重要なコンポーネントは、各画像を個別の単位のシーケンスに変換する画像タグ付け機能です。たとえば、DALL-E と CogView はこのアイデアを採用しました。

もう 1 つは、最近急速に進歩したルート、つまり DALL-E 2 や Imagen などの拡散ベースのテキストから画像へのモデルです。

彼らは画像タグ付けを放棄し、拡散モデルを採用して画像を直接生成しました。これらのモデルは、より高品質の画像を生成し、MS-COCO でより優れたゼロショット FID スコアを持つことがわかります。

Parti モデルの成功は、自己回帰モデルを使用してテキストから画像を生成する効果を改善できることを証明しています。

同時に、Parti は新しいベンチマークである PartiPrompts も導入し、リリースしました。これは、12 のカテゴリと 11 の課題におけるモデルの機能を測定するために使用されます。

しかし、Parti にはまだいくつかの制限があり、研究者らはいくつかのバグも実証しています。

例えば、否定を記述する方法はありません〜

バナナのない皿と、その横にオレンジジュースのないグラス。

不合理なスケーリングなど、常識的な間違いもいくつか発生します。たとえば、この写真では、ロボットはレーシングカーよりも数倍高いです。

レーシングスーツと黒いバイザーを着た光沢のあるロボットが、F1カーの前に誇らしげに立っています。街並みに太陽が沈みます。漫画本のイラスト。

Googleが自ら展開

この調査は Google Research が実施したもので、チームメンバーの大半は中国人です。

中核研究スタッフには、Yuanzhong Xu、Thang Luongなどが含まれており、いずれも現在GoogleでAI関連の研究に携わっています。

(Thang Luong は Google Scholar で 20,000 件以上の引用があります)

△左:徐元中、右:タン・ルオン

しかし興味深いのは、単語を少し言うだけで AI が絵を描ける Google アプリである Imagen が、実は Parti と密接に関連しているということです。

これは Parti の GitHub プロジェクト ドキュメントに記載されています。

Imagen のリリース前に、最新の完全な結果を共有してくれた Imagen チームに感謝します。

CF ガイダンスに関する彼らの重要な発見は、最終的な Parti モデルに特に役立ちました。

そして、『Imagen』の著者の一人である Burcu Karagol Ayan 氏も Parti 氏のプロジェクトに参加しました。

(Googleが「巻き上げ」ているように感じる)

それだけでなく、お隣のDALL-E 2の作者であるAditya Ramesh氏もParti氏とMS-COCOの評価について議論しました。

また、Parti データの作業にも協力してくれた DALL-Eval の著者にも感謝します。

もう一つ

正直に言うと、「テキストから画像を生成する」という概念は、研究者だけが好むものではありません。

ネットユーザーも「遊んで」楽しんでいます(想像力を働かせすぎないでくださいね)。

少し前にImagenさんに宋代の「虎装VR」を描いてもらったのですが、そのままAIお絵かきバトルに発展しました。

△写真:イマージェン絵画

DALL·E、MidJourneyらもこのニュースを聞いて急いで参加した。

△ アート:DALL E

Wordle と DALL-E 2 を組み合わせたものもあります。

しかし、このPartiに戻ると、楽しかったものの、一部のネットユーザーは依然として「心を打つ」疑問を投げかけている。

いつ商品化されるのでしょうか?一人で「ドアを閉めて遊ぶ」だけではつまらない。

党紙アドレス:

https://parti.research.google/

GitHub プロジェクト アドレス:

https://github.com/google-research/parti

参考リンク:

[1]https://twitter.com/lmthang/status/1539664610596225024[2]https://gizmodo.com/new-browser-game-combines-dall-e-mini-and-wordle-1849105289[3]https://imagen.research.google/​

<<:  自動運転システムにおけるエッジコンピューティング技術

>>:  AI顧客サービス指標について話す

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

インテリジェンスの時代において、企業はどのようにして「データをインテリジェンスに集めて」デジタル変革を加速できるのでしょうか?

中国ではクラウドコンピューティングが10年以上にわたって発展してきました。5G、AI、ビッグデータ、...

...

クラウドに人工知能を導入する際の 10 の考慮事項

クラウド コンピューティングは、あらゆる規模の企業がインターネット経由で多様なオンデマンドの仮想 I...

ロボットが人間を攻撃、しかしテスラはそのニュースを隠蔽?マスク氏はこう答えた。

テスラのオプティマスロボットが労働者を攻撃? !マスク氏は噂を払拭するために緊急で姿を現し、事実を歪...

2021 年のトップ 10 機械学習ライブラリ

今は人工知能爆発の時代です。AIと機械学習は広く普及しています。もちろん、機械学習の分野で最も人気の...

...

...

...

...

ニューラルネットワークの詳細な説明、順方向伝播と逆方向伝播

主にロジスティック回帰について説明します。ロジスティック回帰には多くの基本概念が含まれており、ニュー...

...

...

実践的 | この記事は、ディープラーニングをゼロから始めるのに役立ちます

この記事は、初心者の視点から始まり、真のゼロベースの視点から専門的なアドバイスとガイダンスを提供する...

星が輝くとき - WOT グローバル テクノロジー イノベーション カンファレンス 2021 が間もなく開催されます

【51CTO.comオリジナル記事】​​​ 100年前、シュテファン・ツヴァイクは彼の有名な著作「星...

ほとんどの企業はユーザーの同意を得ずに顔認識機能を使用している

顔認証機能の利用にあたり、利用者の同意を得ていない企業が半数近くあるというデータもある。ビッグデータ...