必要なパラメータはわずか1%で、その効果はControlNetを上回る。新しいAI塗装制御マスターが登場

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

「新AI塗装ディテールコントロールマスター」 ControlNet-XSが登場！

重要な点は、パラメータが元の ControlNet の1%に過ぎないことです。

ケーキのフレーバーは自由に切り替えることができます:

△左の写真は改造前

人の服装を変えることも簡単です:

上の写真と同じスタイルで、ボディの形状はそのままに、芸術的な雰囲気が溢れています。

自然の景色を楽しみながら、四季を自由に楽しむこともできます。

そして、このフクロウは、生き物から直接彫刻に変身しました。

これほど小さなパラメータでこのような効果を達成したことに、ネットユーザーは驚き、論文を読むのが待ちきれないと語りました。

ControlNet-XSはハイデルベルク大学のコンピュータビジョン研究所によって開発されました。現在のところ、関連する論文や事前トレーニング済みモデルはまだ公開されていません。

しかし研究者らは、ControlNet-XS FIDスコアはControlNetよりも大幅に優れていると述べています。

Stable Diffusion-XL と Stable Diffusion 2.1 を制御するコードは、まもなくオープンソース化される予定です。

新世代コントロールマスター

まずはStableDiffusion-XLの制御について見てみましょう。

研究者は、さまざまなサイズの制御モデルを評価した結果、制御モデルは 26 億パラメータの StableDiffusion-XL ベースネットワークと同じサイズである必要がないことを発見しました。

400M、104M、48M パラメータの ControlNet-XS 制御も明らかです。

深度マップはより直感的な表示を提供します。画像コンテンツの距離と深度に応じて、深度マップは正確な色深度を表示します。

研究者は行ごとに異なるシード値を設定しましたが、列ごとに同じシード値を設定したことに注意する必要があります。

さらに、オブジェクトの境界と輪郭を明確に表示する Canny エッジ検出マップもあります。

StableDiffusion の制御のために、研究者らは 491M、55M、および 14M パラメータを持つ 3 つのバージョンの ControlNet-XS を評価しました。

結果は、パラメータの 1.6% (865M) でも生成プロセスを確実に制御できることを示しています。

それで、これはどのように行われるのでしょうか?

ゼロからのトレーニング

オリジナルの ControlNet は、StableDiffusionベースモデルの U-Net エンコーダーのコピーであるため、エッジマップなどの追加のガイダンス信号を含むベースモデルと同じ入力を受け取ります。

トレーニングされた ControlNet の中間出力は、ベースモデルのデコーダーレイヤーの入力に追加されます。 ControlNet のトレーニングプロセス全体を通じて、ベースモデルの重みは固定されたままになります。

ControlNet-XS の研究者は、このアプローチには問題があり、ControlNet をそれほど大きくする必要はないと考えています。

最初は、一連のステップで反復的に生成される安定拡散最終出力画像です。各ステップは、U-Net ネットワーク構造のエンコーダー部分とデコーダー部分で実行されます。

各反復におけるベースモデルと制御モデルの入力は、前のステップで生成された画像です。制御モデルは制御イメージも受信します。

問題は、エンコーダーフェーズでは両方のモデルが独立して実行されるのに対し、制御モデルからのフィードバックはベースモデルのデコードフェーズでのみ入力されることです。

全体として、結果として、修正/制御メカニズムが遅延されます。

つまり、ControlNet は、基本モデルのエンコーダーがどのような「エラー」を起こすかを事前に予測しながら、修正/制御という2 つのタスクを実行する必要があります。

画像生成と制御には同様のモデル容量が必要であることを暗示することで、ControlNet の重みをベースモデルの重みで初期化し、その後微調整するのが自然です。

ControlNet-XSに関しては、設計が基本モデルとは異なり、 ControlNet-XSの重みはゼロからトレーニングされており、遅延フィードバックの問題が解決されていると研究者らは述べています。

上図に示すように、ベースモデルのエンコーダーから制御エンコーダー (A) への接続を追加することで、修正プロセスがベースモデルの生成プロセスに迅速に適応できるようにするアプローチです。しかし、ベースモデルのエンコーダーはまだブートストラップされていないため、遅延は完全には解消されません。

そのため、研究者はControlNet-XSからベースモデルエンコーダーへの接続を追加し、生成プロセス全体に直接影響を与えました（B）。

さらに、ミラー化されたデコードアーキテクチャの使用が ControlNet 設定 (C) で有用かどうかを評価しました。

最後に、研究者らは、Canny エッジとオリジナルの ControlNet によってガイドされた 3 つの異なるバリアント (A、B、C) の FID スコアパフォーマンスを COCO2017 検証セットで評価しました。

その結果、すべてのバリアントにおいて、元の ControlNet パラメータのほんの一部しか使用せずに大幅な改善が見られました。

その後、研究者らは、Canny エッジマップと深度マップをガイドとして使用してバリアント B を考案し、それぞれ StableDiffusion2.1 と StableDiffusion-XL 用にサイズの異なる 3 つのモデルをトレーニングしました。

次のステップは、関連する論文、コード、事前トレーニング済みモデルが公開されるのを待つことです〜

プロジェクトアドレス: https://vislearn.github.io/ControlNet-XS/

<<: ノーベル賞を予約しますか? DeepMind の創設者が「ノーベル賞」ラスカー賞を受賞、AlphaFold が「科学のための AI」のベンチマークに

>>: GPT-4は「逆転の呪い」から逃れられない！新しい研究で判明：大規模モデルには推論上の欠陥がある：「AはB」とわかっていても、「BはA」とは限らない

必要なパラメータはわずか1%で、その効果はControlNetを上回る。新しいAI塗装制御マスターが登場

新世代コントロールマスター

ゼロからのトレーニング

AIOps で IT 運用にインテリジェンスを組み込む方法

知識とスキルの限界を押し広げる 24 の機械学習プロジェクト

2020 年の AI トレンドトップ 10

人工知能が建設業界の様相を変えている

パフォーマンスが最大480倍向上：Armが2つの新しいAIエッジコンピューティングチップ設計を発表

やめる！ Google は米国国防総省の 100 億ドルの契約への入札を断念しました。

この戦略は不安定なGANを安定させるのに役立ちます

2030 年までに人工知能はどのようになるでしょうか?

AIが人々の職場復帰を支援：重慶の音声ロボット、北京の無人配達、広州の顔認識体温測定

推薦する

C# アルゴリズムアプリケーションでのガウス消去法の実装

仕事でアルゴリズムが使われることはほとんどないので、なぜアルゴリズムを学ぶ必要があるのでしょうか?

AIが銀行業務をどう変えるか

4Dミリ波レーダーSLAMソリューション研究

AIはあなたの建物をスマートで健康的な建物にします

ヒット曲予測の成功率は97%？このリストは「偽造品と戦う」ためにあります

Google は人工知能の分野で「堀」を持っていないのでしょうか?

自動運転車におけるセンサー応用に関する重要な考慮事項

機械翻訳の3つのコア技術原則 | AI知識の普及

人工知能は広告に関して私たちを誤解させている。今こそ誤りを正すべき時だ

今週の土曜日、JD.comとShanshan Fanyuの技術専門家がブロックチェーンの応用シナリオを解説します。