必要なパラメータはわずか1%で、その効果はControlNetを上回る。新しいAI塗装制御マスターが登場

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

「新AI塗装ディテールコントロールマスター」 ControlNet-XSが登場！

重要な点は、パラメータが元の ControlNet の1%に過ぎないことです。

ケーキのフレーバーは自由に切り替えることができます:

△左の写真は改造前

人の服装を変えることも簡単です:

上の写真と同じスタイルで、ボディの形状はそのままに、芸術的な雰囲気が溢れています。

自然の景色を楽しみながら、四季を自由に楽しむこともできます。

そして、このフクロウは、生き物から直接彫刻に変身しました。

これほど小さなパラメータでこのような効果を達成したことに、ネットユーザーは驚き、論文を読むのが待ちきれないと語りました。

ControlNet-XSはハイデルベルク大学のコンピュータビジョン研究所によって開発されました。現在のところ、関連する論文や事前トレーニング済みモデルはまだ公開されていません。

しかし研究者らは、ControlNet-XS FIDスコアはControlNetよりも大幅に優れていると述べています。

Stable Diffusion-XL と Stable Diffusion 2.1 を制御するコードは、まもなくオープンソース化される予定です。

新世代コントロールマスター

まずはStableDiffusion-XLの制御について見てみましょう。

研究者は、さまざまなサイズの制御モデルを評価した結果、制御モデルは 26 億パラメータの StableDiffusion-XL ベースネットワークと同じサイズである必要がないことを発見しました。

400M、104M、48M パラメータの ControlNet-XS 制御も明らかです。

深度マップはより直感的な表示を提供します。画像コンテンツの距離と深度に応じて、深度マップは正確な色深度を表示します。

研究者は行ごとに異なるシード値を設定しましたが、列ごとに同じシード値を設定したことに注意する必要があります。

さらに、オブジェクトの境界と輪郭を明確に表示する Canny エッジ検出マップもあります。

StableDiffusion の制御のために、研究者らは 491M、55M、および 14M パラメータを持つ 3 つのバージョンの ControlNet-XS を評価しました。

結果は、パラメータの 1.6% (865M) でも生成プロセスを確実に制御できることを示しています。

それで、これはどのように行われるのでしょうか?

ゼロからのトレーニング

オリジナルの ControlNet は、StableDiffusionベースモデルの U-Net エンコーダーのコピーであるため、エッジマップなどの追加のガイダンス信号を含むベースモデルと同じ入力を受け取ります。

トレーニングされた ControlNet の中間出力は、ベースモデルのデコーダーレイヤーの入力に追加されます。 ControlNet のトレーニングプロセス全体を通じて、ベースモデルの重みは固定されたままになります。

ControlNet-XS の研究者は、このアプローチには問題があり、ControlNet をそれほど大きくする必要はないと考えています。

最初は、一連のステップで反復的に生成される安定拡散最終出力画像です。各ステップは、U-Net ネットワーク構造のエンコーダー部分とデコーダー部分で実行されます。

各反復におけるベースモデルと制御モデルの入力は、前のステップで生成された画像です。制御モデルは制御イメージも受信します。

問題は、エンコーダーフェーズでは両方のモデルが独立して実行されるのに対し、制御モデルからのフィードバックはベースモデルのデコードフェーズでのみ入力されることです。

全体として、結果として、修正/制御メカニズムが遅延されます。

つまり、ControlNet は、基本モデルのエンコーダーがどのような「エラー」を起こすかを事前に予測しながら、修正/制御という2 つのタスクを実行する必要があります。

画像生成と制御には同様のモデル容量が必要であることを暗示することで、ControlNet の重みをベースモデルの重みで初期化し、その後微調整するのが自然です。

ControlNet-XSに関しては、設計が基本モデルとは異なり、 ControlNet-XSの重みはゼロからトレーニングされており、遅延フィードバックの問題が解決されていると研究者らは述べています。

上図に示すように、ベースモデルのエンコーダーから制御エンコーダー (A) への接続を追加することで、修正プロセスがベースモデルの生成プロセスに迅速に適応できるようにするアプローチです。しかし、ベースモデルのエンコーダーはまだブートストラップされていないため、遅延は完全には解消されません。

そのため、研究者はControlNet-XSからベースモデルエンコーダーへの接続を追加し、生成プロセス全体に直接影響を与えました（B）。

さらに、ミラー化されたデコードアーキテクチャの使用が ControlNet 設定 (C) で有用かどうかを評価しました。

最後に、研究者らは、Canny エッジとオリジナルの ControlNet によってガイドされた 3 つの異なるバリアント (A、B、C) の FID スコアパフォーマンスを COCO2017 検証セットで評価しました。

その結果、すべてのバリアントにおいて、元の ControlNet パラメータのほんの一部しか使用せずに大幅な改善が見られました。

その後、研究者らは、Canny エッジマップと深度マップをガイドとして使用してバリアント B を考案し、それぞれ StableDiffusion2.1 と StableDiffusion-XL 用にサイズの異なる 3 つのモデルをトレーニングしました。

次のステップは、関連する論文、コード、事前トレーニング済みモデルが公開されるのを待つことです〜

プロジェクトアドレス: https://vislearn.github.io/ControlNet-XS/

<<: ノーベル賞を予約しますか? DeepMind の創設者が「ノーベル賞」ラスカー賞を受賞、AlphaFold が「科学のための AI」のベンチマークに

>>: GPT-4は「逆転の呪い」から逃れられない！新しい研究で判明：大規模モデルには推論上の欠陥がある：「AはB」とわかっていても、「BはA」とは限らない

必要なパラメータはわずか1%で、その効果はControlNetを上回る。新しいAI塗装制御マスターが登場

新世代コントロールマスター

ゼロからのトレーニング

人工知能：未来への道を切り開く

VGG畳み込みニューラルネットワークモデル分析

超便利！追加のコードを書かずに依存性注入の5つの原則をマスターする

ますます大きく、さらに大きく：AI 研究は長期的には行き詰まりに陥るのでしょうか?

ディープラーニングの深層: モデリング知識とオープンソースツールのオプション

フィンテック2022年の技術トレンド：プライバシーコンピューティングが焦点、仮想人間が金融マネージャーを再構築

2018 年の 5 つの主要な AI トレンドとそのメリット

スポーツへの人工知能とビッグデータの導入は、市場を混乱させたり、破壊したりするのでしょうか?

推薦する

TS と AI が出会うと何が起こるでしょうか?

トランスフォーマーベースの効率的で低遅延のストリーミング音声認識モデル

PHPソートアルゴリズムの完全実装

大規模なモデルでプロンプト内のより多くの例を学習させたい場合は、この方法を使用すると、より多くの文字を入力できます。

機械学習：教師あり学習と教師なし学習の違いは何ですか？

ラスベガスの「チャイナナイト」：中国の人工知能が外国人に人生への疑問を抱かせ始める！

人工知能を活用するメリットと課題

自動運転AIアルゴリズムとマルチセンサー融合技術

2018年ニューリテール5大トレンド：無人小売が広がり続け、人工知能やIoTが新たな価値を創出

マイクロソフトの年次研究レビュー: ML のブレークスルーが到来、人間とコンピューターのインタラクションがより現実的に、そして Shum 氏のお別れ

機械学習チームにはより優れた特徴エンジニアリング技術が必要

Python は 2023 年のプログラミング言語リストで引き続きトップを占めています。 SQLが求人需要リストのトップに

DAMO アカデミーの 2020 年の予測: AI は知覚知能から認知知能へと進化する