韓国のガールズグループBLACKPINKが2次元に入ったとき、清華フォーク研究所のAIアーティファクトはこのようにプレイできることが判明

韓国のガールズグループBLACKPINKが2次元に入ったとき、清華フォーク研究所のAIアーティファクトはこのようにプレイできることが判明

携帯電話に写真編集ソフトウェアがインストールされている場合は、その中の「AI ペイント」機能を使用したことがあるかもしれません。通常、写真をアニメスタイルや写真スタイルなどのさまざまなスタイルに変換するためのオプションがいくつか用意されています。しかし今では、ビデオでも同じことが可能になりました。

これらのアニメーション画像は、X プラットフォーム (旧 Twitter) のユーザーである @CoffeeVectors が作成したビデオから取得されています。彼は韓国ガールズグループBLACKPINKの代表作「DDU-DU DDU-DU」のオリジナルMVをAIツールに入力し、すぐにMVのアニメーションバージョンを手に入れた。

完全な効果は次のようになります。

このビデオは、ComfyUI というツールを利用して作成されました。 ComfyUI は、広く採用されている Wenshengtu AI モデル Stable Diffusion 用のオープンソース GUI ベースのワークフロー視覚化エンジンです。複数の安定拡散モデルとそのハイパーネットワークを完全なワークフローに組み合わせて、自動画像生成と最適化を実現できる、ユーザーフレンドリーなグラフィカル インターフェイスを提供します。同時に、コミュニティは ComfyUI の機能をさらに強化するために、さまざまな拡張プラグインも開発しました。

作者の @CoffeeVectors は、この MV を制作する際に、AnimateDiff と ComfyUI のマルチコントロールワークフローを使用したと述べています。前者はアニメスタイルの生成に使用され、後者は生成されたエフェクトの制御に使用されました。さらに重要なことに、彼はこのワークフローで非常に人気のあるアーティファクトである LCM LoRA を導入しました。

「リアルタイムのテキストから画像への処理速度が5~10倍向上。清華LCM/LCM-LoRAが人気に、閲覧回数100万回以上、ダウンロード数20万回以上」という記事では、LCMは清華大学学際情報科学研究所の研究者が構築した新しいモデルであり、テキストから画像への処理と画像から画像への処理の効果が極めて速く、テキスト指示やスケッチ指示に従ってリアルタイムで新しい画像を生成できることが特徴であると紹介しました。

これを基に研究者らは、追加のトレーニングなしで LCM の高速生成機能を他の LoRA モデルに転送できる LCM-LoRA をさらに開発しました。その効果が非常に素晴らしいため、このモデルはHugging Faceプラットフォーム上で20万回以上ダウンロードされており、LCM-LoRAによって生成されたリアルタイムのビデオ効果はXプラットフォーム上のあらゆる場所で見ることができます(下のビデオを参照)。

それで、このアニメバージョンのMVはどうやって作られたんですか? @CoffeeVectors は投稿で彼のアプローチを詳しく説明しました。

@CoffeeVectors は、オリジナルの MV ビデオをダウンロードした後、BLACKPINK の MV 全体を 1 つの .mp4 入力として処理しました。 LCM を使用すると、4090 で 6 ステップでレンダリングでき (以前は 20 ステップ以上必要でした)、VRAM を 10.5 GB しか消費しません。詳細データは次のとおりです。

レンダリング プロセス全体には 81 分かかり、合計 2,467 フレームが生成され、各フレームには約 2 秒かかりました。これには、ビデオから画像シーケンスを抽出し、ControlNet マップを生成する時間は含まれません。 Zoe Depth と Canny ControlNet は、解像度 910 x 512 の SD バージョン 1.5 で使用されました。

出力を改善して、より独特なスタイル、より豊かなディテール、ロトスコープ感の少ないものにするには、個々のフレームを調整する必要があります。ただし、ビデオ全体を一度に完成させると、繰り返し作業できる下書きが作成されます。

入力ビデオについては、12 フレーム/秒という目標を達成するために、1 つおきのフレームを選択しました。

以下は @CoffeeVectors が LCM LoRA を追加しているスクリーンショットです。彼は Checkpoint に組み込まれている VAE を選択しました。

彼は、さまざまなレンズにどれだけ適合するかを確認したかったので、非常に一般的な方法でヒントを書きました。

K サンプラーでは、LCM サンプラーを使用しました。このサンプラーを使用するには、ComfyUI を最新バージョンに更新する必要があることに注意してください。

次の図は、@CoffeeVectors がマルチコントロール ネットのノードをどのように配置するかを示しています。

最後に、@CoffeeVectors はいくつかの関連チュートリアルも推奨しています。

  • ビデオチュートリアル: https://www.youtube.com/watch?app=desktop&v=zrxd95Mxz24
  • 技術ブログ: https://huggingface.co/blog/lcm_LoRA

この種の技術的なアプリケーションに興味のある開発者は、すぐに試すことができます。

<<: 

>>:  データが「生産手段」となるとき、透かし技術を使ってAIトレーニングデータの著作権を保護する方法をまとめた3つの論文

ブログ    

推薦する

汎用聴覚AIのロックを解除します!清華大学電子工学部とVolcano Voiceが共同で新しい認知指向の聴覚言語モデルをオープンソース化

最近、清華大学電子工学部と Volcano Voice チームが協力して、認知指向のオープンソース聴...

AIは5Gネットワ​​ークの管理にどのように活用されるのか

AI は、モノのインターネットやプライベート 5G ネットワークなど、複数の用途をサポートするために...

ボストン・ダイナミクスのロボット犬「スポット」が新たなスキルを獲得:縄跳びや服拾い

海外メディアCNETによると、ボストン・ダイナミクスのロボット犬「スポット」はすでにダンス、鉱山探索...

アンドリュー・ン氏の最新の予測: AIに関するこれらのことは今後10年間は​​変わらない

2024年にはAIの発展はどのように変化するのでしょうか?アンドリュー・ン氏は最新の手紙の中で、今後...

...

4つのPythonソートアルゴリズムをマスターする

プログラミングにおいて、ソートはデータをより速く簡単に見つけるのに役立つ重要なアルゴリズムです。この...

人工知能はどのように農業の発展を促進できるのでしょうか?

古代より、農業は人類の生存の基盤であり、国家経済の基盤となってきました。しかし、人口の急速な増加、耕...

米メディア記事:米中AI競争は東南アジアにとって何を意味するのか?

2月7日、アメリカの外交政策ウェブサイトは「米中人工知能競争は東南アジアにとって何を意味するのか?...

...

...

AI向けに構築されたコンピューターに最適なアクセサリと外部コンポーネント

[[435844]]人工知能用に構築されたコンピュータ システムに最適なアクセサリとコンポーネントは...

多くの競争者が競い合う中、自動運転をめぐる戦いが始まる!

著者: 張傑[51CTO.comより引用] 2020年と比べると、2021年の自動運転業界にはよりエ...

GPT-4Vと人間のデモンストレーションによるロボットのトレーニング:目が学習し、手がそれに従う

言語/視覚入力をロボットの動作に変換するにはどうすればよいでしょうか?カスタムモデルをトレーニングす...

...