安定的な動画拡散をリリースしました！ 3D合成機能が注目を集める、ネットユーザー「進歩が速すぎる」

安定拡散当局はついにこのビデオに対して行動を起こした――

生成ビデオモデルStable Video Diffusion (SVD)をリリースしました。

Stability AI の公式ブログによると、新しい SVD はテキストからビデオへの生成と画像からビデオへの生成をサポートしているそうです。

また、オブジェクトを単一の視点から複数の視点に変換する、つまり3D 合成もサポートしています。

外部の評価によると、SVDはRunwayやPikaの動画生成AIよりもユーザーに人気があると公式は主張している。

現時点では基本モデルのみが公開されているが、担当者は「今後も拡大を続け、Stable Diffusionと同様のエコシステムを構築する計画がある」と明かした。

紙のコード重量がオンラインになりました。

最近、動画生成の分野では新しい遊び方が次々と登場しています。今回はStable Diffusionの番です。ネットユーザーの第一反応は「速い」で、進歩が速すぎるほどです。

しかし、デモの影響だけから判断すると、あまり驚かないというネットユーザーの方が多かった。

私は SD が大好きで、これらのデモは素晴らしいのですが... いくつか欠陥があり、照明がオフで、全体的に途切れ途切れの要素(ビデオフレーム間のちらつき)があります。

全体として、これはまだ始まりに過ぎず、ネットユーザーは SVD の 3D 合成機能について非常に楽観的です。

すぐにもっと良いものが登場するでしょう。説明するだけで完全な 3D シーンが得られるのです。

SDビデオ正式版が登場

上記に加えて、公式ではさらに多くのデモもリリースされています。まずはそれらを見てみましょう。

宇宙遊泳も計画されています。

背景を静止したまま、2羽の鳥だけを動かすこともできます。

SVDに関する研究論文も公開されています。SVDはStable Diffusion 2.1をベースにしており、約6億サンプルのビデオデータセットで基本モデルを事前トレーニングしたと報告されています。

マルチビューデータセットを微調整することで、単一の画像からマルチビューを合成するなど、さまざまな下流タスクに簡単に適応できます。

微調整の後、公式発表では、3～30 fps のカスタムフレームレートで 14 fps (SVD) および 25 fps (SVD-XT) のビデオを生成できる 2 つの画像からビデオへのモデルが発表されました。

その後、SVD-MV と呼ばれるマルチビュービデオ生成モデルを微調整しました。

テスト結果によると、GSO データセットでは、SVD-MV はマルチビュー生成モデル Zero123、Zero123XL、SyncDreamer よりも優れたスコアを獲得しました。

なお、Stability AI は、SVD は現在研究に限定されており、実用的または商業的なアプリケーションには適していないと述べています。 SVD はまだすべての人が利用できるわけではありませんが、ユーザー待機リストへの登録は開始されています。

ビデオ世代の爆発的増加

最近、ビデオ生成の分野ではちょっとした無差別競争が起きています。

以前は、 PikaLabsによって開発された Vincent Video AI がありました。

その後、史上最強の動画生成AIと言われるMoonvalleyが発売されました。

最近、Gen-2 の「モーションブラシ」機能が正式にリリースされ、指した場所に何でも描画できるようになりました。

現在ではSVDが再び登場し、再び3Dビデオを生成できるようになりました。

しかし、テキストから3D生成に関してはあまり進歩がないようで、ネットユーザーもこの現象に困惑している。

データは開発を妨げるボトルネックであると考える人もいます。

一部のネットユーザーは、強化学習が十分に強力ではないことが理由だと述べた。

家族はこの件に関する最新の動向を知っていますか?コメント欄でのシェアを歓迎します〜

論文リンク: https://static1.squarespace.com/static/6213c340453c3f502425776e/t/655ce779b9d47d342a93c890/1700587395994/stable_video_diffusion.pdf

<<: 大規模モデルの観点から見た因果推論

>>: ChatGPTの最強のライバルのアップデート！コンテキストの長さは 2 倍になり、API 価格は 30% 近く下がりました。

コストを70%削減する秘訣: これらの企業はAIをコスト効率よく活用する方法を見つけました

安定的な動画拡散をリリースしました！ 3D合成機能が注目を集める、ネットユーザー「進歩が速すぎる」

SDビデオ正式版が登場

ビデオ世代の爆発的増加

コストを70%削減する秘訣: これらの企業はAIをコスト効率よく活用する方法を見つけました

音声認識：市場の見通しは有望だが、コア技術にはまだブレークスルーが必要

「5つの一般的なアルゴリズム」分岐アルゴリズムとアイデアを図解で紹介

米議会は来月AIサミットを開催し、マスク氏をはじめとする多くの有力者が出席すると報じられている。

NLP 70 年!スタンフォード大学のマニング教授が長文の記事を執筆：「基本モデルは10年でAGIになることができるか？」

人工知能、遺伝子編集、ノーベル賞の画期的な進歩により、80歳でも40歳に見えるようになる

畳み込みニューラルネットワークの設計を始めたいですか?これは包括的なデザインガイドです

スタンフォード大学とOpenAIがメタプロンプティングを提案し、最も強力なゼロショットプロンプティング技術が誕生した。

2 ステップで 25 フレームの高品質アニメーションを生成 (SVD の 8% として計算) | オンラインでプレイ可能

推薦する

ロボットは銀行業務を破壊するのか？

人工知能（AI）時代に誰もが身につけるべき9つのソフトスキル

ドローンはどうやって夏の「蚊との戦い」に勝つのでしょうか?これら3つのポイントを達成する必要があります。

人工知能の時代において、中国語と英語のどちらがAIの母国語になるのでしょうか？

意思決定インテリジェンス: 人工知能における新たな方向性

AI モデルに新たな革命が起こるのでしょうか?脳の記憶は回転するのでしょうか？過去と未来は実際には「直交」した空間である

2018年に人工知能はどのように発展するでしょうか?世界中のトップ20人の専門家がこう言う

ブロックチェーン科学: 非対称暗号化、楕円曲線暗号

人工知能が持続可能な開発を推進する5つの方法

MetaGPT AIモデルオープンソース：ソフトウェア会社の開発プロセスをシミュレートし、高品質のコードを生成できます

AIのための大規模ストレージインフラストラクチャの要件

25年間の素晴らしい実績！ MITの科学者はコンピューターに創造性を与え、ロボットの形状を自動設計させる

ニューラルネットワーク？決定木？できないよ！説明可能な AI を解決できるのは誰か?

鵬城クラウドブレインは鵬城シリーズの大型モデルの基礎研究をサポート