ビデオ通話の低品質なビデオとはおさらば: NVIDIA の新しいアルゴリズムはトラフィックを最大 90% 圧縮できます

ビデオ通話の低品質なビデオとはおさらば: NVIDIA の新しいアルゴリズムはトラフィックを最大 90% 圧縮できます

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

Nvidia は、インターネット速度が遅いユーザーでも高画質通話が利用できるようにするために知恵を絞った。彼らが開発した新しい AI アルゴリズムは、ビデオ通話のトラフィックを最大 90% 圧縮できます。

他の動画と比べると、通話シーンは比較的シンプルで、基本的に人物の頭だけが動いている。そのため、アバターデータを大規模に圧縮できれば、トラフィックを大幅に節約できます。

Nvidia の新しいアルゴリズムface vid2vid はこの点から始まります。たった一枚の写真で、様々な頭部ポーズの写真を再現することが可能です。

H.264 ビデオに必要な帯域幅は、この新しいアルゴリズムの2 ~ 12 倍です。前のデモからわかるように、2 つが同じビット レートを使用する場合、H.264 ビデオはほとんど使用できなくなります。

歪みなく顔を回転させる

NVIDIA では、Pitch (ピッチ角)、Yaw (ヨー角)、Roll (ロール角) の 3 方向に任意に回転できる試用デモを提供しています。

顔を入力し、各方向に最大 30 度回転します。以下は3方向に最大角度まで回転させて生成した画像です。

従来の方法と比較すると、Nvidia の技術では、顔が大きく回転しても顔が歪むことはありません。

しかし、写真は結局のところ静止画であり、生成された顔を動画に組み込むには追加の手順が必要です。

顔動画の合成

アップロードされた鮮明な写真をソース画像として取り込み、そこから外観の特徴を取得します。次に、ビデオ内の各フレームがビデオを再構築するための基礎として使用され、そこから顔の表情や頭の姿勢などの情報が抽出されます。

表情と姿勢の 2 つのデータをキーポイントを通じてエンコードできるため、キャラクターのアイデンティティ情報とモーション情報を分離できます。ビデオを送信する場合、モーション情報のみが必要なので、トラフィックを節約できます。

ソース画像 s からは、キーポイント座標 x とヤコビ行列 J の 2 つのデータ セットが取得されます。これら 2 つのパラメータ セットは、顔の特定の特徴とは関係がなく、人物の幾何学的特徴のみを含みます。

ヤコビ行列は、アフィン変換によってキーポイントの周囲のローカル パッチを別の画像のパッチに変換する方法を表します。恒等ヤコビアンの場合は、パッチをコピーして新しい場所に貼り付けるだけです。

下の図は、最初の 5 つの重要なポイントを計算するプロセスを示しています。ソース画像とモデルによって予測された標準的なキーポイントが与えられます。

モーションビデオから推定された回転と移動がキーポイントに適用され、頭部の姿勢の変化を駆動します。すると表情の変形を感知し、目的の表情に合わせてキーポイントを調整することができます。

次に、ビデオの合成を開始します。フロー wk は、ソースとモーションのキーポイントとそれらのヤコビ行列を使用して推定され、マスク m は生成されたフローから結合されます。2 つのセットは線形に結合され、合成フロー フィールド w を生成します。

次に、顔の特徴 f を入力して出力画像 y を生成します。

この方法はビデオ通話だけでなく、他の「新しい遊び方」にも使えます。

例えば、肖像画が少し歪んでいると思ったら、修正データを手動で入力して顔をまっすぐにすることができます。

あるいは、ある人物の顔の特徴点とヤコビ行列を別の人物に使用して、顔のビデオの動きの移行を実現することもできます。

チームについて

この記事の第一著者は、NVIDIA の上級研究員である Ting-Chun Wang 氏です。

[[355324]]

この記事の責任著者は、NVIDIA の著名な研究者である Liu Mingyu 氏です。

[[355325]]

長い間 CV 分野に注目してきた方であれば、この 2 人の著者のことをよくご存知のはずです。彼らは、画像スタイルの転送、GAN などで多くの作業を行ってきました。

△ ガウガン

二人はこれまで何度もコラボレーションしてきた。例えば。教師なし画像転送ネットワーク(NIPS 2017)と、落書きから写真を生成するGauGAN(CVPR 2019)は、どちらもこの2人の手によるものです。

プロジェクトページ: https://nvlabs.github.io/face-vid2vid/

論文アドレス: https://arxiv.org/abs/2011.15126

<<:  米国が新たなオープンソースAIアルゴリズムを開発:モザイクの美しさを自動修復

>>:  強化学習アルゴリズムの分類をさまざまな観点から理解します

ブログ    
ブログ    

推薦する

人工知能は科学研究に革命を起こす力を持っている

人工知能 (AI) は、コンピューター サイエンス、数学、心理学、言語学などの分野が関わる学際的な分...

失業は避けられないのでしょうか? AI時代、人類が将来やるべきことは2つだけ

Sinovation Venturesの李開復氏は「2017年中国企業100%年次大会」で講演し、「...

...

機械学習のプライバシー研究における新たな進歩: データ強化のリスクは過小評価されており、新しいアルゴリズムは次元依存性を「克服」します

編集者注: 今日、データは人工知能のイノベーションを推進する中核的な要素です。ただし、データのセキュ...

Metaが新しいモバイルAIジェネレーターを公開、5分でAIアプリを作成、AndroidとiOSの両方をサポート

最近、毎年恒例の PyTorch 開発者会議が開催されました。このカンファレンスでは、Meta(旧F...

Java プログラミング スキル - データ構造とアルゴリズム「再帰」

[[392763]]コンセプト簡単に言うと、再帰とは、毎回異なる変数を渡しながら、自身を呼び出すメ...

...

バイオメディカルホログラフィックイメージング用の RNN が 50 倍高速化

[[407014]]デジタル ホログラフィーは、生物医学イメージングでよく使用される顕微鏡技術です。...

機械学習とディープラーニングの違いを簡単に分析する

【51CTO.com クイック翻訳】 [[379353]]現代社会に人工知能の波が押し寄せる中、機械...

AI の透明性とは何ですか? また、なぜそれが必要なのですか?

AI テクノロジーを利用する組織はますます増えていますが、多くの企業はまだ AI テクノロジーの仕...

PHP+MySQL アプリケーションで XOR 暗号化アルゴリズムを使用する

この記事では、排他的論理和 (XOR) 演算を使用したシンプルで使いやすい暗号化/復号化アルゴリズム...

人工知能と機械学習は、組織がデジタルシステムを運用する上でますます重要になる

[[280794]]いくつかの困難や障害にもかかわらず、多くの企業がデジタル変革プロジェクトで大きな...

スマートサーマルイメージングカメラは屋外セキュリティソリューションの第一選択肢となる

スマートサーマルイメージングカメラは、屋外の資産を保護するための侵入者検知ソリューションとして急速に...

役に立つ知識の無用性:AI技術は現代の錬金術か?

[[431348]]人工知能は新時代の錬金術となるのか?著名なAI研究者のアリ・ラヒミ氏らによると...