1.4GB 未満のビデオ メモリで 10,000 フレームのビデオをセグメント化します。コードは現在オープン ソースです。

1.4GB 未満のビデオ メモリで 10,000 フレームのビデオをセグメント化します。コードは現在オープン ソースです。

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

なあ、藤原千花はなんで急に「高温レッドバージョン」になったんだ?

この大きな紫色の手はサノスの生まれ変わりなのでしょうか? ?

上記の効果が単にオブジェクトの後処理による色付けだと考えているなら、あなたは AI に騙されています。

これらの奇妙な色は、実際にはビデオ オブジェクトのセグメンテーションを表しています。

しかし、u1s1、この効果は一見すると本当にわかりにくいです。

可愛い女の子の髪が舞い散ったり、

または、タオルの形状が変わり、物体が互いに遮られることがあります。

AI によるターゲットのセグメンテーションは、まるで色が「溶接」されているかのようにシームレスであると言えます。

この方法は、オブジェクトを高精度にセグメント化できるだけでなく、 10,000 フレームを超えるビデオを処理することもできます。

さらに、セグメンテーション効果は常に同じレベルに保たれ、ビデオの後半部分は依然としてスムーズで繊細です。

さらに驚くべきことは、この方法では高い GPU 要件が必要ないことです。

研究者らは、実験中、この方法では1.4GBを超える GPU メモリが消費されることはなかったと述べています。

現在のアテンション メカニズムに基づく同様の方法では、一般的な消費者向けグラフィック カードでは 1 分を超えるビデオを処理することすらできないことに注意してください。

これは、イリノイ大学アーバナ・シャンペーン校の学者によって最近提案された、長時間ビデオ オブジェクト分割方法XMemです。

ECCV 2022に承認され、コードはオープンソース化されました。

このような滑らかな効果は、Reddit で多くのネットユーザーを魅了し、人気は 800 を超えました。

ネットユーザーは冗談を言っている。

なぜ手を紫色に塗るのですか?

サノスがコンピュータービジョンを趣味としているかどうか知っている人はいますか?

人間の記憶を模倣する

既存のビデオ オブジェクト セグメンテーション方法は多数ありますが、処理速度が遅かったり、GPU に対する要件が高かったり、精度が十分でなかったりします。

本論文で提案する方法は、上記3つの側面を考慮していると言えます。

長い動画内のオブジェクトを素早くセグメント化できるだけでなく、フレームレートは 20FPS に達し、通常の GPU でも完了できます。

特別なのは、人間の記憶パターンにインスピレーションを得ていることです。

1968年、心理学者のアトキンソンとシフリンはアトキンソン-シフリン記憶モデルを提唱しました。

このモデルでは、人間の記憶は瞬間記憶、短期記憶、長期記憶の 3 つのモードに分けられると考えられています。

研究者らは上記のモデルを参考に、AIフレームワークを3つのメモリモードに分割しました。彼らです:

  • リアルタイムで更新される瞬時メモリ
  • 高解像度のワーキングメモリ
  • 高密度の長期記憶。

このうち一時メモリは、画像内の画像情報を記録するためにフレームごとに 1 回更新されます。

作業メモリは一時メモリから画像情報を収集し、r フレームごとに更新されます。

作業記憶が飽和すると、圧縮されて長期記憶に移されます。

長期記憶が飽和状態になると、古くなった特徴は時間の経過とともに忘れ去られます。通常、これは数千のフレームを処理した後に発生します。

こうすることで、時間の経過とともに GPU メモリが不足することがなくなります。

通常、ビデオ内のオブジェクトのセグメンテーションは、最初のフレームに画像とオブジェクト マスクを指定して実行され、その後、モデルが関連するオブジェクトを追跡し、後続のフレームに対応するマスクを生成します。

具体的には、XMem が 1 つのフレームを処理するプロセスは次のとおりです。

AI フレームワーク全体は、3 つのエンドツーエンドの畳み込みネットワークで構成されています。

クエリ エンコーダーは、クエリ固有の画像機能を追跡および抽出するために使用されます。

デコーダーは、メモリ読み取りステップの出力を取得してオブジェクト マスクを生成する役割を担います。

値エンコーダーは、画像とターゲット マスクを組み合わせて、新しいメモリ機能を抽出します。

最終値エンコーダーによって抽出された特徴値は作業メモリに追加されます。

実験結果から判断すると、この方法は短いビデオと長いビデオの両方で SOTA を達成しました。

長いビデオを処理する場合、フレーム数が増えても XMem のパフォーマンスは低下しません。

研究チーム

著者の一人は中国人のHo Kei (Rex) Chengです。

彼は香港科技大学で修士号を取得し、現在はイリノイ大学アーバナ・シャンペーン校で博士課程に在籍しています。

彼の研究分野はコンピュータービジョンです。

彼の論文のいくつかは、CVPR、NeurIPS、ECCV などのトップカンファレンスで採択されています。

もう一人の著者は Alexander G. Schwing です。

彼は現在、イリノイ大学アーバナ・シャンペーン校の助教授であり、ETHチューリッヒで博士号を取得しています。

彼の研究対象には機械学習とコンピュータービジョンが含まれます。

論文の宛先:
https://arxiv.org/abs/2207.07115

GitHub:
https://github.com/hkchengrex/XMem

<<:  気温を下げて干ばつを緩和するブラックテクノロジーが多数存在します。人工降雨の謎とは?

>>:  農業ロボットは好機を迎え、10億ドル規模のビジネスになりつつある

ブログ    
ブログ    

推薦する

機械学習が通信業界にもたらすメリット

通信分野における機械学習技術は、ネットワーク事業者がサービス品質を向上させ、利益を増やし、顧客離れを...

...

...

劉強東氏は「10年で8万人を解雇する」という噂を否定するが、人工知能は無人企業を実現できると語る

最近、「JD.comが今後10年間で8万人の従業員を解雇する」というニュースがネット上で広まった。こ...

フィンテック企業はリスク管理に AI をどのように活用しているのでしょうか?

[51CTO.com からのオリジナル記事] 金融テクノロジーのブームは 21 世紀以降急増してい...

2020年に注目すべき10のAIトレンド

今後 1 年間で AI テクノロジーはどのように進化するのでしょうか。組織が注目すべき主要な AI ...

AIが書いた記事は教師を本当に騙すことができる

過去数年間、機械学習 (ML) と人工知能 (AI) の専門家は、以前は完全に人間が実行できると考え...

国内初の大規模模造品対策訴訟:アリババクラウドが偽造同義千聞アプリを提訴、一審で勝訴

1月16日、中国における大型モデルの偽造品撲滅活動で初の成功事例が発表された。アリババクラウドとアリ...

...

脚本を書いて、AIが動画を自動編集:編集者の7時間かけて作成した動画を13分で完成

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

2021 年にグラフ機械学習にはどのような新たなブレークスルーがあるでしょうか?マギル大学のポスドク研究員が分野の動向を整理

[[443041]]今年ももうすぐ終わり、あと3日で2021年も終わりです。さまざまなAI分野でも...

10年前、古典的なword2vec論文が今日のNeurIPSタイムテスト賞を受賞しました

NeurIPS は世界で最も権威のある AI 学術会議の 1 つです。正式名称は Neural In...

ビッグデータとアルゴリズムについて言えば、これらを知っておくことはあなたにとって大きな利益となるでしょう

この記事では、ビッグデータ アルゴリズムを理解するプロセスをまとめます。本文は、アルゴリズムに関する...

IBM Cloud Pak for Data 4.0 で大規模なインテリジェント オートメーションを統合

あなたのビジネスが本当に予測可能かどうか、そしてデータ担当者、モデル、アプリケーションが適切なデータ...