フーリエ演算子効率トークンミキサー: 軽量ビジュアルネットワークの新しいバックボーン

フーリエ演算子効率トークンミキサー: 軽量ビジュアルネットワークの新しいバックボーン

1. 背景

近年、Transformer、Large-kernel CNN、MLP に基づく 3 つのビジュアル バックボーン ネットワークは、世界規模での効率的な情報融合機能により、幅広い CV タスクで目覚ましい成功を収めています。

既存の主流ニューラル ネットワークである Transformer、CNN、MLP は、それぞれ独自の方法でグローバル トークンの融合を実現します。その中で、Transformer ネットワークの自己注意メカニズムは、クエリとキーのペアの関連性をトークン融合の重みとして使用します。 CNN はカーネル サイズを大きくすることでトランスフォーマーと同様のパフォーマンスを実現します。 MLP は、すべてのトークン間の完全な接続を通じて、もう 1 つの強力なパラダイムを実装します。これらの方法はすべて効果的ですが、計算の複雑度が高く (O (N^2))、ストレージと計算能力が限られているデバイスに展開するのが難しいため、多くのモデルの適用範囲が制限されます。

2. AFFトークンミキサー:軽量、グローバル、適応型

計算コストのかかる問題を解決するために、研究者らは適応型フーリエフィルタ (AFF) と呼ばれる効率的なグローバル トークン融合演算子を構築しました。フーリエ変換によりトークンセットを周波数領域に変換し、周波数領域でコンテンツ適応型フィルタマスクを学習して、周波数領域空間に変換されたトークンセットに対して適応型フィルタリング操作を実行します。

論文: 効率的なグローバル トークン ミキサーとしての適応型周波数フィルタ

リンク: https://arxiv.org/abs/2307.14008

周波数領域畳み込み定理によれば、元の領域での畳み込み演算は、フーリエ領域での対応するアダマール積演算と数学的に同等です。これにより、本研究で提案された AFF トークン ミキサーは、トークン セットのサイズと同じ空間解像度を持つ動的畳み込みカーネルを使用して元のドメインでトークン フュージョンを実行することと数学的に同等になり (下の右側のサブ図を参照)、グローバル スケールでコンテンツ適応型トークン フュージョンを実行する機能を備えています。

周知のとおり、動的畳み込みには高い計算オーバーヘッドが伴い、大きな空間解像度を持つ動的畳み込みカーネルを使用するオーバーヘッドは、効率的で軽量なネットワーク設計にとってさらに受け入れがたいものと思われます。ただし、この記事で提案されている AFF トークン ミキサーは、上記の利点を同時に満たす低電力の同等の実装として使用でき、複雑さが O (N^2) から O (N log N) に削減され、計算効率が大幅に向上します。

図 1: AFF モジュールと AFFNet ネットワークの概略図。

3. AFFNet: 新しい軽量ビジュアルネットワークバックボーン

研究者らは、AFF Token Mixer をメインのニューラル ネットワーク オペレーターとして使用し、AFFNet と呼ばれる軽量ニューラル ネットワークを構築しました。広範囲にわたる実験により、AFF Token Mixer は、視覚的意味認識や高密度予測タスクを含む幅広い視覚タスクにおいて、優れた精度と効率のトレードオフを実現することが示されています。

4. 実験結果

研究者らは、提案されたAFFトークンミキサーとAFFNetを、視覚的意味認識、セグメンテーション、検出などの複数の視覚タスクで評価し、現在の研究分野における最先端の軽量ビジュアルバックボーンネットワークと比較しました。実験結果は、本研究で提案されたモデル設計が幅広い視覚タスクで優れたパフォーマンスを発揮することを示しており、提案された AFF トークン ミキサーが軽量で効率的な新世代のトークン融合演算子として潜在的可能性を検証しています。

図 2: ImageNet-1K データセットの Acc-Param、Acc-FLOPs 曲線と SOTA との比較。

表1: ImageNet-1KデータセットにおけるSOTAとの比較

表 2: 下流タスク (視覚検出とセグメンテーション) と SOTA の比較。

5. 結論

この研究結果は、潜在空間における周波数領域変換が、ニューラルネットワークにおけるグローバル適応トークン融合の効率的かつ低電力の同等の実装であるグローバル適応トークン融合の役割を果たすことができることを数学的に証明しています。これにより、ニューラル ネットワークにおけるトークン融合演算子の設計に関する新しい研究アイデアが生まれ、また、ストレージと計算能力が限られたエッジ デバイス上にニューラル ネットワーク モデルを展開するための新しい開発スペースも生まれます。

<<:  マルチモーダル世界モデルで未来を予測!カリフォルニア大学バークレー校の新しいAIエージェントは人間の言語を正確に理解し、SOTAを刷新する

>>: 

ブログ    
ブログ    
ブログ    
ブログ    

推薦する

人工知能トレーナーという職業は魅力的ですか?

人工知能については誰もが知っていますが、人工知能トレーナーについてはどのくらい知っていますか? [[...

新しいことを学び、古いものを見直す: ナレッジグラフからグラフデータベースへ

人工知能技術といえば、まずディープラーニングや機械学習技術が思い浮かびます。人工知能の応用といえば、...

このトリックにより、トランスフォーマーの推論速度が4.5倍になり、数十万ドルを節約できます。

[[443226]]この記事はAI新メディアQuantum Bit(公開アカウントID:QbitA...

「ブラックミラー」に匹敵する-AI技術が母親に亡くなった娘の姿を見せた

現在、外国の科学技術チームがAI技術を利用して、唯一の子供を亡くした母親の長年の願いを叶えた。彼らは...

...

人工知能はデータ活用効率を向上させ、他産業とのAI統合を加速させる

コンピューティング能力は、デジタル技術の継続的な発展とデジタル経済時代の中核的な生産性にとって重要な...

...

自動運転車に「道路を認識」させる方法

人間が歩くのと同じように、自動運転車も移動プロセスを完了するためには、交通環境について自主的に考え、...

Facebookが削除した10億の顔情報は、インターネット上の単なる「データゴミ」だ

[[433430]] Facebook が名前を Meta に変更し、Metaverse への本格的...

製造および自動化アプリケーション向けの人工知能技術の選び方

人工知能 (AI) の定義は、産業オートメーションにおける生産と、研究室外の日常生活では大きく異なり...

人工知能は裁判所によって特許発明者とみなされるでしょうか?

人工知能(AI)は、新薬の発見から新しい数学の問題の解決まで、あらゆることを人間が行うのに役立ってお...

待ちに待った! ByteDance初の大規模モデル製品「Doubao」が公開テスト可能、招待コードは不要!

ノア著他の大手企業と比較すると、ByteDanceの大型モデル分野における進歩は常に比較的神秘的であ...

2019 年の AI 統計と重要な事実

[[280183]] [51CTO.com クイック翻訳] 人工知能(AI)は日々驚異的なスピードで...

機械読解とは何ですか?これは自然言語処理とどのような関係があるのでしょうか?

[[324510]] 01 機械読解タスク2002 年に発表された論文で、学者の C. スノーは読...