Google Brain の最新の操作は「レトロ」: 畳み込み注意は不要、画像分類は SOTA に近い

この記事はAI新メディアQuantum Bit（公開アカウントID：QbitAI）より許可を得て転載しています。転載の際は出典元にご連絡ください。

Google Brain の Visual Transformer チーム (ViT) がレトロなものを作りました。

彼らは畳み込みニューラルネットワーク(CNN)やトランスフォーマーを使用せず、初期の AI ビジョンタスクで採用された多層パーセプトロン(MLP)構造のみに依存して SOTA に近いパフォーマンスを達成し、ImageNet 画像分類タスクで 87.94% の精度を達成しました。

このアーキテクチャはMLP-Mixerと呼ばれ、2 つの異なるタイプの MLP レイヤーを使用します。これは、チャネルミキシング(ビット単位の操作)に 1×1 畳み込みを使用し、文字ミキシング(クロスビット操作) に完全な受容野とパラメータ共有を備えた単一チャネルの深い畳み込みを使用する特別な CNN と見ることができます。

JFT-300Mデータセットで事前トレーニングされ、224解像度に微調整されたMixer-H/14バージョンは、 86.32％の精度を達成しました。これは、SOTAモデルViT-H/14よりもわずか0.3％低いですが、実行速度は2.2倍です。

論文の宛先:
https://arxiv.org/abs/2105.01601

プロジェクトアドレス:
https://github.com/google-research/vision_transformer/tree/linen

<<: seq2seq モデルよりも 90 倍高速です。 Google、新しいテキスト編集モデルFELIXを発表

>>: 映画品質の CG レンダリングを作成しましょう!スタンフォード大学の研究者がニューラル光学レンダリングを提案

エンコーダー・デコーダーアーキテクチャを放棄し、エッジ検出に拡散モデルを使用する方が効果的です。国立国防科学技術大学はDiffusionEdgeを提案しました。

ブログ

Google Brain の最新の操作は「レトロ」: 畳み込み注意は不要、画像分類は SOTA に近い

エンコーダー・デコーダーアーキテクチャを放棄し、エッジ検出に拡散モデルを使用する方が効果的です。国立国防科学技術大学はDiffusionEdgeを提案しました。

ドローンが小型化するにつれて、その開発が成熟するためには3つの点を考慮する必要があります。

中国の研究チームが86%の精度を誇るAI「皮肉」検出モデルを発表

中国の科学者が色を変えることができる柔らかいロボットを開発

このAI職種の平均学歴は中学卒程度であり、最も絶望的な職業として認識されている

新しいトレンド！人工知能と5G技術がスマートフォンを再定義する

パンデミック後、アメリカ人の半数がスマートデバイスの音声制御が不可欠だと考えている

推薦する

ChatGPTはどんどん怠惰になり、代わりにPUA人間を学習しました

AIがビジネスプロセスとインテリジェントセキュリティをサポートする方法

知っておきたい！AI を活用したサイバー犯罪対策に機械学習を活用する方法

アルゴリズムの練習: 数独の基本解法

AMiner が発表: 2022 年に世界で最も影響力のある人工知能学者「AI 2000」

2020 年に慈善活動を変える主要なテクノロジートレンドのリスト

AIガバナンスがリスクを軽減しながら利益を獲得する方法

人工知能業界では無視できない技術分野「ナレッジグラフ」

Google Gemini がゲームを逆転！マルチモーダル機能は GPT-4V と同等 | 香港中国語 128 ページの総合評価レポート

3つの主要なSQL ServerアルゴリズムのI/Oコストの簡単な分析

低速自動運転と高速自動運転に関する議論