アリババDAMOアカデミーが自動運転の技術的困難を突破:3D物体検出の精度と速度の両方を実現

アリババDAMOアカデミーが自動運転の技術的困難を突破:3D物体検出の精度と速度の両方を実現

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

最新のニュースとしては、アリババDAMOアカデミーが、今度は自動運転における3D物体検出の分野で新たな研究の進歩を遂げたという。

DAMOアカデミーの研究者らは、汎用性の高い高性能検出器を提案した。自動運転分野で最も重要なテストセットの1つであるKITTI鳥瞰図(BEV)データセットでは、検出速度が25FPSに達し、一気に1位になった。2位のソリューションと比較すると半分以上であり、精度は他の単段検出器をはるかに上回っていた。 3D物体検出において、精度と速度を両立させたのは初めてだと言えます。

DAMOアカデミーの研究チームは、「検出器は自動運転システムの中核部品の一つだが、この分野では革新とブレークスルーが不足していた。今回、3D検出の精度と速度の向上を達成し、自動運転システムの安全性向上に貢献するだろう」と述べた。

実験結果から判断すると、明らかに順調に進んでおり、研究を完了した中心人物(第一著者)はDAMOアカデミーのインターン生です。

同時に、この研究は同業者から認められ、コンピュータービジョン分野のトップカンファレンスであるCVPR 2020にも取り上げられました。彼らはどうやってそれを行うのでしょうか? Alibaba Damo Academyが提供する解釈の助けを借りて、それらを一つずつ見ていきましょう。

精度とスピードの両方を実現するにはどうすればよいでしょうか?

周知のとおり、通常の 2D 画像認識アプリケーションとは異なり、自動運転システムには精度と速度に対する要求が厳しく、周囲の環境にある物体を素早く識別するだけでなく、3 次元空間内で物体の位置を正確に特定する必要もあります。

通常、センサーとアルゴリズム モデルだけでは、視覚認識の精度と速度のバランスをとることはできません。したがって、検出器は自動運転システムの安全性を向上させる重要な要素になります。

長年の研究を経て、現在業界で主流となっている単段検出器は検出速度は優れているものの、検出精度が不十分であることがわかりました。

これが、DAMO アカデミーの研究の出発点です。両方の世界の最良の部分を実現する方法を見つけることです。

彼らが提案したアイデアは、2 段階検出器におけるきめ細かい特徴特性評価のアイデアを、1 段階検出に移植するというものです。

彼らのモデルでは、展開用の検出器、つまり推論ネットワークは、バックボーン ネットワークと検出ヘッドで構成されています。

バックボーン ネットワークは、高いセマンティクスを持つボクセルの特徴を抽出するために 3D スパース ネットワークとして実装されています。検出ヘッドはボクセルの特徴を鳥瞰図の表現に圧縮し、その上で 2D 完全畳み込みネットワークを実行して 3D オブジェクト ボックスを予測します。

トレーニング中、研究者たちは補助ネットワークを使用して、シングルステージ検出器のボクセル特徴をポイントレベル特徴に変換し、特定の監視信号を適用しました。

実装では、畳み込み特徴内の非ゼロ信号を元のポイントクラウド空間にマッピングし、各ポイントで補間して畳み込み特徴のポイントレベルの表現を取得します。これにより、畳み込み特徴には構造認識機能も備わり、検出精度が向上します。

モデル推論を行う際、補助ネットワークは計算に参加せず(切り離され)、単段検出器の検出効率を保証します。

さらに、彼らは、シングルステージ検出器に存在する「ボックス信頼性不一致」問題に対処するために使用される、部品感知ワーピング (PSWarp) というエンジニアリングの改善も提案しました。

基本的な考え方は、サンプラーを使用して、生成されたサンプリング グリッドで対応するローカル感度特徴マップをサンプリングし、位置合わせされた特徴マップを生成することです。最終的に信頼性を反映できる特徴マップは、K 個のアライメントされた特徴マップの平均です。

2段階法と同等の精度を達成できる1段階法

Alibaba DAMO Academy の研究者は、KITTI データセットで自らの方法の有効性を評価しました。下の図(PR 曲線)では、実線が 2 段階方式、点線が 1 段階方式を表しています。

DAMO Academyが提案する1段階法(黒)は、2段階法と同等の精度を達成できることがわかります。

下の図は、KITTI Bird's Eye View (BEV) および 3D テスト セットの結果を示しています。

彼らが提案した方法は、追加計算量を増やすことなく、精度を維持しながら25FPSの検出速度を達成できることがわかります。具体的な検出結果は以下の通りです。

共著者の二人は、どちらもDAMOアカデミーの研究インターンです。

「点群からの構造認識シングルステージ3Dオブジェクト検出」と題されたこの研究論文は、アリババ・ダモ・アカデミーと香港理工大学の5人の研究者によって執筆された。

第一著者は、アリババDAMOアカデミーの研究インターンであるChenhang He氏です。彼は現在、香港理工大学で博士号取得を目指しており、2022年に卒業する予定です。

彼の指導者は、DAMO アカデミーの上級研究員であり、香港理工大学電子計算学部の教授、IEEE フェローであり、本研究の責任著者でもある張磊氏です。

もう一人の筆頭著者である Hui Zeng 氏も Alibaba DAMO Academy の研究インターンであり、Zhang Lei 氏の博士課程の学生でもあり、今年卒業する予定である。

他の著者には、DAMO アカデミーの上級研究員であり IEEE フェローである Hua Xiansheng 氏と、DAMO アカデミーの上級アルゴリズム専門家である Huang Jianqiang 氏が含まれます。

<<:  フォーブス誌の2020年AIに関するトップ10予測: 人工知能はますます「疎外」されつつある

>>:  AIは賢くなり、これらの新しい技術は流行の防止と生産の再開に役立つだろう

ブログ    

推薦する

ついにAI、BI、ビッグデータ、データサイエンスをわかりやすく説明する人が出てきた

[[427319]] 01 データデータは、携帯電話に残すデジタルフットプリントから健康記録、買い物...

5つの重要なステップ!ディープラーニングモデルを構築するにはどうすればいいですか?

この記事は、公開アカウント「Reading the Core」(ID: AI_Discovery)か...

エッジAI: インテリジェンスをソースに近づける

人工知能の発展により、データをアルゴリズムに渡すのではなく、アルゴリズムがデータを処理するようになり...

...

「業界最強」と称されるアリトン・イー・チエンウェン、国内No.1大型モデルを目指す

どの時代にもメインテーマがあり、次の10年の主なテーマはAIです。 ChatGPTの登場以来、中国で...

人工知能がブルーカラーの仕事に取って代わると、どのような影響があるでしょうか?

AI と ML をより多くのタスクに統合すると、短期的には多くのメリットが得られますが、長期的には...

...

OpenAI のセキュリティ脆弱性が明らかに: ChatGPT の制限は一般的でない言語を使用することで簡単に回避可能

10月12日、ブラウン大学のコンピューターサイエンス研究者は、OpenAIのGPT-4セキュリティ設...

2021年にAI開発に使える言語は何ですか?

[[417589]]パイソン[[417590]] Python は現在、機械学習で最も人気のあるプ...

2020年に注目すべき10のAIトレンド

今後 1 年間で AI テクノロジーはどのように進化するのでしょうか。組織が注目すべき主要な AI ...

多くの場所で顔認証の削除が通知されました!人工知能業界は衰退するのでしょうか?

[[356436]] 「ブラックテクノロジー」の顔スキャンマシンを大量に購入する人がいる一方で、顔...

2020 年に慈善活動を変える主要なテクノロジー トレンドのリスト

チャリティーは常に実行速度が遅いことで知られています。慈善団体が社会、経済、環境の変化に対応するには...

AI ライティングの限界はどこにあるのでしょうか?

[[248875]]画像出典: Visual China本質的に、この記事は AI ライティングを...

無料の Python 機械学習コース パート 3: 多項式回帰

多項式回帰は線形回帰の改良版です。線形回帰を知っていれば、簡単に理解できるでしょう。そうでない場合は...

論文執筆に必ず使うべき 12 のニューラル ネットワーク可視化ツール

この記事では、ニューラルネットワークの描画をより美しくする 12 個のツールを紹介します。 1. 描...