Facebook、AIが著作権侵害を正確に識別できるようにソースデータ拡張ライブラリを公開: 100以上の拡張方法が提供される

Facebook、AIが著作権侵害を正確に識別できるようにソースデータ拡張ライブラリを公開: 100以上の拡張方法が提供される

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載しています。転載の際は出典元にご連絡ください。

わずかな変更でも AI モデルの堅牢性に影響を及ぼします。

AIの目から見ると、次の2つの写真は互いに何の関係もないように見えるかもしれません。

現在、 Facebook AI はデータ拡張用の新しい Python ライブラリAugLy をオープンソース化しました。

[[409845]]

オーディオ、画像、ビデオ、テキストの4 つのモダリティをサポートし、入力コンテンツに対してさまざまな処理を実行できる100を超えるデータ拡張機能を提供します。

たとえば、テキストの大文字、フォント、エンコード方法を変更したり、テキストに句読点を追加したり、文字の位置を調整したり、タイプミスをシミュレートしたりします。

[[409846]]

このプロジェクトは1.8k 個のスターを獲得し、GitHub のホット リストに掲載されています。

「スクリーンショット転送」をAIに認識させる

AugLy は、実際のネットワークにおける特定のデータ拡張をカバーし、モデルのトレーニングとテスト用のサンプルを作成することを目的としています。

AugLy は、Facebook や Instagram などのプラットフォームからの実際の画像や動画に基づいて、プロジェクトのすべてのデータを統合ライブラリと API で変換し、100 を超えるデータ拡張方法を提供します。

オーディオ、画像、ビデオ、テキストの 4 つのモダリティに対応する 4 つのサブライブラリが含まれています。

これらのサブライブラリには、関数ベースおよびクラスベースの変換、組み合わせ、適用されるメタデータその強度を選択する機能が含まれます。

画像処理を例にとると、AugLy はトリミング、回転、ノイズの追加、ぼかし、グレースケールなどを行うことができます。

このような:

一部のネットユーザーは、「テキストモジュールは英語のみをサポートしていますか?」という疑問を提起しました。

AugLy の最大の特徴は、一般的な拡張機能を多数搭載していることに加え、 「インターネット ユーザー」型のデータ拡張機能を提供していることです。

たとえば、画像をスクリーンショットスタイルに変換すると、実際の生活で目にするものに近くなります。

AugLy データ拡張を使用して AI モデルをトレーニングします。内容は同じだが形式が異なるこの情報は、モデルの堅牢性を向上させるのに役立ちます。

コピー検出音声検出著作権侵害などのタスクでは、トレーニング後、AIはユーザーがアップロードしたコンテンツをより正確に識別できます。

さらに、AugLy は、モデルの堅牢性を評価するために Deepfake Detection Challenge で使用されています。

ネットユーザーの間で熱い議論

この新しい Python ライブラリはネットユーザーの注目も集め、Reddit で350 件を超える「いいね!」を獲得しました。

一部のネットユーザーは、「テキストモジュールは英語のみをサポートしていますか?」という疑問を提起しました。

熱狂的なネットユーザーはこう言った。

テキスト モジュールは主に nlpaug のラッパーであるように見えるため、AugLy はいくつかのパラメータを変更するだけで他の言語をサポートします。

一部のネットユーザーからは、なぜそれを直接 PyTorch に追加しないのかという質問もありました。

それに応えて、ある人がこう返信しました。

これによりインストールが非常に遅くなるため、必要な人は個別にインストールするだけで済みます。pytorch をこれほど肥大化させる必要はありません。

AugLy には Python 3.6 以降が必要です。これは pip を使用してインストールできます。ただし、仮想環境とシステム環境では、conda と sudo apt-get を使用して python-magic を別途インストールする必要もあります。

残念ながら、AugLyは現在バッチ画像の入力をサポートしていませんが、開発者は将来この機能が改善される予定であると述べています。

<<:  動物や人間には学習の臨界期があり、ディープニューラルネットワークにも臨界期がある。

>>:  これでブリッジで腹筋運動ができるようになりました!中国初の3Dプリント橋が上海で公開

ブログ    
ブログ    

推薦する

...

業界丨2020年のインテリジェントウェーブを理解するには、BaiduとGoogleのAIの足跡から始める

2020年が過ぎました。順調で平和な生活を送ったか、非常に困難な生活を送ったかにかかわらず、私たちは...

「AI顔変換」技術の悪用はサイバーセキュリティ詐欺の氷山の一角を露呈

今年に入ってからは、ChatGPTやGPT-4などの技術の応用により、深層合成製品やサービスが増加し...

グーグルは、人工知能の進歩により飛行機による地球温暖化への影響を大幅に軽減できると主張

グーグルは8月14日、飛行機による気候への影響を大幅に軽減できる人工知能の分野で大きな進歩を遂げたと...

2019年の人工知能の5つの主要な発展傾向

人工知能が開発を加速「中国人工知能産業市場展望及び投資戦略計画分析報告書」の統計によると、2017年...

自動運転タクシーが登場!

[[383103]]武漢晩報(王超然記者)自動運転タクシーに乗ってみての感想は?車の中に運転手はい...

直接的な選好最適化戦略を用いたミストラル7bモデルの微調整

翻訳者|朱 仙中レビュー | Chonglou導入通常、事前トレーニング済みの大規模言語モデル (L...

AIをうまく活用したいなら、この2つの問題を早急に解決しなければなりません!

[[441323]]早すぎるオールインデータ文化を一夜にして構築することはできないのと同様に、分析...

集団雷雨!自動化された攻撃により、主要な言語モデルを1分で脱獄できる

大規模な言語モデル アプリケーションが直面する 2 つの主要なセキュリティ上の脅威は、トレーニング ...

...

インタビュアー: 負荷分散アルゴリズムを理解していますか?

前回の記事では、ポーリング、ランダム、最小接続の 3 つの負荷分散アルゴリズムについて説明しました。...

将来的にはAIを5Gネットワ​​ーク解析に活用できる

現在、5G に関するブログやベンダーの論文が数多くあり、新しいメディア伝送からギガビット速度、モバイ...

強化学習とゲーム理論を活用して、EAのテストAIは賢いものになった

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

...

公式論文コードが公開されました。OpenAIはGPT-3のイメージ版をどのように実装したのでしょうか?

OpenAIはDALL-Eに関するいくつかの論文と実装コードを公開しました。今年初め、OpenAI...