アルゴリズムのパフォーマンスを最適化するためにデータ品質を確保するための 6 つのヒント

アルゴリズムのパフォーマンスを最適化するためにデータ品質を確保するための 6 つのヒント

今日、企業は、分析アルゴリズムの良し悪しは、そのアルゴリズムをトレーニングするデータの良し悪しによって決まるということに気づき始めています。より深い洞察を得るためにデータ品質を向上させる方法をいくつか紹介します。

キャシー・オニールの著書『Weapons of Math Destruction』では、ビッグデータ アルゴリズムは高品質で実行されなければ誤った結果を生成する可能性があると説明されています。

オニール氏は、最も成績の悪い教師200人を特定するためにアルゴリズムを実行したある学区の例を挙げている。選ばれた教師の一人は実は成績優秀者だったが、彼女のクラスの生徒の多くは成績の低い学校の出身だった。その結果、その教師が教えた生徒たちのテストの成績は悪かったため、その教師に低い評価を与えた。

オニール氏は、管理者、生徒、同僚教師からの好意的なレビューなど、他の形式の入力もアルゴリズムに関連するデータ処理に組み込むべきであり、そうすれば今回のような事件を防ぐことができるかもしれないと考えている。これは、ビッグデータ実践者全員にとって、分析アルゴリズムの良し悪しは、それが実行されるデータの良し悪しによって決まるということを思い出させるものです。

[[231290]]

企業は、データの品質によってアルゴリズムのパフォーマンスが最適化され、最終的にデータから洞察が得られることをどのように保証できるでしょうか?

重要なのは、データの準備と、企業がアルゴリズムを適用したいビジネスユースケースとの一致です。

質の高いデータとアルゴリズムを開発するための 6 つのベスト プラクティスを以下に示します。

1. 「本当の」アルゴリズム

企業は、アルゴリズムを自社のビジネスに適合させるビジネスケースを慎重に構築する必要があります。あなたが医療提供者であり、サービス提供エリア内で心臓疾患のリスクが高い人々を特定したい場合、「65 歳以上の人は誰ですか?」と尋ねるのではなく、「65 歳以上の人はすでに心臓手術を受けましたか?」と尋ねるアルゴリズムを構築することをお勧めします。

2. データを標準化する

重複したデータを取得して分析結果に影響を与える可能性を回避するには、重複したレコードを単一のデータ イベントに正規化する必要があります。

3. 破損したデータを修復する

場合によっては、アルゴリズムでチェックする前に、破損したデータを手動で修正するために人間が関与する必要があります。壊れたデータにはスペルミス(例:メイン州在住者なのに ME ではなく MN)が含まれている可能性があり、また誰かの姓のスペルミスにより、データセットに含めるべきではない余分なレコードが作成される可能性もあります。データの精度が高ければ高いほど、分析結果も正確になります。

4. 無関係なデータを排除する

企業がデータの範囲を、調査している特定のユースケースの境界に絞り込めば絞り込むほど、アルゴリズムによるデータ処理速度が上がり、企業が求めている洞察をアルゴリズムが提供できる可能性が高まります。

5. ユーザーの合意を得る

ユーザーが知らない情報を知っている可能性があるため、事前にユーザーに確認せずに、除外するデータについて一方的に決定しないでください。

6. 結果を確認する

ビッグデータのアルゴリズムとクエリの傾向としては、必要に応じて変更して再実行しますが、必ずしも結果を記録するわけではありません。代わりに、常に結果のベンチマークを設定し、それを測定します。たとえば、最初のデータ アルゴリズムで製品の潜在的購入者からの応答率が 3% しか得られず (そのうち 1% が最終的に製品を購入した場合)、変更したクエリがこれを上回るパフォーマンスを発揮するかどうかを知る必要があります。

<<:  AIの冬が来ます!ディープラーニングはスケールしません...

>>:  AIが皮膚がんの診断で17カ国の皮膚科医58人に勝利

ブログ    
ブログ    

推薦する

政府規制のAIの時代が到来

スティーブン・ホーキング博士はかつてこう言った。「効果的な人工知能の開発に成功すれば、私たちの文明史...

...

画像分類を40ナノ秒で完了、ニューラルネットワークを内蔵した画像センサーがNatureに掲載

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

2021 年の人工知能のトップ 10 トレンド

コロナウイルスのパンデミック以前、AI業界は2020年に大きな成長を遂げると予想されていました。 2...

IoT、AI、ブロックチェーンがビジネス経済を変革する

ビジネスとテクノロジーの世界のつながりは非常に強いため、テクノロジーの発展が次の段階に進むたびに、ビ...

...

機械学習を使うのに開発者である必要はありません

デジタル化と AI の導入が加速する中、企業では人工知能 (AI) と機械学習 (ML) の開発者が...

FP8 を使用して大規模モデルをトレーニングするとどれくらい良いのでしょうか? Microsoft: BF16 より 64% 高速、メモリは 42% 削減

大規模言語モデル (LLM) には、これまでにない言語理解および生成機能が備わっていますが、これらの...

識別的か生成的か: どちらが視覚的理解の未来を表すのでしょうか?

これまで、視覚システムに関する基本的な研究の多くは、動物に画像を見せ、そのニューロンの反応を測定し、...

人工知能は大学のキャンパスにどのような変化をもたらしたのでしょうか?

[[279290]] [51CTO.com クイック翻訳] 大学はどのようにして、個人の教育キャリ...

MITの最新の成果:AIが人間の脳が言語を処理する仕組みを解明

最新世代の予測言語モデルは、言語の根底にある意味の一部も学習したようです。驚くべきことに、これらのモ...

RealAIは、業界の信頼できる発展を促進するために人工知能セキュリティ技術ツールを作成します。

4月26日、中国サイバースペース管理局の主催で「人工知能-社会実験の観点から見た社会ガバナンス」を...

GitHub、企業向けAI搭載コーディングアシスタント「Copilot Enterprise」をリリース

GitHub の新製品「GitHub Copilot Enterprise」は、企業独自のコードベー...