データセットを正しく分割するにはどうすればいいでしょうか? 3つの一般的な方法の概要

データセットを正しく分割するにはどうすればいいでしょうか? 3つの一般的な方法の概要

データセットをトレーニング セットに分割すると、モデルを理解するのに役立ちます。これは、モデルが新しい未知のデータにどのように一般化されるかを理解するために重要です。 モデルが過剰適合されている場合、新しい未知のデータにうまく一般化されない可能性があります。したがって、正確な予測を行うことは不可能です。

適切な検証戦略を持つことは、優れた予測を作成し、AI モデルのビジネス価値を活用するための第一歩です。この記事では、一般的なデータ分割戦略をいくつか紹介します。

シンプルなトレーニングとテストの分割

データセットはトレーニングと検証の 2 つの部分に分かれており、80% がトレーニング用、20% が検証用です。 これを行うには、Scikit のランダム サンプリングを使用できます。

まず、ランダム シードを修正する必要があります。そうしないと、比較して同じデータ分割を取得できず、デバッグ中に結果を再現できなくなります。 データセットが小さい場合、検証分割がトレーニング分割と相関しないという保証はありません。データのバランスが取れていない場合、同じ分割比率を得ることはできません。

したがって、単純な分割は開発とデバッグにのみ役立ちますが、実際のトレーニングは十分に完璧ではありません。そのため、次の分割方法がこれらの問題の解決に役立ちます。

K 分割交差検証

データセットを k 個のパーティションに分割します。 下の画像では、データセットは 5 つのパーティションに分割されています。

1 つのパーティションが検証データセットとして選択され、他のパーティションはトレーニング データセットとして選択されます。これにより、異なるパーティションのセットごとにモデルがトレーニングされます。

最終的に、K 個の異なるモデルが取得され、これらのモデルは統合された方法を使用して、その後の推論と予測に一緒に使用されます。

Kは通常[3,5,7,10,20]に設定されます。

低いバイアスでモデルのパフォーマンスを確認したい場合は、より高いKを使用します[20]。変数選択のためのモデルを構築する場合は、低いk [3,5]を使用するとモデルの分散が低くなります。

アドバンテージ:

  • モデル予測を平均化することで、同じ分布から抽出された未知のデータに対するモデルのパフォーマンスを向上させることができます。
  • これは、優れた生産モデルを取得するために広く使用されているアプローチです。
  • さまざまなアンサンブル手法を使用して各データ セットの予測を作成し、これらの予測を使用してモデルを改善することができます。これを OOF (アウトフォールド予測) と呼びます。

質問:

  • 不均衡なデータセットがある場合は、Stratified-kFold を使用します。
  • すべてのデータセットでモデルを再トレーニングした場合、そのパフォーマンスを k-Fold を使用してトレーニングされたモデルと比較することはできません。このモデルはデータセット全体ではなく、k-1 でトレーニングされているためです。

階層化kFold

各折り畳み内の異なるクラス間の比率は維持できます。データセットが不均衡な場合、たとえば、Class1 には 10 個の例があり、Class2 には 100 個の例があります。 Stratified-kFoldによって作成された各妥協分類の比率は、元のデータセットと同じである。

考え方は K 分割交差検証に似ていますが、各分割の比率は元のデータセットと同じです。

クラス間の初期比率は各分析で保持できます。データセットが大きい場合、K 分割交差検証でも比率が保持される可能性がありますが、これは確率的です。一方、Stratified-kFold は決定論的であり、小さなデータセットに使用できます。

ブートストラップとサブサンプリング

ブートストラップとサブサンプリングは K 分割クロス検証に似ていますが、固定された分割はありません。データセットからランダムにデータを選択し、他のデータを検証として使用してn回繰り返します。

ブートストラップ = 交互サンプリング。これについては以前の記事で詳しく紹介しました。

いつ使うのですか?ブートストラップとサブサンプリングは、推定メトリックの標準誤差が大きい場合にのみ使用する必要があります。これはデータセット内の外れ値が原因である可能性があります。

要約する

通常、機械学習では、k 分割交差検証が最初に使用されます。データセットが不均衡な場合は、Stratified-kFold が使用されます。外れ値が多い場合は、Bootstrap などの方法を使用してデータ分析を改善できます。

<<:  5G悪報セキュリティ管理プラットフォームにおけるディープラーニングに基づくテキスト感情認識技術の応用

>>:  ユビキタス「AI+」人工知能はこのように私たちの生活を変える

ブログ    
ブログ    

推薦する

AI戦略に関するCIOの4つの優先事項

テクノロジーリーダーにとって、今は刺激的でもあり、不安でもある時代です。急速に進化するデジタルテクノ...

中小企業のAIを活用したデジタルトランスフォーメーションを実現する4つの道

大企業と比較すると、中小企業は強力な技術的および財務的サポートが不足している可能性があり、技術者が不...

Jupyter のアップグレード: さまざまな大規模モデルを接続し、コードを生成し、チャットを通じてエラーを修正できます

これで、大規模言語モデル (LLM) が Jupyter に接続されました。これは主に、Projec...

論文をレビューするための新しい Python プログラム。手動レビューをなくし、arXiv 論文のスコアを自動的に付けます。

この記事はAI新メディアQuantum Bit(公開アカウントID:QbitAI)より許可を得て転載...

グリーンAIが気候変動の影響にどう対処できるか

機械学習などの計算集約型テクノロジーの開発には、大きな二酸化炭素排出量が伴い、気候変動の一因となりま...

ウクライナ、写真を通じて殺害されたロシア兵の家族を発見?顔認識が初めて軍事紛争で大規模に使用され、大きな論争を巻き起こしている

報道によると、ウクライナが使用している顔データベースは、米国に本社を置くテクノロジー企業の「Clea...

機械学習プロセスにおける3つの落とし穴、どれを踏んでしまったか確認しましょう

[[273444]]ビッグデータダイジェスト制作編集者: Vicky、Cao Peixin機械学習の...

中国電信が星辰AIビッグモデルをソース公開:LLM研究開発を完了し、オープンソース化した初の中央企業

予期せぬことに、オープンソースのビッグモデル ファミリーに特別なプレーヤーが登場しました。国営企業か...

...

...

自動車所有者は完全自動運転を導入すべきでしょうか?マスク氏:よく分かりません

北京時間7月27日、テスラは最近、自動車所有者に「完全自動運転」(FSD)機能のサブスクリプションを...

アルゴリズムの改善とハードウェアの反復、どちらがより収益性が高いでしょうか? MITの最新の研究結果がこの答えを提供している

コンピューターが登場する前には、アルゴリズムがありました。コンピュータの誕生により、コンピュータの強...

イーブンテクノロジーは、AIアプリケーションシナリオに沿った新世代のデータウェアハウスを構築します。

[51CTO.com からのオリジナル記事] 今日の情報化社会には、さまざまな情報リソースが溢れて...

人工知能の分野では、すでに世界中で 10 個の画期的な技術が存在します。

[[238191]]人工知能はハイテクで、多岐にわたり、多次元的で、学際的な統合装置であり、ビッグ...

ChatGPTとDALL·E 3間の業界用語が発見された

先月末、OpenAIは最新の画像ジェネレーターDALL・E 3をリリースしました。爆発的な生成効果も...