K 分割交差検証とグリッドサーチ

K 分割交差検証とグリッドサーチ

みなさんこんにちは、私はZhibinです〜

今日は、GridSearch グリッド検索と K 分割相互認証を使用して、決定木モデルのパラメータを調整する方法を紹介します。

前回の記事では、決定木モデルの構築と実践を紹介しました。その時は、max_depth という 1 つのパラメータのみが使用されていました。しかし、実際には、モデルには、criterion (特徴選択基準)、class_weight (クラスの重み) などの他の影響パラメータがあります。より正確な結果を得たい場合は、モデルパラメータを調整し、モデルを構築するための最適なパラメータを見つける必要があります。

1. K分割交差検証

K 分割交差検証では、実際にデータ セットを K 個の部分に分割し、そのたびに K-1 個の部分をトレーニング セットとして選択し、残りの部分をテスト セットとして使用し、K 個のモデルの平均テスト結果を最終的なモデル効果として取得します。次の図に示すように:

K 値の選択はデータ セットのサイズに関係します。データ セットが小さい場合は K 値を増やし、データ セットが大きい場合は K 値を減らしてください。実装コードは次のとおりです。

 sklearn.model_selection から cross_val_score をインポートします
acc = cross_val_score(モデル、X、Y、cv=5)

2. グリッドサーチ

GridSearch は、すべての候補パラメータを走査し、各モデルの有効性と精度を評価し、最終結果として最適なパラメータを選択する、徹底的な検索パラメータ調整方法です。

パラメータ チューニングは、単一パラメータ チューニングと複数パラメータ チューニングに分かれています。Zhibin はそれぞれ例を挙げて紹介します。

(1)単一パラメータチューニング

単一パラメータのチューニングを説明するために、単一パラメータ max_depth を例に挙げます。コードは次のとおりです。

 sklearn.model_selection から GridSearchCV をインポートします
パラメータ = {'max_depth':[1,3,5,7,9]}
grid_search = GridSearchCV(モデル、パラメータ、スコアリング='roc_auc'、cv=5)grid_search.fit(X_train、Y_train)

出力パラメータの最適な結果:

グリッド検索.ベストパラメータ

max_depth パラメータの最適な結果は次のとおりです。

上記で得られた最適なパラメータ値でモデルを再構築し、AUC値が改善されたかどうかを確認します。コードは次のとおりです。

モデル = DecisionTreeClassifier(最大深度=7)
モデルをフィット(X_train,Y_train)
y_pred_proba = model.predict_proba(X_test)
sklearn.metricsからroc_auc_scoreをインポートします
スコア = roc_auc_score(Y_test.values,y_pred_proba[:,1])

得られた AUC 値は次のとおりです。

これは以前の値 0.958 よりも高く、モデルの精度が向上したことを示しています。

(2)マルチパラメータチューニング

決定木モデルには次のパラメータがあります。

これらのパラメータは、構築した決定木モデルの精度に影響します。ここでは、max_depth (最大深度)、criterion (特徴選択基準)、min_samples_split (子ノードを下方に分割するために必要なサンプルの最小数) を例として、マルチパラメータ チューニングを実行します。コードは次のとおりです。

 sklearn.model_selection から GridSearchCV をインポートします
パラメータ = {'max_depth':[5,7,9,11,13],'criterion':['gini','entropy'],'min_samples_split':[5,7,9,11,13,15]}
モデル = DecisionTreeClassifier()
grid_search = GridSearchCV(モデル、パラメータ、スコアリング='roc_auc'、cv=5)
グリッド検索.fit(X_train,Y_train)

出力パラメータの最適値:

グリッド検索.ベストパラメータ

上記で得られた最適なパラメータ値でモデルを再構築し、AUC値が改善されたかどうかを確認します。コードは次のとおりです。

モデル = DecisionTreeClassifier(基準 = 'エントロピー'、最大深度 = 13、最小サンプル分割 = 15)
モデルをフィット(X_train,Y_train)
y_pred_proba = model.predict_proba(X_test)
sklearn.metricsからroc_auc_scoreをインポートします
スコア = roc_auc_score(Y_test.values,y_pred_proba[:,1])

得られた AUC 値は次のとおりです。

これは以前の値 0.985 よりも高く、モデルがさらに最適化されたことを示しています。

<<:  NLP技術の準備——自然言語処理技術はあなたの妻ではありません

>>:  世界の自動運転「M&A」を4大勢力が攻勢

ブログ    

推薦する

人工知能が小売業界にどのような変化をもたらしているかをこの記事で学びましょう。2018年は新しい小売技術の元年になります

現代の小売業は第二次世界大戦後に始まりました。カルフールによるハイパーマーケット モデルの先駆的導入...

人工知能、自動化、そして仕事の未来: 答えが必要な 10 の質問!

[[264418]]職場で機械が人間の労働に取って代わるようになるにつれ、私たち全員が機械から利益...

...

機械学習を活用して人事部門の時間を節約する方法

導入履歴書データベースに「ソフトウェア エンジニア」という名前の履歴書が 10,000 件あるとしま...

ICLRスポットライト!清華大学は時系列異常検出アルゴリズムを提案し、5つのSOTA結果を達成した。

現実世界のシステムは、動作中に大量の時系列データを生成します。これらの時系列データを通じてシステム内...

スマート製造に関する新しい規制が8月に施行されます。これらは大きな影響力を持っており、知っておく必要があります

顔認識アプリケーションは司法解釈を受ける7月28日、我が国の最高人民法院は「顔認識技術を用いた個人情...

AIモデルのオープンソースの定義を変える必要がある

オープンソースライセンスは進化すべきだと思いますか? 2023年は人工知能(AI)の登場とともに新年...

モバイル AI でよりスマートなアプリを構築

モバイル AI は、すでにペースが速いモバイル アプリ開発の世界に混乱をもたらしています。 2020...

...

...

...

行列のランクと行列式の意味を1つの記事で理解する

工学部の学生として、私たちは行列や行列式などの線形代数の知識を長い間使用してきました。この記事では、...

効果はGen-2を超えます! Byte の最新ビデオ生成モデルは、一文でハルクに VR メガネをかけさせます

一言で言えば、ハルクに VR メガネをかけさせるのです。 4K品質。パンダのファンタジーの旅これは、...

自然言語処理: コンピュータに人間の言語を理解して処理させる

自然言語処理 (NLP) は、人工知能の分野における重要かつ刺激的なテクノロジーです。その目標は、コ...

ビジネスリーダーがLLMを活用して新たな機会を創出できる5つの方法

一般的に、AIGC とは、人間が作成したコンテンツに非常によく似た画像、音楽、テキストなどのコンテン...