データサイエンティストが最もよく使用するアルゴリズム10選

最新の KDnuggets 調査では、データサイエンティストの実際の業務で最もよく使用されるアルゴリズムが集計されており、ほとんどの学術界と産業界において驚くべき発見がありました。

KDnuggets の Gregory Piatetsky 氏によると、最新の調査質問は次のとおりです。過去 12 か月間に、実際のデータサイエンス関連のアプリケーションでどのモデル/アルゴリズムを使用しましたか?

したがって、844 枚の解答用紙に基づく結果は次のとおりです。

◆ ◆ ◆

上位10のアルゴリズムとその投票者の割合

図1: データサイエンティストが最もよく使用するアルゴリズムのトップ10。すべてのアルゴリズムについては、記事の最後にある表を参照してください。

回答者は平均 8.1 個のアルゴリズムを使用しており、これは 2011 年の同様の調査と比較すると大幅に増加しています。

2011 年のデータ分析アルゴリズムの調査と比較すると、最も一般的に使用されている方法は依然として回帰、クラスタリング、決定木/ルール、視覚化であることがわかりました。最大の増加率は（増加 = %2016/%2011 -1）です。

ブースティングアルゴリズムが40%改善されました。 2011年の23.5%から2016年には40%に増加した。

テキストマイニングが30%向上しました。 27.7%から35.9%へ

視覚化が 27% 向上しました。 38.3%から48.7%へ

時系列/シーケンス分析: 25% 改善されました。 29.6%から37.0%へ

異常/逸脱検出、16.4%から19.5%に19%改善

アンサンブル法、28.3%から33.6%に19%増加

サポートベクターマシン（SVM）は28.6%から33.6%に18%向上しました。

後退、57.9%から67.1%に16%改善

◆ ◆ ◆

2016年最も人気のある新人は

K近傍法、46%

主成分分析（PCA）、43%

ランダムフォレスト、38%

最適化、24%

ニューラルネットワーク - ディープラーニング、19%

特異値分解、16%

◆ ◆ ◆

最も大きな下落は

関連性ルール、28.6%から15.3%に47%減少

アップリフトモデリング、4.8%から3.1%に36%減少（これに関する膨大な文献を考慮すると驚くほど低い）

要因分析、24%減少、18.6%から14.2%へ

生存分析、9.3%から7.9%に15%減少

次の表は、さまざまなアルゴリズムタイプ (教師ありアルゴリズム、教師なしアルゴリズム、メタアルゴリズム、その他のアルゴリズム) が使用される場所を示しています。応募種別不明（NA、4.5%）またはその他の職業種別（3%）は含まれていません。

表1: 職業種別アルゴリズムの使用状況

ほぼ全員が教師あり学習アルゴリズムを使用していることに気付きました。政府や産業界のデータサイエンティストは、学生や科学者よりも多様なアルゴリズムを使用します。産業データサイエンティストはメタアルゴリズムの使用を好みます。

◆ ◆ ◆

さまざまな職業で最もよく使われるアルゴリズム + ディープラーニングのトップ 10

次に、さまざまな職業で最もよく使用されるアルゴリズム+ディープラーニングのトップ10を分析しました。

表2: 職業別のトップ10アルゴリズム+ディープラーニング

これらの違いをより明確に示すために、異なる職業タイプのアルゴリズム使用バイアスを計算する式を使用します。

バイアス = 特定の職業タイプのアルゴリズム使用率 / すべての職業タイプのアルゴリズム使用率 - 1

図2: さまざまな会場でのアルゴリズム使用の偏り

産業データサイエンティストは、回帰、視覚化、統計、ランダムフォレスト、時系列を使用する傾向があることに気付きました。政府機関や非営利団体では、視覚化、主成分分析、時系列を使用する可能性が高くなります。学術界の研究者は主成分分析とディープラーニングをより多く利用しています。学生は一般的にアルゴリズムをあまり使用しませんが、主にテキストマイニングとディープラーニングを使用します。

次に、KDnuggets ユーザー全体を表す特定の地域でのエンゲージメントを見てみましょう。

調査員の地域分布:

アメリカ/カナダ、40%

ヨーロッパ、32%

アジア、18%

ラテンアメリカ、5.0%

アフリカ/中東、3.4%

オーストラリア/ニュージーランド、2.2%

2011 年の調査では、業界と政府からの回答者を 1 つのグループにまとめ、学術研究者と学生を 1 つのグループにまとめ、業界と政府グループのアルゴリズムの使用知識を計算しました。

（産官グループのアルゴリズム利用率 / 学術学生グループのアルゴリズム利用率） / （産官グループの人数 / 学術学生グループの人数） - 1

したがって、親和性が 0 のアルゴリズムは、業界/政府グループと学術学生グループによって同等に使用されていることを示します。 IG 親密度が高くなるほど、アルゴリズムは業界に偏り、結果が小さくなるほど、アルゴリズムは学術に偏ります。

最も「工業的なアルゴリズム」は次のとおりです。