クラスタリング(Clustering)とは
Clustering
ラベルなしデータを類似度に基づいてグループ分けする教師なし学習手法
概要
クラスタリングは、正解ラベルを与えずにデータ間の類似度や距離をもとに、似た性質を持つサンプル同士をグループ(クラスタ)へ分割する教師なし学習手法。 k-meansのような分割型手法、階層的クラスタリング、密度に基づくDBSCANなど、多様なアルゴリズムが存在する。 顧客セグメンテーションや異常検知、埋め込み空間の可視化・分析など、ラベル付けが困難または存在しないデータの構造を把握する用途で広く使われる。 事前にクラスタ数を指定する必要があるか、データの密度分布からクラスタを自動発見できるかは手法ごとに異なる。