用語集
クラスタリングclustering
顧客や商品などのデータを、似た性質を持つグループ(クラスター)に自動的に分ける分析手法。あらかじめ「正解のグループ」を決めずにデータの中の構造を見つけるため、顧客セグメントの発見や施策の出し分けに使います。
クラスタリングとは
クラスタリング(clustering)とは、多数のデータを「互いに似ているもの同士」でグループに分ける手法です。「優良顧客/離反しそうな顧客」のように人がラベルを決めて分類するのではなく、購買金額・頻度・購入カテゴリ・回答傾向などの複数の指標から、データ自身が持つまとまりを見つけるのが特徴です(このため「教師なし学習」に分類されます)。代表的な手法に k-means 法や階層的クラスター分析があります。
何に使うのか
- 顧客セグメンテーション:「週末にまとめ買いする家族層」「平日昼に少量買う単身層」のような、行動にもとづく顧客像を発見する
- 商品や店舗の分類:売れ方の似た商品群、客層の似た店舗群をまとめて施策を共通化する
- アンケートやサーベイの回答者を、価値観や満足度のパターンでグループ分けする
- 自由記述などのテキストを、文章の意味の近さでグルーピングする(自然言語処理と組み合わせる)
進め方の要点
どの指標で「似ている」を測るかを最初に決めることが結果を左右します。単位の違う指標(金額と回数など)はそのままでは比べられないため、標準化してから計算します。クラスターの数は自動で決まらないので、複数の分け方を試し、「施策として区別する意味があるか」で判断します。
注意点
クラスタリングは「グループが存在する」ことを前提に必ず何らかの分け方を返します。分けた結果に名前を付け、現場感と照らして解釈できるかを確認しないと、意味のない区分で施策を打つことになります。分析結果は出発点であり、各クラスターに合った打ち手を検討することまでがセットです。