Customer Analytics
Segmentacja klientów z clusteringiem: trzy operacyjne segmenty z 2240 klientów
Porównano pięć algorytmów clusteringu, a decyzję podjęto z rozsądkiem: nie wygrywa model z najlepszym wynikiem, lecz ten, którym da się operować. Efektem są trzy operacyjnie użyteczne segmenty klientów i strategia kampanii, która podąża za budżetem. Capstone MIT z odtwarzalnym repozytorium towarzyszącym.
Detalista prowadzi kampanie w internecie, katalogu i sklepie dla sześciu kategorii produktów, a akceptacja sięga zaledwie 1 do 15%. Powód jest prosty: każdy klient traktowany jest tak samo. Pytanie tego projektu: czy uczenie nienadzorowane potrafi odczytać naturalne segmenty klientów z danych behawioralnych, tak by budżet marketingowy trafiał tam, gdzie realnie konwertuje? Nie ma zmiennej docelowej, więc strukturę trzeba znaleźć.
Zbiór danych
Podstawą jest publiczny zbiór marketingowy (marketing_campaign.csv) z 2240
rekordami klientów i 26 atrybutami: demografia, wydatki wg kategorii (wino, owoce, mięso, ryby,
słodycze, złoto), zachowanie kanałowe (web/katalog/sklep/deals) oraz reakcje na pięć kampanii. Po
oczyszczeniu (imputacja mediany dla dochodu, usunięcie jednej skrajnej wartości) pozostaje 2232
modelowanych klientów. Do clusteringu trafia 17 cech behawioralnych, demografia
służy tylko profilowaniu. To publiczny zbiór edukacyjny udostępniony w ramach programu capstone MIT;
prawa do danych pozostają przy pierwotnym wydawcy.
Podejście: pięć algorytmów, jedna użyteczna struktura
Analiza eksploracyjna ujawniła trzy wzorce: dochód jest najsilniejszym czynnikiem wydatków, wino + mięso to ok. 75% wydatków, a dzieci wyraźnie obniżają wydatki premium. Po inżynierii cech (8 nowych), StandardScaler i PCA (10 komponentów, 90,7% wariancji) porównano pięć algorytmów clusteringu, oceniając je po wskaźniku silhouette i użyteczności operacyjnej: K-Means, K-Medoids, Hierarchical (Ward), DBSCAN i Gaussian Mixture.
Wyniki
Wskaźnik silhouette przy k=3 dla poszczególnych algorytmów:
| Algorytm (k=3) | Silhouette | Werdykt |
|---|---|---|
| K-Means (wybrany) | 0,2888 | Zrównoważony, interpretowalny, przypisuje nowych klientów |
| K-Medoids | 0,2670 | Porównywalny, wolniejszy |
| Hierarchical (Ward) | 0,2661 | Potwierdza tę samą strukturę 3 segmentów |
| Gaussian Mixture | 0,1808 | Słabsza separacja |
| DBSCAN | 0,4820 | Odrzucony: 2216 w jednym klastrze + 10 punktów szumu, brak przypisania nowych klientów |
DBSCAN osiągnął najwyższy wynik, ale jest bezużyteczny w produkcji (jeden dominujący klaster, nie da się przypisać nowych klientów). Wskaźnik silhouette K-Means, 0,2888, oznacza umiarkowaną, wciąż operacyjnie interpretowalną strukturę. Nie jest to przypadek czysto odseparowanych klastrów. Wybrano K-Means (k=3), ponieważ jego trzy segmenty są odtwarzane przez K-Medoids i Hierarchical clustering, a pewność wynika właśnie z tej odtwarzalności, nie z wielkości wskaźnika. Nie wygrywa najlepszy wynik, lecz rozwiązanie broniące się i wdrażalne.
Trzy segmenty
| Segment | Udział | Śr. dochód | Śr. wydatki | Zaakceptowane kampanie |
|---|---|---|---|---|
| Premium Enthusiasts | 25,4% | 76 319 $ | 1 420 $ | 1,01 |
| Moderate Mainstream | 27,8% | 57 292 $ | 721 $ | 0,40 |
| Budget Families | 46,8% | 35 475 $ | 99 $ | 0,17 |
Wszystkie kwoty w dolarach amerykańskich, zgodnie ze zbiorem źródłowym.
Od klastrów do strategii
- Kampanie trzypoziomowe. Premium: ekskluzywne/VIP, katalog + sklep; Mainstream: cross-sell/lojalność, omnichannel; Budget: deals i pakiety rodzinne, mobile + e-mail.
- Budżet tam, gdzie konwertuje. Udział Premium w górę, Budget w dół.
- Dopasowanie kanału. Koniec mailingów katalogowych do Budget, skalowanie katalogu dla Premium.
Prognozowany efekt finansowy (ok. 98 tys. $ korzyści netto / ok. 196% ROI w pierwszym roku) to obliczenie modelowe na jawnych założeniach, a nie zmierzony wynik.
Odtwarzalność i weryfikacja
Pełny, wykonany kod (EDA, inżynieria cech, porównanie pięciu algorytmów, profilowanie segmentów) znajduje się w repozytorium towarzyszącym: github.com/myBytesResearch/mit-capstone-mpianowski. Projekt powstał jako capstone w MIT Professional Education Applied AI and Data Science Program (weryfikowalny certyfikat).