Customer Analytics
Segmentacja klientów z clusteringiem: trzy operacyjne segmenty z 2240 klientów
Porównano pięć algorytmów clusteringu, a decyzję podjęto z rozsądkiem: nie wygrywa model z najlepszym wynikiem, lecz ten, którym da się operować. Efektem są trzy wyraźnie rozdzielone segmenty klientów i strategia kampanii, która podąża za budżetem. Capstone MIT z powtarzalnym repozytorium towarzyszącym.
Sprzedawca prowadzi kampanie w web, katalogu i sklepie dla sześciu kategorii produktów - i osiąga akceptację na poziomie zaledwie 1 do 15%. Powód jest prosty: każdy klient traktowany jest tak samo. Pytanie tego projektu: czy uczenie nienadzorowane potrafi odczytać naturalne segmenty klientów z danych behawioralnych, tak by budżet marketingowy trafiał tam, gdzie realnie konwertuje? Nie ma zmiennej docelowej - strukturę trzeba znaleźć.
Zbiór danych
Podstawą jest publiczny zbiór marketingowy (marketing_campaign.csv) z 2240
rekordami klientów i 26 atrybutami: demografia, wydatki wg kategorii (wino, owoce, mięso, ryby,
słodycze, złoto), zachowanie kanałowe (web/katalog/sklep/deals) oraz reakcje na pięć kampanii. Po
oczyszczeniu (imputacja mediany dla dochodu, usunięcie jednej skrajnej wartości) pozostaje
2232 modelowanych klientów; 17 cech behawioralnych trafia do
clusteringu, demografia służy tylko profilowaniu.
Podejście: pięć algorytmów, jedna użyteczna struktura
Analiza eksploracyjna ujawniła trzy wzorce: dochód jest najsilniejszym czynnikiem wydatków, wino + mięso to ok. 75% wydatków, a dzieci wyraźnie obniżają wydatki premium. Po inżynierii cech (8 nowych), StandardScaler i PCA (10 komponentów, 90,7% wariancji) porównano pięć algorytmów clusteringu - oceniając je po wskaźniku silhouette i użyteczności operacyjnej: K-Means, K-Medoids, Hierarchical (Ward), DBSCAN i Gaussian Mixture.
Wyniki
Wskaźnik silhouette przy k=3 dla poszczególnych algorytmów:
| Algorytm (k=3) | Silhouette | Werdykt |
|---|---|---|
| K-Means (wybrany) | 0,2888 | Zrównoważony, interpretowalny, przypisuje nowych klientów |
| K-Medoids | 0,2670 | Porównywalny, wolniejszy |
| Hierarchical (Ward) | 0,2661 | Potwierdza tę samą strukturę 3 segmentów |
| Gaussian Mixture | 0,1808 | Słabsza separacja |
| DBSCAN | 0,4820 | Odrzucony - 2216 w jednym klastrze + 10 punktów szumu, brak przypisania nowych klientów |
DBSCAN osiągnął najwyższy wynik - ale jest bezużyteczny w produkcji (jeden dominujący klaster, nie da się przypisać nowych klientów). Wybrano K-Means (k=3): jego trzy segmenty są odtwarzane przez K-Medoids i Hierarchical clustering (wysoka pewność). Nie wygrywa najlepszy wynik, lecz rozwiązanie broniące się i wdrażalne.
Trzy segmenty
| Segment | Udział | Śr. dochód | Śr. wydatki | Zaakceptowane kampanie |
|---|---|---|---|---|
| 💎 Premium Enthusiasts | 25,4% | 76 319 $ | 1 420 $ | 1,01 |
| 🛒 Moderate Mainstream | 27,8% | 57 292 $ | 721 $ | 0,40 |
| 👨👩👧 Budget Families | 46,8% | 35 475 $ | 99 $ | 0,17 |
Od klastrów do strategii
- Kampanie trzypoziomowe - Premium: ekskluzywne/VIP, katalog + sklep; Mainstream: cross-sell/lojalność, omnichannel; Budget: deals i pakiety rodzinne, mobile + e-mail.
- Budżet tam, gdzie konwertuje - udział Premium w górę, Budget w dół.
- Dopasowanie kanału - koniec mailingów katalogowych do Budget; skalowanie katalogu dla Premium.
Prognozowany efekt finansowy (ok. 98 tys. $ korzyści netto / ok. 196% ROI w pierwszym roku) to obliczenie modelowe na jawnych założeniach - nie zmierzony wynik.
Powtarzalność i weryfikacja
Pełny, wykonany kod (EDA, inżynieria cech, porównanie pięciu algorytmów, profilowanie segmentów) znajduje się w repozytorium towarzyszącym: github.com/myBytesResearch/mit-capstone-mpianowski. Projekt powstał jako capstone w MIT Professional Education Applied Data Science Program (weryfikowalny certyfikat).
Dane klientów, z których chcesz wyciągnąć więcej? Porozmawiajmy o segmentacji.