Wszystkie artykuły Research

Customer Analytics

Segmentacja klientów z clusteringiem: trzy operacyjne segmenty z 2240 klientów

Porównano pięć algorytmów clusteringu, a decyzję podjęto z rozsądkiem: nie wygrywa model z najlepszym wynikiem, lecz ten, którym da się operować. Efektem są trzy operacyjnie użyteczne segmenty klientów i strategia kampanii, która podąża za budżetem. Capstone MIT z odtwarzalnym repozytorium towarzyszącym.

Detalista prowadzi kampanie w internecie, katalogu i sklepie dla sześciu kategorii produktów, a akceptacja sięga zaledwie 1 do 15%. Powód jest prosty: każdy klient traktowany jest tak samo. Pytanie tego projektu: czy uczenie nienadzorowane potrafi odczytać naturalne segmenty klientów z danych behawioralnych, tak by budżet marketingowy trafiał tam, gdzie realnie konwertuje? Nie ma zmiennej docelowej, więc strukturę trzeba znaleźć.

Zbiór danych

Podstawą jest publiczny zbiór marketingowy (marketing_campaign.csv) z 2240 rekordami klientów i 26 atrybutami: demografia, wydatki wg kategorii (wino, owoce, mięso, ryby, słodycze, złoto), zachowanie kanałowe (web/katalog/sklep/deals) oraz reakcje na pięć kampanii. Po oczyszczeniu (imputacja mediany dla dochodu, usunięcie jednej skrajnej wartości) pozostaje 2232 modelowanych klientów. Do clusteringu trafia 17 cech behawioralnych, demografia służy tylko profilowaniu. To publiczny zbiór edukacyjny udostępniony w ramach programu capstone MIT; prawa do danych pozostają przy pierwotnym wydawcy.

Podejście: pięć algorytmów, jedna użyteczna struktura

Analiza eksploracyjna ujawniła trzy wzorce: dochód jest najsilniejszym czynnikiem wydatków, wino + mięso to ok. 75% wydatków, a dzieci wyraźnie obniżają wydatki premium. Po inżynierii cech (8 nowych), StandardScaler i PCA (10 komponentów, 90,7% wariancji) porównano pięć algorytmów clusteringu, oceniając je po wskaźniku silhouette i użyteczności operacyjnej: K-Means, K-Medoids, Hierarchical (Ward), DBSCAN i Gaussian Mixture.

Metoda łokcia i wskaźniki silhouette do wyboru liczby klastrów k
Metoda łokcia i wskaźniki silhouette w funkcji k. W połączeniu z interpretowalnością biznesową wybór padł na k=3.

Wyniki

Wskaźnik silhouette przy k=3 dla poszczególnych algorytmów:

Algorytm (k=3)SilhouetteWerdykt
K-Means (wybrany)0,2888Zrównoważony, interpretowalny, przypisuje nowych klientów
K-Medoids0,2670Porównywalny, wolniejszy
Hierarchical (Ward)0,2661Potwierdza tę samą strukturę 3 segmentów
Gaussian Mixture0,1808Słabsza separacja
DBSCAN0,4820Odrzucony: 2216 w jednym klastrze + 10 punktów szumu, brak przypisania nowych klientów

DBSCAN osiągnął najwyższy wynik, ale jest bezużyteczny w produkcji (jeden dominujący klaster, nie da się przypisać nowych klientów). Wskaźnik silhouette K-Means, 0,2888, oznacza umiarkowaną, wciąż operacyjnie interpretowalną strukturę. Nie jest to przypadek czysto odseparowanych klastrów. Wybrano K-Means (k=3), ponieważ jego trzy segmenty są odtwarzane przez K-Medoids i Hierarchical clustering, a pewność wynika właśnie z tej odtwarzalności, nie z wielkości wskaźnika. Nie wygrywa najlepszy wynik, lecz rozwiązanie broniące się i wdrażalne.

Klastry K-Means (k=3) w przestrzeni PCA, trzy operacyjnie użyteczne grupy klientów
Trzy klastry K-Means w przestrzeni PCA, rozpoznawalnie rozmieszczone wzdłuż głównych osi behawioralnych.

Trzy segmenty

SegmentUdziałŚr. dochódŚr. wydatkiZaakceptowane kampanie
Premium Enthusiasts25,4%76 319 $1 420 $1,01
Moderate Mainstream27,8%57 292 $721 $0,40
Budget Families46,8%35 475 $99 $0,17

Wszystkie kwoty w dolarach amerykańskich, zgodnie ze zbiorem źródłowym.

Finalna segmentacja klientów K-Means k=3: segmenty PCA, dochód vs wydatki, rozkład, wydatki wg kategorii
Finalna segmentacja w skrócie: rozkład, dochód vs. wydatki oraz profil wydatków wg kategorii rozpoznawalnie różnicują trzy grupy.

Od klastrów do strategii

  • Kampanie trzypoziomowe. Premium: ekskluzywne/VIP, katalog + sklep; Mainstream: cross-sell/lojalność, omnichannel; Budget: deals i pakiety rodzinne, mobile + e-mail.
  • Budżet tam, gdzie konwertuje. Udział Premium w górę, Budget w dół.
  • Dopasowanie kanału. Koniec mailingów katalogowych do Budget, skalowanie katalogu dla Premium.

Prognozowany efekt finansowy (ok. 98 tys. $ korzyści netto / ok. 196% ROI w pierwszym roku) to obliczenie modelowe na jawnych założeniach, a nie zmierzony wynik.

Odtwarzalność i weryfikacja

Pełny, wykonany kod (EDA, inżynieria cech, porównanie pięciu algorytmów, profilowanie segmentów) znajduje się w repozytorium towarzyszącym: github.com/myBytesResearch/mit-capstone-mpianowski. Projekt powstał jako capstone w MIT Professional Education Applied AI and Data Science Program (weryfikowalny certyfikat).