Wszystkie artykuły Research

Customer Analytics

Segmentacja klientów z clusteringiem: trzy operacyjne segmenty z 2240 klientów

Porównano pięć algorytmów clusteringu, a decyzję podjęto z rozsądkiem: nie wygrywa model z najlepszym wynikiem, lecz ten, którym da się operować. Efektem są trzy wyraźnie rozdzielone segmenty klientów i strategia kampanii, która podąża za budżetem. Capstone MIT z powtarzalnym repozytorium towarzyszącym.

Sprzedawca prowadzi kampanie w web, katalogu i sklepie dla sześciu kategorii produktów - i osiąga akceptację na poziomie zaledwie 1 do 15%. Powód jest prosty: każdy klient traktowany jest tak samo. Pytanie tego projektu: czy uczenie nienadzorowane potrafi odczytać naturalne segmenty klientów z danych behawioralnych, tak by budżet marketingowy trafiał tam, gdzie realnie konwertuje? Nie ma zmiennej docelowej - strukturę trzeba znaleźć.

Zbiór danych

Podstawą jest publiczny zbiór marketingowy (marketing_campaign.csv) z 2240 rekordami klientów i 26 atrybutami: demografia, wydatki wg kategorii (wino, owoce, mięso, ryby, słodycze, złoto), zachowanie kanałowe (web/katalog/sklep/deals) oraz reakcje na pięć kampanii. Po oczyszczeniu (imputacja mediany dla dochodu, usunięcie jednej skrajnej wartości) pozostaje 2232 modelowanych klientów; 17 cech behawioralnych trafia do clusteringu, demografia służy tylko profilowaniu.

Podejście: pięć algorytmów, jedna użyteczna struktura

Analiza eksploracyjna ujawniła trzy wzorce: dochód jest najsilniejszym czynnikiem wydatków, wino + mięso to ok. 75% wydatków, a dzieci wyraźnie obniżają wydatki premium. Po inżynierii cech (8 nowych), StandardScaler i PCA (10 komponentów, 90,7% wariancji) porównano pięć algorytmów clusteringu - oceniając je po wskaźniku silhouette i użyteczności operacyjnej: K-Means, K-Medoids, Hierarchical (Ward), DBSCAN i Gaussian Mixture.

Metoda łokcia i wskaźniki silhouette do wyboru liczby klastrów k
Metoda łokcia i wskaźniki silhouette w funkcji k. W połączeniu z interpretowalnością biznesową wybór padł na k=3.

Wyniki

Wskaźnik silhouette przy k=3 dla poszczególnych algorytmów:

Algorytm (k=3)SilhouetteWerdykt
K-Means (wybrany)0,2888Zrównoważony, interpretowalny, przypisuje nowych klientów
K-Medoids0,2670Porównywalny, wolniejszy
Hierarchical (Ward)0,2661Potwierdza tę samą strukturę 3 segmentów
Gaussian Mixture0,1808Słabsza separacja
DBSCAN0,4820Odrzucony - 2216 w jednym klastrze + 10 punktów szumu, brak przypisania nowych klientów

DBSCAN osiągnął najwyższy wynik - ale jest bezużyteczny w produkcji (jeden dominujący klaster, nie da się przypisać nowych klientów). Wybrano K-Means (k=3): jego trzy segmenty są odtwarzane przez K-Medoids i Hierarchical clustering (wysoka pewność). Nie wygrywa najlepszy wynik, lecz rozwiązanie broniące się i wdrażalne.

Klastry K-Means (k=3) w przestrzeni PCA, trzy wyraźnie rozdzielone grupy klientów
Trzy klastry K-Means w przestrzeni PCA - wyraźnie rozdzielone wzdłuż głównych osi behawioralnych.

Trzy segmenty

SegmentUdziałŚr. dochódŚr. wydatkiZaakceptowane kampanie
💎 Premium Enthusiasts25,4%76 319 $1 420 $1,01
🛒 Moderate Mainstream27,8%57 292 $721 $0,40
👨‍👩‍👧 Budget Families46,8%35 475 $99 $0,17
Finalna segmentacja klientów K-Means k=3: segmenty PCA, dochód vs wydatki, rozkład, wydatki wg kategorii
Finalna segmentacja w skrócie: rozkład, dochód vs. wydatki oraz profil wydatków wg kategorii wyraźnie rozdzielają trzy grupy.

Od klastrów do strategii

  • Kampanie trzypoziomowe - Premium: ekskluzywne/VIP, katalog + sklep; Mainstream: cross-sell/lojalność, omnichannel; Budget: deals i pakiety rodzinne, mobile + e-mail.
  • Budżet tam, gdzie konwertuje - udział Premium w górę, Budget w dół.
  • Dopasowanie kanału - koniec mailingów katalogowych do Budget; skalowanie katalogu dla Premium.

Prognozowany efekt finansowy (ok. 98 tys. $ korzyści netto / ok. 196% ROI w pierwszym roku) to obliczenie modelowe na jawnych założeniach - nie zmierzony wynik.

Powtarzalność i weryfikacja

Pełny, wykonany kod (EDA, inżynieria cech, porównanie pięciu algorytmów, profilowanie segmentów) znajduje się w repozytorium towarzyszącym: github.com/myBytesResearch/mit-capstone-mpianowski. Projekt powstał jako capstone w MIT Professional Education Applied Data Science Program (weryfikowalny certyfikat).

Dane klientów, z których chcesz wyciągnąć więcej? Porozmawiajmy o segmentacji.