Wszystkie artykuły badawcze

E-Commerce Intelligence

Rekomendacje produktów Amazon: która metoda wygrywa kiedy

Cztery metody rekomendacji porównane na 65 290 ocenach Amazon - rank-based, user/item collaborative filtering oraz SVD. Żaden model nie wygrywa we wszystkim: dostrojony SVD dla użytkowników z historią (RMSE 0,8822), rank-based na zimny start. Projekt coursework MIT, uczciwie zmierzony, z powtarzalnym repozytorium towarzyszącym.

Każdy sklep staje przed tym samym pytaniem: który produkt pokazać temu użytkownikowi jako następny? Systemy rekomendacji odpowiadają na nie w zakresie od „to teraz kupują wszyscy" po „to pasuje do twojej historii". Ten projekt buduje cztery takie metody na tym samym zbiorze i mierzy je tymi samymi wskaźnikami - z niewygodnym wnioskiem: nie ma jednego najlepszego modelu, jest tylko ten pasujący do danego scenariusza.

Zbiór danych

Podstawą jest publiczny zbiór ocen produktów Amazon. Po wstępnym przetworzeniu do aktywnych użytkowników pozostaje 65 290 ocen od 1540 użytkowników dla 5689 produktów. Macierz użytkownik-produkt jest w 99,26% pusta - to główna trudność każdego rekomendera. A oceny są silnie optymistyczne: średnia 4,29, mediana 5. Tę skośność trzeba znać, zanim zinterpretuje się jakikolwiek pojedynczy wskaźnik.

Rozkład ocen Amazon: 5 gwiazdek wyraźnie dominuje, niskie oceny są rzadkie
Rozkład ocen - 5 gwiazdek dominuje, niskie oceny są rzadkie. Ten positivity bias zawyża później wartości precyzji.

Cztery metody, jeden uczciwy pomiar

Porównano cztery podejścia, wszystkie dostrojone przez GridSearchCV i oceniane tymi samymi metrykami - RMSE (jak dokładna jest przewidywana ocena) oraz Precision@10 i Recall@10 (próg trafności 3,5):

  • Rank-based (popularność) - poleca najwyżej oceniane produkty powyżej minimalnej liczby interakcji. Nie zna pojedynczego użytkownika i właśnie dlatego jest właściwym wyborem na zimny start (nowi użytkownicy bez historii).
  • User-user collaborative filtering - „użytkownicy tacy jak ty lubili też …".
  • Item-item collaborative filtering - „kto to lubił, lubi też …"; zwykle stabilniejszy, bo cechy produktów zmieniają się rzadziej niż gust użytkowników.
  • SVD (faktoryzacja macierzy) - rozkłada macierz na czynniki latentne i najlepiej radzi sobie z rzadkością danych.

Wyniki

MetodaRMSEPrecision@10Recall@10F1
User-user CF (baseline)1,00120,8550,8580,856
User-user CF (dostrojony)0,95270,8470,8940,870
Item-item CF (baseline)0,99500,8380,8450,841
Item-item CF (dostrojony)0,95670,8380,8890,863
SVD (baseline)0,88820,8530,8800,866
SVD (dostrojony)0,88220,8540,8840,869
Porównanie RMSE sześciu metod na pełnej osi od 0: słupki są niemal równej długości
RMSE dla poszczególnych metod na pełnej osi od 0. Dostrojony SVD (niebieski) prowadzi - ale dystans do pozostałych jest niewielki.

Na czystej dokładności predykcji wygrywa dostrojony SVD (RMSE 0,8822), tuż za nim baseline SVD i dostrojone modele CF. Na F1 dostrojony user-user (0,870) wyprzedza o włos - różnica jest marginalna.

Co analiza faktycznie pokazuje

  • Positivity bias barwi wskaźniki. Przy medianie 5 wartości precyzji około 0,85 są łatwiejsze do osiągnięcia, niż brzmią; twardszym wskaźnikiem jest RMSE.
  • Różnice są umiarkowane. Z 1,00 do 0,88 RMSE - realne, ale nie skok, który koronuje jedną metodę uniwersalnie.
  • Decyduje scenariusz, nie ranking. Dla nowych użytkowników bez historii nie ma drogi w bok od rank-based; dla użytkowników z historią dostrojony SVD lub item-item dają bardziej osobiste trafienia. W praktyce łączy się oba i regularnie dotrenowuje.

Powtarzalność i weryfikacja

Pełny, wykonany kod (EDA, wszystkie cztery metody, dostrajanie hiperparametrów) znajduje się w repozytorium towarzyszącym: github.com/myBytesResearch/amazon-product-recommendation-system. Projekt powstał jako coursework w MIT Professional Education Applied AI and Data Science Program (weryfikowalny certyfikat).