Analiza eksploracyjna danych:
z danych powstają inteligentne modele
Analiza eksploracyjna danych to faza 4 procesu data science: uwidocznienie wzorców, zależności i wartości odstających, zanim model zostanie wytrenowany. Potem rozwijamy, trenujemy i optymalizujemy modele uczenia maszynowego, które mogą odpowiedzieć na Państwa pytania biznesowe.
Czym jest analiza eksploracyjna danych, a czym nie jest
Analiza eksploracyjna danych, w skrócie EDA, to systematyczne obejrzenie zbioru danych przed modelowaniem: rozkłady, zależności, wartości odstające i luki zostają uwidocznione, zanim model ma odpowiedzieć na pytanie. Oglądamy zbiór danych, zanim zadamy mu pytanie. Pojęcie pochodzi od Johna W. Tukeya, który w 1977 roku w książce „Exploratory Data Analysis” opisał stojącą za nim postawę: najpierw patrzeć, potem liczyć; wykresy przed testami hipotez, mediana przed średnią, gdy rozkład jest skośny, i gotowość, by przyjąć zbiór danych takim, jaki jest.
Trzy dyscypliny są przy tym regularnie mylone:
| Porównanie | Statystyka opisowa | Analiza eksploracyjna danych | Statystyka wnioskowania |
|---|---|---|---|
| Cel | Podsumować dane | Znaleźć wzorce, osobliwości i hipotezy | Sprawdzić hipotezy i uogólnić na populację |
| Typowe narzędzia | Średnia, mediana, rozrzut, częstości | Histogram, wykres pudełkowy, wykres rozrzutu, macierz korelacji, wykres szeregu czasowego | Przedziały ufności, testy istotności, sprawdzenie założeń modelu |
| Wynik | Wskaźniki | Hipotezy, otwarte pytania, decyzje dotyczące przygotowania | Stwierdzenia z podaną niepewnością |
| W projekcie | pierwszy raport | faza 4, przed modelem | faza 5, walidacja modeli |
Dwa rozróżnienia są ważne dla Państwa projektu. Po pierwsze wobec fazy 2: w pozyskiwaniu danych sprawdzamy przez eksplorację danych, czy zbiór w ogóle udźwignie pytanie. W fazie 4 jest już pewne, że dane udźwigną, a teraz chodzi o to, na które pytanie mogą odpowiedzieć. Po drugie wobec wnioskowania: wzorzec, który rzuca się w oczy w analizie eksploracyjnej, jest hipotezą, a nie dowodem. Czy się utrzyma, rozstrzyga dopiero walidacja na danych, których model nigdy nie widział.
Eksploracja danych w fazie 2Cztery pytania EDA
Każda analiza eksploracyjna, którą przeprowadzamy, odpowiada na te same cztery pytania. Przykłady pochodzą z naszych artykułów badawczych; każdy ma otwarte repozytorium towarzyszące do samodzielnego przeliczenia.
Rozkład (histogram, wykres pudełkowy)
Jak rozkłada się każda zmienna? Histogram pokazuje skośność, ograniczenie od góry i wielomodalność, które ukrywa średnia. Przy 65 290 ocenach Amazon średnia wynosiła 4,29 gwiazdki, mediana 5: dominuje pięć gwiazdek, a każdy wskaźnik trafień wygląda przez to lepiej, niż jest. Co z tego wynika w projekcie: przekształcić zmienną docelową albo zmienić wskaźnik, zanim uruchomi się pierwszy model.
Zależność (macierz korelacji, wykres rozrzutu)
Które zmienne opowiadają to samo? W zbiorze Boston Housing stawka podatku i dostęp do autostrady korelują na poziomie 0,91, faktycznie jedna informacja zmierzona dwa razy. Co z tego wynika w projekcie: jedna cecha wylatuje, inaczej model liczy podwójnie.
Wartości odstające i luki (wykres pudełkowy, szereg czasowy)
Gdzie brakuje wartości, gdzie leżą ekstrema? Z 1 898 zamówień platformy dostawczej 736 było nieocenionych, 38,78 procent. Każde stwierdzenie o zadowoleniu opiera się więc na próbie, która sama się wybrała. Co z tego wynika w projekcie: brakujące dane to ustalenie, a nie problem na przypis.
Hipoteza (porównanie grup w czasie)
Które pytanie jest warte modelu? Ten sam zbiór dostaw pokazał w dni robocze 28,34 minuty czasu dostawy, w weekend 22,47. Dwoje analityków odczytało z tego dwie przeciwne rekomendacje: potencjał popytu albo problem operacyjny. Co z tego wynika w projekcie: EDA dostarcza hipotezę, nie decyzję. Założenie o przyczynie trzeba ujawnić, zanim model je utrwali.
Analiza eksploracyjna danych na przykładzie: trzy ustalenia przed klastrowaniem
Detalista prowadzi kampanie dla sześciu kategorii produktów w sieci, katalogu i sklepie stacjonarnym i osiąga wskaźniki akceptacji od 1 do 15 procent, bo każdy klient jest traktowany tak samo. Zbiór danych: 2 240 klientów z 26 cechami, w tym demografia, wydatki w każdej kategorii, zachowanie w kanałach i reakcja na pięć kampanii. Nie ma etykiety docelowej. Model ma znaleźć strukturę, a nie przewidywać. Zanim wybierze się metodę, musi więc być jasne, które cechy w ogóle opisują zachowanie, a które tylko osobę.
Najpierw analiza eksploracyjna. W dochodzie brakowało wartości, zastąpiono je medianą; usunięto jedną skrajną wartość odstającą, zostało 2 232 klientów. Trzy ustalenia poniosły dalszą pracę:
- Dochód jest najsilniejszym czynnikiem wydatków.
- Wino i mięso stanowią około 75 procent wydatków.
- Dzieci w gospodarstwie domowym wyraźnie obniżają wydatki premium.
Co z tego wynikło dla modelu: do klastrowania weszło 17 cech behawioralnych, demografia posłużyła tylko do profilowania. Pięć metod stanęło do porównania; wybrano nie tę z najwyższym wskaźnikiem, lecz tę, której trzy segmenty odtworzyły dwie kolejne metody. Hipoteza z analizy eksploracyjnej, że klientów rozdziela zachowanie, a nie demografia, stała się w ten sposób decyzją o modelu. Jakie to segmenty i co buduje na nich rachunek kampanii, opisuje artykuł.
Segmentacja klientów z użyciem klastrowaniaSystematyczny rozwój modeli
Modelowanie jest ustrukturyzowanym procesem. Znajdujemy najlepsze rozwiązanie dla Państwa przypadku użycia.
Wybór algorytmu
Systematyczne porównanie odpowiednich podejść dla Państwa przypadku użycia.
Optymalizacja
Celowa optymalizacja modelu dla najlepszej możliwej wydajności.
Iteracyjne doskonalenie
Możliwe do prześledzenia eksperymenty i systematyczna analiza.
Od EDA do modelu: wybór algorytmu i model bazowy
Na końcu analizy eksploracyjnej są hipoteza i odpowiedź na pytanie wstępne, które w dużej mierze przesądza o wyborze algorytmu: czy istnieje zmienna docelowa.
- Jest zmienna docelowa i jest kategorią: klasyfikacja. Czy opona będzie do wymiany za cztery tygodnie, czy sesja zakończy się zamówieniem.
- Jest zmienna docelowa i jest liczbą: regresja. Cena domu, wolumen zamówień w przyszłym miesiącu.
- Nie ma zmiennej docelowej: uczenie nienadzorowane. Klastrowanie, gdy szukamy grup, oraz wykrywanie anomalii, gdy szukamy odchyleń.
Przed pierwszym modelem uczenia maszynowego liczymy najprostszą możliwą predykcję, model bazowy: średnią, wartość z poprzedniego roku, regułę kciuka działu biznesowego. Model, który nie pobije tego odniesienia, nie jest modelem. Model bazowy chroni też przed drugą pułapką, predykcją, która tylko opowiada wynik. Model gradient boosting osiągnął na danych sklepu AUC 0,961, miarę zdolności rozdzielania klas, w której 1 to ideał, a 0,5 to przypadek, aż okazało się, że koszyk na końcu sesji niemal zdradza wynik; bez cech koszyka zostało 0,860.
Modele konwersji i leakageTrzy rodziny algorytmów uczenia maszynowego pokrywają większość projektów:
- Modele liniowe wygrywają, gdy zależności są w przybliżeniu liniowe i liczy się wyjaśnialność. Na zbiorze Boston regresja liniowa z ośmioma cechami wyjaśnia około 77 procent wariancji, a każde z jej czterech założeń zostało sprawdzone, a nie założone.
- Zespoły drzew takie jak random forest i gradient boosting wygrywają na danych tabelarycznych z mieszanymi cechami i średniej wielkości. Benchmark na 45 zbiorach tabelarycznych pokazuje, że przy około 10 000 obserwacji nadal przewyższają głębokie sieci neuronowe.
- Sieci neuronowe wygrywają przy sekwencjach, obrazach i tekście oraz przy bardzo dużych wolumenach danych: szeregi czasowe wielu klientów jednocześnie, zdjęcia, wolny tekst.
Trening modelu i strojenie hiperparametrów
Każdy trening modelu zaczyna się od podziału danych na trzy części: dane treningowe, z których model się uczy, dane walidacyjne, na których wybiera się hiperparametry, i dane testowe, których dotyka się dokładnie raz na końcu. Podział musi odpowiadać rzeczywistości. Przy danych sesyjnych dzielimy wzdłuż sesji, w przykładzie konwersji starsze 80 procent sesji do treningu, a nowsze 20 procent do testu; przy szeregach czasowych dzielimy wzdłuż czasu. Kto rozdziela wiersze losowo, ma tę samą sesję po obu stronach, a model uczy się odpowiedzi na pamięć. Dlaczego dane testowe pozostają nietknięte do końca, wyjaśnia podział train/test w fazie 5.
Hiperparametry to ustawienia, których model sam się nie uczy: głębokość drzewa, współczynnik uczenia, siła regularyzacji. Grid search wypróbowuje wszystkie kombinacje zadanej siatki. Random search losuje kombinacje i szybciej znajduje dobre obszary. Optymalizacja bayesowska wykorzystuje dotychczasowe przebiegi, by celowo wybrać następną próbę. Zysk w naszych przykładach jest skromny, a mimo to mierzalny: na danych Amazon grid search obniżył średni błąd predykcji (RMSE) metody sąsiedzkiej z 1,0012 do 0,9527, a faktoryzacji macierzy z 0,8882 do 0,8822.
Czy model nauczył się na pamięć, pokazuje porównanie części danych: w modelu Boston współczynnik determinacji R² na danych testowych (0,7725) był minimalnie wyższy od wartości treningowej (0,7672). Jak walidacja krzyżowa uściśla ten obraz, należy do fazy 5.
Regresja cen mieszkań: co naprawdę mówi R² równe 0,77Dla każdego przebiegu protokołujemy to, czego osoba trzecia potrzebuje do powtórzenia: wersję danych, ziarno losowe, podział, parametry, metryki dla każdej części danych i stan kodu. W dokumentacji eksperymentów zapisujemy więc nie tylko to, że przebieg 14 był lepszy od przebiegu 13, lecz także dlaczego i czy różnica w ogóle przekracza rozrzut między częściami danych. Z tą dokumentacją model przechodzi do fazy 5, gdzie musi się sprawdzić względem Państwa kryteriów biznesowych.
Walidacja modeli w fazie 5Nasze podejście
Wartości bazowe & punkty odniesienia
Proste modele referencyjne jako realistyczny punkt wyjścia.
Projektowanie eksperymentów
Systematycznie zaplanowane, udokumentowane i odtwarzalne eksperymenty.
Rozwój modelu
Iteracyjne porównywanie różnych podejść dla Państwa problemu.
Optymalizacja
Najlepsi kandydaci są optymalizowani pod kątem metryk istotnych biznesowo.
Typowe rezultaty
Najczęstsze pytania o analizę eksploracyjną danych
Czym jest analiza eksploracyjna danych (EDA)?
Analiza eksploracyjna danych to systematyczne obejrzenie zbioru danych przed modelowaniem: rozkłady, zależności, wartości odstające i luki zostają uwidocznione wykresami i odpornymi wskaźnikami. Pojęcie sięga Johna W. Tukeya (1977). Wynikiem są hipotezy i decyzje dotyczące przygotowania, a nie dowód.
Jakie metody należą do analizy eksploracyjnej danych?
Histogramy i wykresy pudełkowe dla rozkładów, wykresy rozrzutu i macierze korelacji dla zależności, wykresy szeregów czasowych dla przebiegów i załamań, porównania grup dla hipotez. Do tego odporne wskaźniki, jak mediana i kwartyle, których wartości odstające nie zniekształcają. W projektach dodajemy sprawdzenie brakujących wartości, bo luki same są ustaleniem.
Czym różni się statystyka eksploracyjna od opisowej?
Statystyka opisowa podsumowuje dane we wskaźnikach: średnia, rozrzut, częstości. Analiza eksploracyjna korzysta z tych wskaźników, ale ponadto szuka wzorców, osobliwości i pytań, których wcześniej nikt nie zadał. Opisowa opisuje, co jest; eksploracyjna pyta, co za tym stoi i czy model się opłaca.
Kiedy stosuje się analizę eksploracyjną danych?
Zawsze przed pierwszym modelem, czyli w fazie 4 procesu data science, po przygotowaniu danych w fazie 3. Ponadto przy każdym nowym źródle danych, po każdej zmianie systemu i gdy model w eksploatacji się pogarsza. Na platformie dostawczej praca celowo zatrzymała się na analizie eksploracyjnej: decyzja zależała od założenia o wąskim gardle, a nie od predykcji.
Jak wybrać właściwy algorytm uczenia maszynowego?
Najpierw według zmiennej docelowej: kategoria oznacza klasyfikację, liczba oznacza regresję, brak zmiennej docelowej oznacza klastrowanie lub wykrywanie anomalii. Potem według danych: tabele z mieszanymi cechami przemawiają za zespołami drzew, jak gradient boosting, sekwencje, obrazy i tekst za sieciami neuronowymi, liniowe zależności z potrzebą wyjaśnienia za modelami liniowymi. Zawsze względem modelu bazowego.
Czym jest strojenie hiperparametrów?
Hiperparametry to ustawienia, których model sam się nie uczy, na przykład głębokość drzewa czy współczynnik uczenia. Strojenie oznacza systematyczne szukanie tych ustawień na danych walidacyjnych, przez grid search, random search albo optymalizację bayesowską. Zysk jest często mały, ale mierzalny; w przykładzie Amazon RMSE jednej z metod spadł z 1,0012 do 0,9527.
Jak długo trwa trening modelu?
Samo liczenie trwa przy danych tabelarycznych od minut do godzin, przy głębokich sieciach na dużych wolumenach danych dni. Czas kalendarzowy wyznacza liczba eksperymentów: model bazowy, porównanie metod, strojenie, walidacja krzyżowa. Czas trwania fazy 4 zależy więc od wielkości danych i pytania; liczba eksperymentów decyduje o nim bardziej niż czas obliczeń.
Pogłębienie
Eksploracja danych w fazie 2 Dwoje analityków, jeden zbiór danych: gdzie liczby są te same, a rekomendacje się rozchodzą Segmentacja klientów z użyciem klastrowania Modele konwersji i leakage Rekomendacje produktów Amazon: która metoda kiedy wygrywa Prognozowanie wolumenu zamówień Regresja cen mieszkań: co naprawdę mówi R² równe 0,77 Walidacja modeli w fazie 5Porozmawiajmy o Państwa projekcie
Każdy projekt jest wyjątkowy. Prosimy opowiedzieć o Państwa wyzwaniu.
Zarezerwuj bezpłatną rozmowę wstępną