Cykl Data Science

Proces data science według CRISP-DM to standardowy proces projektów data science. myBytes pracuje w jego sześciu fazach i pokazuje tu na przykładzie, co dzieje się w każdej z nich.

Z Państwa surowych danych
do wartości biznesowej

Model jest tak solidny, jak proces, który go tworzy, dlatego nie pomijamy żadnej fazy.

CRISP-DM

CRISP-DM: definicja, pochodzenie i różnice

Cross-Industry Standard Process for Data Mining opisuje w sześciu fazach, jak z pytania biznesowego powstaje model działający w eksploatacji.

CRISP-DM to skrót od Cross-Industry Standard Process for Data Mining. Ten model postępowania dzieli projekt data science na sześć faz: Business Understanding, Data Understanding, Data Preparation, Modeling, Evaluation i Deployment. Każda faza ma pytanie przewodnie, zdefiniowane zadania i rezultat, którego potrzebuje faza następna. Od lat 2000. uchodzi za faktyczny standard projektów data mining i data science.

CRISP-DM opracowały od 1996 roku firmy Daimler-Benz, NCR i producent narzędzi ISL, który później wszedł w skład SPSS, z ubezpieczycielem OHRA jako czwartym partnerem; przewodnik CRISP-DM 1.0 ukazał się w 2000 roku. Model jest celowo neutralny branżowo i niezależny od narzędzi. Właśnie dlatego pasuje do projektów, o których w 1996 roku nikt nie myślał: model zwrotów w handlu odzieżą, prognoza awarii w produkcji i model rotacji w logistyce przechodzą przez te same sześć faz.

Nowsze modele postępowania budują na CRISP-DM, zamiast go zastępować. ASUM-DM od IBM uzupełnia go o eksploatację i zarządzanie projektem, TDSP od Microsoftu dodaje role, zadania i strukturę projektu, ale od 2023 roku nie jest już rozwijany, a DASC-PM z Nordakademie rozszerza go o udostępnianie danych i podstawy naukowe. Kto zna jeden z tych modeli, rozpozna w nim CRISP-DM.

Sam CRISP-DM nie określa ról; w praktyce fazy i tak rozkładają się w rozpoznawalny sposób. Fazy 1 i 2 potrzebują działu biznesowego: pytanie biznesowe, kryteria sukcesu oraz wiedza o tym, jakie dane są w firmie i co naprawdę oznacza pole w systemie gospodarki magazynowej, pochodzą od ludzi, którzy pracują z danymi. Fazy 3 i 6 to inżynieria danych: potoki, wersjonowanie, eksploatacja. Fazy 4 i 5 to praca data scientistów. Żadna faza nie należy do jednej roli, a projekt, który obsadza tylko fazy środkowe, nie ma ani solidnego pytania, ani eksploatacji.

CRISP-DM jest iteracyjny, nie liniowy. Strzałki biegną także wstecz. Jeśli ocena danych w fazie 2 pokaże, że na cel biznesowy z fazy 1 nie da się odpowiedzieć dostępnymi danymi, projekt wraca do fazy 1. Jeśli model w ewaluacji nie spełni kryteriów sukcesu, wraca do modelowania albo do przygotowania danych. Zewnętrzny krąg zamyka się po wdrożeniu: nowe dane z eksploatacji rodzą nowe pytania biznesowe.

Cykl życia data science

Pełny cykl

Każda faza opiera się na poprzedniej: iteracyjnie, przejrzyście i zgodnie z Państwa celami biznesowymi.

Fazy data science

Sześć faz procesu data science - szczegółowo

Proszę kliknąć fazę, aby zobaczyć pełny opis.

Faza 01

Zrozumienie biznesu (Business Understanding)

Definiowanie celów biznesowych i przekształcanie ich w pytania analityczne.

Pytanie przewodnie: Która decyzja ma być na końcu lepsza i po czym to Państwo poznają? Rezultat: obraz celu z kryteriami sukcesu i oceną, czy dane udźwigną pytanie.

Definicja celówKryteria sukcesuWykonalność
Zobacz szczegóły →
Faza 02

Pozyskiwanie & eksploracja danych (Data Understanding)

Identyfikacja i udostępnianie odpowiednich źródeł danych wraz z oceną jakości.

Pytanie przewodnie: Jakie dane mają już Państwo w firmie i czy wystarczą na pytanie z fazy 1? Rezultat: inwentarz danych z oceną jakości każdego źródła.

Źródła danychAnaliza jakościEksploracja
Zobacz szczegóły →
Faza 03

Przetwarzanie & inżynieria danych (Data Preparation)

Czyszczenie, transformacja i wydobywanie znaczących cech.

Pytanie przewodnie: Jak z surowych danych powstają czyste, odtwarzalne zbiory? Rezultat: wersjonowane potoki danych z kontrolami jakości. Ta faza zajmuje największą część pracy projektowej.

Czyszczenie danychCechyAutomatyzacja
Zobacz szczegóły →
Faza 04

Analiza eksploracyjna & modelowanie (Modeling)

Systematyczny rozwój i optymalizacja modeli z możliwymi do prześledzenia eksperymentami.

Pytanie przewodnie: Który model odpowiada na pytanie lepiej niż prosty punkt odniesienia? Rezultat: udokumentowane eksperymenty z modelem bazowym i najlepszymi kandydatami.

AnalizaRozwój modeluOptymalizacja
Zobacz szczegóły →
Faza 05

Ewaluacja & walidacja (Evaluation)

Rygorystyczna ocena wydajności modelu względem celów biznesowych.

Pytanie przewodnie: Czy model spełnia kryteria sukcesu z fazy 1 także w realistycznych warunkach? Rezultat: raport z walidacji z metrykami, czynnikami wpływu i rekomendacją dopuszczenia.

Ocena wydajnościWyjaśnialnośćWalidacja
Zobacz szczegóły →
Faza 06

Wdrożenie & monitoring (Deployment)

Wdrożenie produkcyjne z monitorowaniem i ciągłym doskonaleniem.

Pytanie przewodnie: Jak model trafia do eksploatacji i kto zauważy, gdy zacznie słabnąć? Rezultat: system produkcyjny z monitoringiem i przekazaniem operacji Państwa zespołowi.

OperacjeAutomatyzacjaMonitoring
Zobacz szczegóły →
Przykład CRISP-DM

Przykład CRISP-DM: zwroty w modzie, przeliczone w sześciu fazach

Przypadek użycia z naszej serii modowej, faza po fazie. Wszystkie liczby to obliczenie modelowe dla fikcyjnej firmy, nie wyniki klientów.

Średniej wielkości firma odzieżowa z 1 800 artykułami i 18 rynkami sprzedaje jeansy online. Wskaźnik zwrotów jeansów wynosi 38 procent, a przyczyną 34 procent tych zwrotów jest „nie pasuje”.

Faza 1 · Zrozumienie biznesu

Pytanie biznesowe nie brzmi „chcemy AI”, lecz: Jaką część zwrotów z powodu dopasowania da się uniknąć, jeśli klient przy zakupie dostanie rekomendację właściwego rozmiaru? Kryterium sukcesu jest wskaźnik zwrotów w każdej kategorii, mierzony przed wdrożeniem i po nim. Z fazy 1 pochodzi też ograniczenie: nowych klientów bez historii zakupów taki model może początkowo obsłużyć tylko średnimi kategorii.

Faza 2 · Pozyskiwanie & eksploracja danych

Dane są w firmie: historia zakupów, powody zwrotów, zamówiony i zatrzymany rozmiar dla każdego klienta i kroju, do tego tabele rozmiarów każdego artykułu. Faza 2 sprawdza, czy informacja o rozmiarze w danych o zwrotach jest kompletna. Jeśli jej brakuje, nie ma modelu, jest tylko statystyka.

Faza 3 · Przetwarzanie & inżynieria danych

Z surowych danych powstaje dla każdego klienta profil zatrzymanych i odesłanych rozmiarów według kroju, a dla każdego artykułu skalibrowany przebieg rozmiarów. Obliczenie modelowe zakłada, że dla 68 procent zwrotów z powodu dopasowania wystarczyłaby poprawna rekomendacja rozmiaru. Czy to założenie się utrzyma, rozstrzyga się tutaj, na jakości pól z rozmiarem.

Faza 4 · Analiza eksploracyjna & modelowanie

Model to collaborative filtering z dopasowaniem sylwetki: klienci o podobnym zachowaniu zakupowym i zwrotowym dostają rekomendację rozmiaru, który podobni klienci zatrzymali przy tym kroju. Punktem odniesienia jest tabela rozmiarów bez rekomendacji, jako prosty model referencyjny przed każdym bardziej złożonym podejściem. Jeśli model nie pobije tego odniesienia, wysiłek się nie opłaca.

Faza 5 · Ewaluacja & walidacja

W obliczeniu modelowym model trafia we właściwy rozmiar w 82 procentach przypadków. Zwroty z powodu dopasowania spadają o 18 procent, a wskaźnik zwrotów jeansów z 38 do 31 procent. Opublikowany przypadek dostawcy osiąga do 20 procent mniej zwrotów ogółem, natomiast obliczenie modelowe celowo pozostaje poniżej. Ewaluacja sprawdza też, czy efekt występuje we wszystkich kategoriach, czy tylko w jeansach.

Faza 6 · Wdrożenie & monitoring

Model działa jako widget na stronie produktu: „Na podstawie Państwa dotychczasowych zakupów rekomendujemy rozmiar 31/32”. Drugi wynik trafia do zespołu produktowego: artykuły, których tabela rozmiarów systematycznie odbiega. Monitoring dalej obserwuje wskaźnik zwrotów w każdej kategorii. Obliczenie modelowe przyjmuje 61 824 unikniętych zwrotów po 26 euro, czyli 1,61 mln euro rocznie.

FazaPytanie przewodnie w przykładzieRezultat w przykładzie
1 Business UnderstandingJakiej części zwrotów z powodu dopasowania da się uniknąć?Kryterium sukcesu: wskaźnik zwrotów w każdej kategorii
2 Data UnderstandingCzy rozmiar i powód zwrotu są rejestrowane dla każdego zamówienia?Inwentarz danych z historii zakupów, zwrotów, tabel rozmiarów
3 Data PreparationJak uczynić klienta i krój porównywalnymi?Profil rozmiarów każdego klienta, skalibrowany przebieg rozmiarów każdego artykułu
4 ModelingJaki rozmiar zatrzymują podobni klienci?Collaborative filtering z dopasowaniem sylwetki
5 EvaluationCzy model trafia w rozmiar częściej niż tabela?82 procent trafień, wskaźnik zwrotów z 38 do 31 procent (obliczenie modelowe)
6 DeploymentJak rekomendacja dociera do klienta?Widget na stronie produktu, raport dla zespołu produktowego, monitoring

Kolejny krok w tej samej serii pokazuje drugą iterację kręgu: analiza tekstu 210 000 komentarzy w wolnym tekście rozkłada „nie pasuje” na pięć przyczyn i razem z rekomendacją rozmiaru obniża łączny wskaźnik zwrotów obliczenia modelowego we wszystkich kategoriach i 18 rynkach z 28 do około 23 procent.

Obniżenie zwrotów: przypadek użycia stojący za przykładem Analiza przyczyn zwrotów: co kryje się za „nie pasuje”
Projekt data science

Gdzie i w której fazie upadają projekty data science

Opublikowane liczby o niepowodzeniach wskazują na dwie pierwsze fazy, nie na modelowanie.

Program MIT NANDA podał w sierpniu 2025 roku, że 95 procent badanych organizacji mimo wydatków na generatywną AI nie widzi mierzalnego efektu w wynikach. Rok wcześniej Gartner przewidział, że co najmniej 30 procent projektów GenAI zostanie przerwanych po proof of concept do końca 2025 roku z powodu słabej jakości danych, braku kontroli ryzyka, rosnących kosztów lub niejasnej wartości biznesowej. Niejasna wartość biznesowa i brak kontroli ryzyka to w naszej ocenie pytania fazy 1, jakość danych to pytanie fazy 2; koszty ujawniają się zwykle dopiero w eksploatacji. Nasz artykuł badawczy prześledza siedem przyczyn metodycznych, od inflacji twierdzeń we wniosku projektowym po porównanie ze słabym modelem bazowym.

Dlaczego 95% pilotaży GenAI zawodzi

Drugie ustalenie dotyczy danych. W naszych rozmowach ze średniej wielkości zespołami danych pilotaże AI rzadko upadają na modelu, a najczęściej na jakości danych, której wcześniej nikt nie sprawdził. Opublikowaliśmy do tego audyt, który w dziesięć minut sprawdza zbiór danych w siedmiu wymiarach, z oceną w skali świateł dla każdego wymiaru. Audyt należy do fazy 2, zanim wysiłek popłynie do fazy 3.

Siedem pytań rozstrzyga, czy Państwa projekt AI upadnie

Trzecie ustalenie jest najprostsze: bez spisanego celu nie ma niczego, na czym model mógłby przejść albo polec. Środek zaradczy w fazie 1 kosztuje niewiele: spisany, ustalony z góry punkt końcowy sukcesu, który mówi, jaki wskaźnik na jakiej populacji w jakim okresie będzie mierzony wobec jakiego porównania. Bez tego punktu końcowego w fazie 5 nie da się niczego zwalidować, a projekt zostaje na końcu oceniony według wrażeń, a nie liczb.

Jeśli projekt u nas się kończy, to z reguły po fazie 1 lub fazie 2, a nie dopiero po modelowaniu. Tak ma być. „Nie” po obrazie celu albo po ocenie danych jest tanie; „nie” po modelowaniu ma już za sobą najbardziej pracochłonną fazę, przygotowanie danych. Jeśli Państwa dane nie udźwigną pytania, mówimy to i proponujemy, co trzeba zrobić wcześniej.
Metodyka data science

Nasze podejście do data science

Trzy zasady przenikają każdą fazę naszych projektów.

Iteracyjne & zwinne

Krótkie pętle informacji zwrotnej z ciągłym zaangażowaniem interesariuszy.

Odtwarzalne & przejrzyste

Udokumentowane decyzje i możliwe do prześledzenia wyniki.

Business-First

Sukces mierzymy realną dostarczoną wartością, a nie złożonością modelu.

Fazy CRISP-DM

Najczęstsze pytania o CRISP-DM

Co oznacza CRISP-DM i od czego pochodzi ten skrót?

CRISP-DM to skrót od Cross-Industry Standard Process for Data Mining. Model postępowania opracowały od 1996 roku firmy Daimler-Benz, NCR i ISL (później SPSS), a w 2000 roku opublikowano go jako przewodnik. Opisuje sześć faz od pytania biznesowego do eksploatacji i jest z założenia neutralny branżowo i niezależny od narzędzi.

Jakie sześć faz ma CRISP-DM?

Business Understanding, Data Understanding, Data Preparation, Modeling, Evaluation i Deployment. W myBytes nazywają się „Zrozumienie biznesu”, „Pozyskiwanie i eksploracja danych”, „Przetwarzanie i inżynieria danych”, „Analiza eksploracyjna i modelowanie”, „Ewaluacja i walidacja” oraz „Wdrożenie i monitoring”. Fazy przebiegają iteracyjnie: cofnięcie się do wcześniejszej fazy jest przewidziane, a nie wyjątkowe.

Czy CRISP-DM jest nadal aktualny, czy są nowsze modele postępowania?

Nowsze modele, takie jak ASUM-DM, TDSP i DASC-PM, rozszerzają CRISP-DM, ale go nie zastępują. Przewodnik z 2000 roku traktuje eksploatację i nadzór tylko jako zadanie w ramach wdrożenia. Dokładnie tam uzupełniamy fazę 6 o monitoring, zautomatyzowane wydanie i przekazanie operacji. Same sześć faz pozostaje w mocy.

Jak długo trwa projekt data science według CRISP-DM?

Nie ma ryczałtowego czasu trwania i celowo go nie podajemy. Czas zależy od tego, czy dane z fazy 2 udźwigną pytanie i ile przygotowania wymaga faza 3. Wiarygodnie da się powiedzieć dwie rzeczy: faza 1 zaczyna się od rozmowy, a pierwsza kontrola danych w siedmiu wymiarach trwa dziesięć minut.

Która faza zajmuje najwięcej czasu?

Przygotowanie danych w fazie 3. Zajmuje największą część pracy projektowej, bo tu zbiegają się brakujące wartości, duplikaty i niespójności z wielu źródeł. Dlatego automatyzujemy je odtwarzalnymi potokami i kontrolami jakości. Jak to wygląda w szczegółach, opisuje strona faza 3: przygotowanie danych.

Czym różni się CRISP-DM od cyklu życia data science?

CRISP-DM to konkretny, udokumentowany model postępowania z sześcioma nazwanymi fazami. „Cykl życia data science” to pojęcie nadrzędne dla każdego cyklicznego przedstawienia projektu data science; wiele wersji to warianty CRISP-DM z mocniejszym akcentem na eksploatację. Nasz cykl to CRISP-DM pod własnymi nazwami faz, z monitoringiem jako częścią szóstej fazy.

Czy jest przykład CRISP-DM z praktyki?

Tak. Na tej stronie przeliczamy zwroty w branży mody przez wszystkie sześć faz, od pytania biznesowego po działający model, z pytaniem przewodnim i wynikiem dla każdej fazy. Stojący za tym przypadek użycia pokazuje dane, metodę i business case.

Czy CRISP-DM nadaje się też do projektów AI z modelami językowymi?

Tak, a dwie pierwsze fazy stają się tam ważniejsze, nie mniej ważne. Opublikowane powody przerywania projektów GenAI, niejasna wartość biznesowa i słaba jakość danych, to pytania fazy 1 i fazy 2. Modelowanie oznacza przy modelach językowych z reguły wybór i integrację zamiast własnego treningu; ewaluacja i monitoring pozostają obowiązkowe bez zmian.

Pierwszy krok do wyników opartych na danych

Każdy projekt zaczyna się od fazy 1: od zrozumienia Państwa biznesu. Ten pierwszy krok to rozmowa, nie umowa.

Każdy projekt jest wyjątkowy. Prosimy opowiedzieć o Państwa wyzwaniu.

Rozpocznij bezpłatną rozmowę