Faza 02 cyklu Data Science

Pozyskiwanie danych:
identyfikacja i dostęp do właściwych danych

Pozyskiwanie danych to faza 2 procesu data science: znaleźć właściwe źródła danych, uzyskać do nich dostęp i ocenić ich jakość. Dane są surowcem każdego rozwiązania AI.

Pozyskiwanie danych

Dane jako zasób strategiczny

Jakość Państwa danych wyznacza pułap tego, co AI może osiągnąć.

Pozyskiwanie danych to zdobycie danych, których potrzebuje projekt data science: istniejące źródła danych są identyfikowane, dostęp jest ustalany, dane są po raz pierwszy przeglądane, a ich jakość oceniana. W procesie CRISP-DM ta faza nazywa się Data Understanding. Kończy się inwentarzem danych i osądem, czy dane udźwigną pytanie z fazy 1.

Pojęcie ma dwa znaczenia. W technice pomiarowej pozyskiwanie danych, po angielsku data acquisition albo DAQ, oznacza rejestrowanie sygnałów czujników na maszynach i instalacjach. Ta strona dotyczy drugiego znaczenia: zdobycia danych do projektu analitycznego albo uczenia maszynowego. Pierwsze pytanie rzadko dotyczy przy tym danych, które trzeba zebrać na nowo, a częściej tych, które Państwo już mają. Zwykle leżą w gospodarce magazynowej, w sklepie, w sterowniku maszyny i w tabelach działów.

Inwentaryzacja danych

Systematyczny katalog dostępnych źródeł danych z oceną trafności.

Analiza jakości

Ocena kompletności, spójności i dokładności.

Ścieżki dostępu

Identyfikacja optymalnych dróg bezpiecznego udostępniania danych.

Źródła danych

Identyfikacja źródeł danych: cztery klasy w średnich firmach

Źródła danych projektu w średniej firmie dają się uporządkować w cztery klasy. Do każdej należy typowa pułapka, która powinna rzucić się w oczy przy pierwszym przeglądzie.

ERP i gospodarka magazynowa

Zamówienia, odwołania, stany magazynowe, kartoteka artykułów i dostawców: historia zamówień i stanów, z której powstają prognozy zapotrzebowania, bez nowej rejestracji. Typowa pułapka: decydująca informacja znajduje się w polu uwag, na przykład powód anulowania albo warunek specjalny, i trzeba ją najpierw przełożyć na policzalne kategorie.

CRM, sklep i śledzenie w sieci

Historia zakupów, zwroty, sesje w sklepie: źródła dla modeli zwrotów, konwersji i segmentacji. Typowa pułapka: ten sam klient występuje w sprzedaży, księgowości i sklepie w trzech pisowniach; bez wspólnego klucza historii zakupów i zwrotów nie da się połączyć.

Dane maszynowe i z czujników

Sterowniki i czujniki dostarczają pomiary co sekundę, często rejestrowane od lat i nigdy systematycznie nieanalizowane. Rejestracja danych produkcyjnych i system realizacji produkcji (MES) dokładają warstwę organizacyjną: postęp zleceń, liczby sztuk, powody przestojów. Typowa pułapka: sterownik, MES i ERP protokołują to samo zlecenie z własnymi zegarami i własnym taktem, a do tego dochodzą luki w szeregach czasowych, zmieniające się jednostki i podwójne numery zleceń.

Rejestracja danych procesowych: skąd pochodzą dane maszynowe i ile są warte

Dane zewnętrzne

Pogoda, ceny rynkowe, święta, geodane i zdjęcia satelitarne uzupełniają własne dane tam, gdzie przyczyna leży poza firmą. Typowa pułapka: dane zewnętrzne są podłączane według dzisiejszego stanu, którego w momencie decyzji jeszcze nie było. A bez udokumentowanego źródła i wersji wyniku nie da się później prześledzić.

Zewnętrzne geodane jako źródło danych: przykład EUDR

Mierzenie jakości danych

Ocena jakości danych: sześć kryteriów i jak je mierzymy

Jakość danych to stopień, w jakim zbiór danych nadaje się do określonego celu. Ocenia się ją nie ryczałtowo, lecz według pojedynczych kryteriów: kompletności, spójności, dokładności, aktualności, unikalności i głębokości historii. Każde kryterium ma miarę i próg zależny od przypadku użycia; ten sam zbiór może wystarczyć do raportu, a do prognozy nie.

Pięć z sześciu kryteriów mierzymy naszym audytem jakości danych, który w dziesięć minut sprawdza zbiór w siedmiu wymiarach i dla każdego wymiaru wystawia ocenę w skali świateł, a głębokość historii sprawdzamy wobec pytania z fazy 1. Progi to reguły kciuka, nie norma.

KryteriumPytanieMiaraPróg (reguła kciuka)
KompletnośćCzy pola obowiązkowe są wypełnione?Udział braków w każdej kolumnie po zadeklarowaniu zastępników jak „?” albo 9999 jako brakówPoniżej około 5 procent bez wzorca niekrytyczne; powyżej albo przy systematycznym braku krytyczne
SpójnośćCzy typy, jednostki i formaty są jednolite w każdej kolumnie?Dryf typu w kolumnie, data jako tekst, separatory dziesiętne, strefy czasowe i klucze między tabelamiKażde odchylenie jest deklarowane, a niewyjaśniony dryf typu jest krytyczny
Dokładność i wiarygodnośćCzy wartości są merytorycznie możliwe?Wartości odstające w każdej kolumnie numerycznej według Tukeya (1,5-krotność rozstępu ćwiartkowego) i 5 sigma; merytoryczne zakresy wartościWartości odstające są liczone i merytorycznie klasyfikowane; to przypadek do czyszczenia, nie powód do zatrzymania
AktualnośćJak aktualny i pozbawiony luk jest szereg czasowy?Odstęp najnowszego punktu danych od daty odniesienia; luki czasowe większe niż trzykrotny medianowy krok między obserwacjamiKażda luka wymaga wyjaśnienia (weekend, święto, awaria); niewyjaśnione luki są krytyczne
UnikalnośćCzy każda transakcja występuje dokładnie raz?Duplikaty w pełnym wierszu i w zadeklarowanych kolumnach kluczowychDuplikaty techniczne są niekrytyczne, jeśli da się je policzyć; merytoryczne bez reguły są krytyczne
Głębokość historiiCzy okres obejmuje pytanie?Objęty okres wobec sezonowości i horyzontu prognozyDo prognoz zwykle 12 do 24 miesięcy zależnie od sezonowości i granulacji; jeśli historia nie obejmuje pytania, to powód do zatrzymania

Jak ustalenia są czyszczone, opisuje faza 3.

Zbiór danych może wyglądać na technicznie czysty, a mimo to nie nadawać się do prognozowania, uczenia maszynowego ani raportowania zarządczego. Dlatego ocena kończy się osądem dla każdego źródła, a ten osąd może brzmieć nie: jeśli brakuje wielkości docelowej albo historia nie obejmuje okresu pytania, mówimy to teraz, zanim wysiłek popłynie do przygotowania.
Data Quality Check w stałej cenie: sprawdzić jakość danych, zanim projekt wystartuje Siedem pytań rozstrzyga, czy Państwa projekt AI upadnie: audyt do samodzielnego zastosowania
Eksploracja danych

Eksploracja danych: pierwsze spojrzenie, zanim zacznie się modelowanie

Eksploracja danych w fazie 2 to sprawdzenie przydatności, nie analiza. Oglądamy najważniejsze kolumny: rozkłady, brakujące wartości i pytanie, czy wielkość docelowa w ogóle istnieje. Analiza eksploracyjna danych w fazie 4 idzie potem głębiej: szuka na przygotowanych danych wzorców, zależności i hipotez dla modelu. Tu się sprawdza, tam się pyta.

Trzy ustalenia powtarzają się w projektach:

  1. Wielkość docelowa sama jest luką. Na platformie dostawczej oceny klienta, którą należało wyjaśnić, brakowało przy więcej niż co trzecim zamówieniu.
  2. Kolumna wygląda na kompletną, a nie jest. W zbiorze UCI Adult kolumna Workclass uchodzi za wypełnioną w 100 procentach, dopóki znak zapytania nie zostanie zadeklarowany jako brak; wtedy pokazuje się 5,6 procent luk.
  3. Najsilniejsza cecha potrzebuje historii. W naszej analizie 2,33 mln pozycji zamówień detalisty odzieżowego dotychczasowy wskaźnik zwrotów klienta był najsilniejszym sygnałem następnego zwrotu. Ten sygnał istnieje tylko dla klientów z wcześniejszymi zamówieniami; głębokość historii współdecyduje więc, jaki model jest możliwy.
Dwoje analityków, jeden zbiór danych: te same liczby, dwie rekomendacje
Udostępnianie danych

Dostęp do danych i ochrona danych: jak dane bezpiecznie do nas trafiają

Ocena potrzebuje dostępu do danych, ale nie ich przenoszenia. Pracujemy najchętniej w Państwa infrastrukturze, dzięki czemu dane nie muszą opuszczać firmy. Oferujemy trzy drogi:

  • Dostęp w Państwa środowisku: Udostępniają Państwo maszynę wirtualną z kopiami albo wyciągami danych, my otrzymujemy dostęp na czas oznaczony, a potem mogą Państwo tę maszynę usunąć.
  • Pakiet analityczny u Państwa: Dostarczamy odtwarzalny pakiet analityczny jako kontener albo zestaw skryptów, uruchamia go zespół Państwa firmy, a z powrotem przychodzą raporty i wskaźniki.
  • Zanonimizowane wyciągi: Dla danych niekrytycznych wystarczą wyciągi pseudonimizowane albo syntetyzowane. Wyciąg musi zawierać typowe przypadki, wyjątki i okresy; dziesięć wierszy z milionów wystarcza tylko do sprawdzenia formatu.

Dane osobowe przetwarzamy tylko wtedy, gdy są niezbędne do celu i istnieje w tej sprawie umowa, tam gdzie to możliwe w formie pseudonimizowanej. Odpowiada to zasadom ograniczenia celu i minimalizacji danych z RODO. Porady prawnej w zakresie ochrony danych tym nie zastępujemy.

Na start oferujemy ocenę jakości z tej fazy jako Data Quality Check w stałej cenie.

Dalej do fazy 3: przygotowanie danych

Schematyczny przepływ danych: ERP/CRM, czujniki IoT, API i otwarte dane zasilają potok danych (ETL, ELT albo streaming); wynikiem jest katalog danych, w którym każde źródło jest sprofilowane, udokumentowane i zabezpieczone jakościowo. Schemat, nie pomiar projektowy.

Podejście w projekcie data science

Nasze podejście

01

Inwentaryzacja

Rejestrujemy i katalogujemy wszystkie istotne źródła danych wraz z metadanymi.

02

Ocena jakości

Sprawdzanie brakujących wartości, niespójności, wartości odstających i zgodności ze schematem.

03

Pierwszy przegląd

Eksploracja danych: sprawdzenie rozkładów, luk i wielkości docelowej; analiza eksploracyjna danych następuje w fazie 4.

04

Udostępnianie danych

Projektowanie bezpiecznych, odtwarzalnych ścieżek dostępu.

Rezultaty data science

Typowe rezultaty

Przegląd istotnych źródeł danych
Raport jakości danych
Pierwsza eksploracja danych z osądem przydatności
Rekomendacje dotyczące udostępniania danych
FAQ o pozyskiwaniu danych

Najczęstsze pytania o pozyskiwanie danych

Co oznacza pozyskiwanie danych w projekcie data science?

Pozyskiwanie danych to faza 2 procesu data science, w standardzie CRISP-DM Data Understanding. Istniejące źródła danych są identyfikowane, dostęp jest ustalany, dane są przeglądane, a ich jakość oceniana. Wynikiem są inwentarz danych z osądem jakości dla każdego źródła i decyzja, czy dane udźwigną pytanie biznesowe.

Jakich źródeł danych potrzebuje projekt uczenia maszynowego co najmniej?

Jednego źródła, w którym występuje wielkość docelowa, którą model ma przewidywać, na przykład zwrot, awaria albo ilość zamówienia. Do tego cech znanych w momencie predykcji oraz klucza łączącego jedno z drugim, na przykład numeru zamówienia albo ID klienta. Jeśli brakuje jednego z nich, nie ma modelu, jest tylko statystyka.

Ile historii danych jest potrzebne?

Do prognoz zwykle 12 do 24 miesięcy, zależnie od sezonowości i granulacji. Nasze obliczenia modelowe z przykładowymi firmami zakładają dla prognoz zużycia co najmniej sześć miesięcy historii telematyki i warsztatu, dla wolumenu zamówień 24 miesiące, a dla powodów zwrotów dwa lata komentarzy w wolnym tekście; to założenia, nie wartości klientów.

Jak ocenić jakość danych, zanim zbuduje się model?

Według pojedynczych kryteriów z miarą i progiem: kompletność, spójność, dokładność, aktualność, unikalność i głębokość historii. Pięć z nich sprawdza nasz audyt w dziesięć minut, z oceną w skali świateł dla każdego wymiaru, a głębokość historii sprawdzamy wobec pytania. Decydujący jest cel: ten sam zbiór może wystarczyć do raportu, a do prognozy nie.

Czy musimy przekazać dane myBytes, czy mogą zostać w firmie?

Mogą zostać w firmie. Pracujemy najchętniej w Państwa infrastrukturze, z kopiami, wyciągami albo zanonimizowanymi danymi, na przykład na maszynie wirtualnej u Państwa albo z pakietem analitycznym dla Państwa zespołu. Dane osobowe przetwarzamy tylko wtedy, gdy są niezbędne do celu i istnieje umowa.

Czym różni się eksploracja danych od analizy eksploracyjnej danych?

Eksploracja danych w fazie 2 sprawdza przydatność: rozkłady najważniejszych kolumn, luki, czy wielkość docelowa istnieje. Analiza eksploracyjna danych (EDA) w fazie 4 szuka na przygotowanych danych wzorców, zależności i hipotez dla modelu. Pierwsza odpowiada, czy dane udźwigną pytanie; druga, na które pytanie mogą odpowiedzieć.

Czy wystarczą nasze dane z ERP, czy potrzebujemy danych maszynowych?

To zależy od pytania. Prognozy zapotrzebowania i stanów powstają z historii zamówień, odwołań i stanów w ERP, bez nowej rejestracji. Prognozy awarii albo braków potrzebują historii czujników i konserwacji ze sterownika albo MES. Nowe czujniki rzadko są pierwszym krokiem; zwykle wystarcza to, co sterowniki, rejestracja danych produkcyjnych i ERP już zapisują.

Porozmawiajmy o Państwa projekcie

Każdy projekt jest wyjątkowy. Prosimy opowiedzieć o Państwa wyzwaniu.

Zarezerwuj bezpłatną rozmowę wstępną