Pozyskiwanie danych:
identyfikacja i dostęp do właściwych danych
Pozyskiwanie danych to faza 2 procesu data science: znaleźć właściwe źródła danych, uzyskać do nich dostęp i ocenić ich jakość. Dane są surowcem każdego rozwiązania AI.
Dane jako zasób strategiczny
Jakość Państwa danych wyznacza pułap tego, co AI może osiągnąć.
Pozyskiwanie danych to zdobycie danych, których potrzebuje projekt data science: istniejące źródła danych są identyfikowane, dostęp jest ustalany, dane są po raz pierwszy przeglądane, a ich jakość oceniana. W procesie CRISP-DM ta faza nazywa się Data Understanding. Kończy się inwentarzem danych i osądem, czy dane udźwigną pytanie z fazy 1.
Pojęcie ma dwa znaczenia. W technice pomiarowej pozyskiwanie danych, po angielsku data acquisition albo DAQ, oznacza rejestrowanie sygnałów czujników na maszynach i instalacjach. Ta strona dotyczy drugiego znaczenia: zdobycia danych do projektu analitycznego albo uczenia maszynowego. Pierwsze pytanie rzadko dotyczy przy tym danych, które trzeba zebrać na nowo, a częściej tych, które Państwo już mają. Zwykle leżą w gospodarce magazynowej, w sklepie, w sterowniku maszyny i w tabelach działów.
Inwentaryzacja danych
Systematyczny katalog dostępnych źródeł danych z oceną trafności.
Analiza jakości
Ocena kompletności, spójności i dokładności.
Ścieżki dostępu
Identyfikacja optymalnych dróg bezpiecznego udostępniania danych.
Identyfikacja źródeł danych: cztery klasy w średnich firmach
Źródła danych projektu w średniej firmie dają się uporządkować w cztery klasy. Do każdej należy typowa pułapka, która powinna rzucić się w oczy przy pierwszym przeglądzie.
ERP i gospodarka magazynowa
Zamówienia, odwołania, stany magazynowe, kartoteka artykułów i dostawców: historia zamówień i stanów, z której powstają prognozy zapotrzebowania, bez nowej rejestracji. Typowa pułapka: decydująca informacja znajduje się w polu uwag, na przykład powód anulowania albo warunek specjalny, i trzeba ją najpierw przełożyć na policzalne kategorie.
CRM, sklep i śledzenie w sieci
Historia zakupów, zwroty, sesje w sklepie: źródła dla modeli zwrotów, konwersji i segmentacji. Typowa pułapka: ten sam klient występuje w sprzedaży, księgowości i sklepie w trzech pisowniach; bez wspólnego klucza historii zakupów i zwrotów nie da się połączyć.
Dane maszynowe i z czujników
Sterowniki i czujniki dostarczają pomiary co sekundę, często rejestrowane od lat i nigdy systematycznie nieanalizowane. Rejestracja danych produkcyjnych i system realizacji produkcji (MES) dokładają warstwę organizacyjną: postęp zleceń, liczby sztuk, powody przestojów. Typowa pułapka: sterownik, MES i ERP protokołują to samo zlecenie z własnymi zegarami i własnym taktem, a do tego dochodzą luki w szeregach czasowych, zmieniające się jednostki i podwójne numery zleceń.
Rejestracja danych procesowych: skąd pochodzą dane maszynowe i ile są warte
Dane zewnętrzne
Pogoda, ceny rynkowe, święta, geodane i zdjęcia satelitarne uzupełniają własne dane tam, gdzie przyczyna leży poza firmą. Typowa pułapka: dane zewnętrzne są podłączane według dzisiejszego stanu, którego w momencie decyzji jeszcze nie było. A bez udokumentowanego źródła i wersji wyniku nie da się później prześledzić.
Ocena jakości danych: sześć kryteriów i jak je mierzymy
Jakość danych to stopień, w jakim zbiór danych nadaje się do określonego celu. Ocenia się ją nie ryczałtowo, lecz według pojedynczych kryteriów: kompletności, spójności, dokładności, aktualności, unikalności i głębokości historii. Każde kryterium ma miarę i próg zależny od przypadku użycia; ten sam zbiór może wystarczyć do raportu, a do prognozy nie.
Pięć z sześciu kryteriów mierzymy naszym audytem jakości danych, który w dziesięć minut sprawdza zbiór w siedmiu wymiarach i dla każdego wymiaru wystawia ocenę w skali świateł, a głębokość historii sprawdzamy wobec pytania z fazy 1. Progi to reguły kciuka, nie norma.
| Kryterium | Pytanie | Miara | Próg (reguła kciuka) |
|---|---|---|---|
| Kompletność | Czy pola obowiązkowe są wypełnione? | Udział braków w każdej kolumnie po zadeklarowaniu zastępników jak „?” albo 9999 jako braków | Poniżej około 5 procent bez wzorca niekrytyczne; powyżej albo przy systematycznym braku krytyczne |
| Spójność | Czy typy, jednostki i formaty są jednolite w każdej kolumnie? | Dryf typu w kolumnie, data jako tekst, separatory dziesiętne, strefy czasowe i klucze między tabelami | Każde odchylenie jest deklarowane, a niewyjaśniony dryf typu jest krytyczny |
| Dokładność i wiarygodność | Czy wartości są merytorycznie możliwe? | Wartości odstające w każdej kolumnie numerycznej według Tukeya (1,5-krotność rozstępu ćwiartkowego) i 5 sigma; merytoryczne zakresy wartości | Wartości odstające są liczone i merytorycznie klasyfikowane; to przypadek do czyszczenia, nie powód do zatrzymania |
| Aktualność | Jak aktualny i pozbawiony luk jest szereg czasowy? | Odstęp najnowszego punktu danych od daty odniesienia; luki czasowe większe niż trzykrotny medianowy krok między obserwacjami | Każda luka wymaga wyjaśnienia (weekend, święto, awaria); niewyjaśnione luki są krytyczne |
| Unikalność | Czy każda transakcja występuje dokładnie raz? | Duplikaty w pełnym wierszu i w zadeklarowanych kolumnach kluczowych | Duplikaty techniczne są niekrytyczne, jeśli da się je policzyć; merytoryczne bez reguły są krytyczne |
| Głębokość historii | Czy okres obejmuje pytanie? | Objęty okres wobec sezonowości i horyzontu prognozy | Do prognoz zwykle 12 do 24 miesięcy zależnie od sezonowości i granulacji; jeśli historia nie obejmuje pytania, to powód do zatrzymania |
Jak ustalenia są czyszczone, opisuje faza 3.
Eksploracja danych: pierwsze spojrzenie, zanim zacznie się modelowanie
Eksploracja danych w fazie 2 to sprawdzenie przydatności, nie analiza. Oglądamy najważniejsze kolumny: rozkłady, brakujące wartości i pytanie, czy wielkość docelowa w ogóle istnieje. Analiza eksploracyjna danych w fazie 4 idzie potem głębiej: szuka na przygotowanych danych wzorców, zależności i hipotez dla modelu. Tu się sprawdza, tam się pyta.
Trzy ustalenia powtarzają się w projektach:
- Wielkość docelowa sama jest luką. Na platformie dostawczej oceny klienta, którą należało wyjaśnić, brakowało przy więcej niż co trzecim zamówieniu.
- Kolumna wygląda na kompletną, a nie jest. W zbiorze UCI Adult kolumna Workclass uchodzi za wypełnioną w 100 procentach, dopóki znak zapytania nie zostanie zadeklarowany jako brak; wtedy pokazuje się 5,6 procent luk.
- Najsilniejsza cecha potrzebuje historii. W naszej analizie 2,33 mln pozycji zamówień detalisty odzieżowego dotychczasowy wskaźnik zwrotów klienta był najsilniejszym sygnałem następnego zwrotu. Ten sygnał istnieje tylko dla klientów z wcześniejszymi zamówieniami; głębokość historii współdecyduje więc, jaki model jest możliwy.
Dostęp do danych i ochrona danych: jak dane bezpiecznie do nas trafiają
Ocena potrzebuje dostępu do danych, ale nie ich przenoszenia. Pracujemy najchętniej w Państwa infrastrukturze, dzięki czemu dane nie muszą opuszczać firmy. Oferujemy trzy drogi:
- Dostęp w Państwa środowisku: Udostępniają Państwo maszynę wirtualną z kopiami albo wyciągami danych, my otrzymujemy dostęp na czas oznaczony, a potem mogą Państwo tę maszynę usunąć.
- Pakiet analityczny u Państwa: Dostarczamy odtwarzalny pakiet analityczny jako kontener albo zestaw skryptów, uruchamia go zespół Państwa firmy, a z powrotem przychodzą raporty i wskaźniki.
- Zanonimizowane wyciągi: Dla danych niekrytycznych wystarczą wyciągi pseudonimizowane albo syntetyzowane. Wyciąg musi zawierać typowe przypadki, wyjątki i okresy; dziesięć wierszy z milionów wystarcza tylko do sprawdzenia formatu.
Dane osobowe przetwarzamy tylko wtedy, gdy są niezbędne do celu i istnieje w tej sprawie umowa, tam gdzie to możliwe w formie pseudonimizowanej. Odpowiada to zasadom ograniczenia celu i minimalizacji danych z RODO. Porady prawnej w zakresie ochrony danych tym nie zastępujemy.
Na start oferujemy ocenę jakości z tej fazy jako Data Quality Check w stałej cenie.
Dalej do fazy 3: przygotowanie danychSchematyczny przepływ danych: ERP/CRM, czujniki IoT, API i otwarte dane zasilają potok danych (ETL, ELT albo streaming); wynikiem jest katalog danych, w którym każde źródło jest sprofilowane, udokumentowane i zabezpieczone jakościowo. Schemat, nie pomiar projektowy.
Nasze podejście
Inwentaryzacja
Rejestrujemy i katalogujemy wszystkie istotne źródła danych wraz z metadanymi.
Ocena jakości
Sprawdzanie brakujących wartości, niespójności, wartości odstających i zgodności ze schematem.
Pierwszy przegląd
Eksploracja danych: sprawdzenie rozkładów, luk i wielkości docelowej; analiza eksploracyjna danych następuje w fazie 4.
Udostępnianie danych
Projektowanie bezpiecznych, odtwarzalnych ścieżek dostępu.
Typowe rezultaty
Najczęstsze pytania o pozyskiwanie danych
Co oznacza pozyskiwanie danych w projekcie data science?
Pozyskiwanie danych to faza 2 procesu data science, w standardzie CRISP-DM Data Understanding. Istniejące źródła danych są identyfikowane, dostęp jest ustalany, dane są przeglądane, a ich jakość oceniana. Wynikiem są inwentarz danych z osądem jakości dla każdego źródła i decyzja, czy dane udźwigną pytanie biznesowe.
Jakich źródeł danych potrzebuje projekt uczenia maszynowego co najmniej?
Jednego źródła, w którym występuje wielkość docelowa, którą model ma przewidywać, na przykład zwrot, awaria albo ilość zamówienia. Do tego cech znanych w momencie predykcji oraz klucza łączącego jedno z drugim, na przykład numeru zamówienia albo ID klienta. Jeśli brakuje jednego z nich, nie ma modelu, jest tylko statystyka.
Ile historii danych jest potrzebne?
Do prognoz zwykle 12 do 24 miesięcy, zależnie od sezonowości i granulacji. Nasze obliczenia modelowe z przykładowymi firmami zakładają dla prognoz zużycia co najmniej sześć miesięcy historii telematyki i warsztatu, dla wolumenu zamówień 24 miesiące, a dla powodów zwrotów dwa lata komentarzy w wolnym tekście; to założenia, nie wartości klientów.
Jak ocenić jakość danych, zanim zbuduje się model?
Według pojedynczych kryteriów z miarą i progiem: kompletność, spójność, dokładność, aktualność, unikalność i głębokość historii. Pięć z nich sprawdza nasz audyt w dziesięć minut, z oceną w skali świateł dla każdego wymiaru, a głębokość historii sprawdzamy wobec pytania. Decydujący jest cel: ten sam zbiór może wystarczyć do raportu, a do prognozy nie.
Czy musimy przekazać dane myBytes, czy mogą zostać w firmie?
Mogą zostać w firmie. Pracujemy najchętniej w Państwa infrastrukturze, z kopiami, wyciągami albo zanonimizowanymi danymi, na przykład na maszynie wirtualnej u Państwa albo z pakietem analitycznym dla Państwa zespołu. Dane osobowe przetwarzamy tylko wtedy, gdy są niezbędne do celu i istnieje umowa.
Czym różni się eksploracja danych od analizy eksploracyjnej danych?
Eksploracja danych w fazie 2 sprawdza przydatność: rozkłady najważniejszych kolumn, luki, czy wielkość docelowa istnieje. Analiza eksploracyjna danych (EDA) w fazie 4 szuka na przygotowanych danych wzorców, zależności i hipotez dla modelu. Pierwsza odpowiada, czy dane udźwigną pytanie; druga, na które pytanie mogą odpowiedzieć.
Czy wystarczą nasze dane z ERP, czy potrzebujemy danych maszynowych?
To zależy od pytania. Prognozy zapotrzebowania i stanów powstają z historii zamówień, odwołań i stanów w ERP, bez nowej rejestracji. Prognozy awarii albo braków potrzebują historii czujników i konserwacji ze sterownika albo MES. Nowe czujniki rzadko są pierwszym krokiem; zwykle wystarcza to, co sterowniki, rejestracja danych produkcyjnych i ERP już zapisują.
Porozmawiajmy o Państwa projekcie
Każdy projekt jest wyjątkowy. Prosimy opowiedzieć o Państwa wyzwaniu.
Zarezerwuj bezpłatną rozmowę wstępną