Szybka odpowiedź

Dane pod AI przygotowuje się w pięciu powtarzalnych krokach: odkrycie (co mamy i gdzie), czyszczenie (duplikaty, błędy, braki), mapowanie (co odpowiada czemu między systemami), transformacja (format zrozumiały dla modelu) i walidacja (czy dane naprawdę opisują problem). To nie jest formalność przed "właściwym" projektem. Gartner przewiduje, że do końca 2026 r. organizacje porzucą 60% projektów AI, które nie mają wsparcia w danych gotowych na AI (Gartner, 2025).

Dlaczego jakość danych jest ważniejsza niż wybór algorytmu?

Bo algorytm może pracować tylko na tym, co dostanie. Prosty model na dobrych danych zwykle wypada lepiej niż złożony model na danych zaszumionych, a różnicy między dobrym i złym zbiorem nie nadrobi żadna architektura.

Badania wskazują to samo z kilku stron. W raporcie IDC problemy z jakością danych są najczęstszą przyczyną, przez którą projekty AI nie spełniły oczekiwań (IDC dla Lenovo, 2025). W badaniu Informatica dane (kompletność, jakość, gotowość) wskazało 43% szefów danych jako główną przeszkodę w przenoszeniu projektów GenAI z pilotażu na produkcję (Informatica, 2025). RAND, na podstawie 65 wywiadów z praktykami, wymienia brak danych potrzebnych do wytrenowania skutecznego modelu jako jedną z pięciu głównych przyczyn porażek projektów AI (RAND, 2024).

Jednocześnie według ankiety Gartnera 63% organizacji nie ma albo nie jest pewnych, czy ma właściwe praktyki zarządzania danymi dla AI (Gartner, 2025). Problem jest powszechny, a nie wyjątkowy. Szerzej o tym, gdzie jeszcze utykają projekty, piszemy w artykule dlaczego pilotaże AI nie trafiają na produkcję.

Dlaczego model AI nie odróżni dobrych danych od złych?

Bo nie ma zdrowego rozsądku ani kontekstu biznesowego. Model szuka wzorców i korelacji, nie pytając, czy są sensowne, czy przypadkowe. Wszystko, co dostanie, traktuje jako prawdę.

Dwa przykłady, jak to wygląda w praktyce:

  • Niespójne etykiety. System wykrywania nadużyć uczony na historii transakcji, w której różne działy oznaczały oszustwa różnie ("fraud", "podejrzane", czasem wcale). Model nie widzi niespójności, tylko buduje sprzeczne reguły, które obniżają jego trafność na produkcji.
  • Niejednolite jednostki. Dane sprzedażowe, w których w jednej kolumnie są złotówki, euro i dolary. Bez przeliczenia na jedną walutę model albo potraktuje 100 zł, 100 EUR i 100 USD jako tę samą liczbę, albo jako nieporównywalny tekst. W obu przypadkach nie nauczy się niczego o wartości transakcji.

Zasada "śmieci na wejściu, śmieci na wyjściu" w AI działa mocniej niż w klasycznym IT: model nie tylko powtarza błędy, ale też je uogólnia.

Jakie cechy mają dane gotowe na AI?

Dane gotowe na AI (ang. AI-ready data) to dane dopasowane do konkretnego zastosowania, które model może wykorzystać bez wprowadzania go w błąd. Mają pięć cech:

CechaCo oznaczaCo się dzieje, gdy jej brakuje
CzysteBez duplikatów, błędów i nieistotnych rekordówKlient zapisany dwa razy wygląda jak dwóch klientów, model przecenia cechy, które "występują częściej" tylko przez duplikaty
SpójneTe same pojęcia zapisane tak samo we wszystkich systemach"Polska" w CRM i "PL" w ERP to dla modelu dwa różne miejsca
KompletneZawierają informacje potrzebne do zadaniaBez historii zakupów rekomendacje są losowe, luki w danych z czujników psują predykcję awarii
Osadzone w kontekścieOdzwierciedlają realny proces biznesowyBez oznaczenia okresów promocji model przypisze wzrost sprzedaży preferencjom klientów
Objęte zasadami (governed)Właściciel, zasady dostępu, ochrona danych wrażliwych, zgodność z RODOZespół nie może legalnie użyć danych albo używa ich bez kontroli

Klasyczne wymiary jakości danych (dokładność, kompletność, spójność, aktualność, poprawność względem reguł i unikalność) nadal obowiązują. Różnica polega na tym, że w AI liczy się dopasowanie do przypadku użycia: dane dobre do raportu kwartalnego mogą być złe do modelu, który ma przewidywać zachowanie klienta w czasie rzeczywistym.

Jak wygląda proces przygotowania danych krok po kroku?

Typowy proces ma pięć etapów i nie jest liniowy: walidacja często odsyła zespół z powrotem do czyszczenia albo nawet do odkrywania danych.

  1. Odkrycie. Ustalasz, jakie dane istnieją, gdzie leżą i w jakiej są strukturze. Zwykle okazuje się, że dane klienta są w CRM, transakcje w ERP, a zachowania w analityce webowej, każde z inną konwencją nazw.
  2. Czyszczenie. Usuwasz duplikaty, poprawiasz błędy i decydujesz, co zrobić z brakami: usunąć rekord, uzupełnić wartością szacowaną czy oznaczyć jako brak.
  3. Mapowanie. Definiujesz, jak pola z różnych systemów odpowiadają strukturze docelowej. Na przykład "customer_id", "nr_klienta" i "account_id" to ten sam byt.
  4. Transformacja. Przekształcasz dane do postaci, którą model przetworzy: skalowanie wartości liczbowych, kodowanie kategorii, przygotowanie cech czasowych. W projektach z dokumentami to także podział tekstu na fragmenty i dodanie metadanych.
  5. Walidacja. Sprawdzasz, czy transformacje zadziałały, czy dane rzeczywiście opisują problem biznesowy i czy spełniają ustalone progi jakości, zanim zaczniesz trenować lub indeksować.

Jak to wygląda przy dokumentach, a nie tabelach?

W projektach opartych na dokumentach, takich jak RAG i bazy wiedzy, przygotowanie danych to przede wszystkim praca z formatami. RAG (retrieval-augmented generation) to technika, w której model językowy przed odpowiedzią wyszukuje fragmenty Twoich dokumentów i opiera na nich odpowiedź. Jeśli fragmenty są złe, odpowiedź też będzie zła.

W naszej agentowej bazie wiedzy potok danych robi kilka rzeczy, zanim cokolwiek trafi do wyszukiwarki: OCR odczytuje polski i angielski tekst ze skanów, tabele są zamieniane na tekst z nagłówkami kolumn, wykresy opisuje model wizyjny, a każdy fragment dostaje prefiks z metadanymi przed wektoryzacją. Do tego dochodzi stemming polskich słów, żeby "dawka" i "dawki" były tym samym. Produkcyjnie to ponad 2 mln fragmentów z 22 786 dokumentów. Podstawy tej techniki opisujemy w artykule jak RAG sprawia, że AI jest mądrzejsze.

W innych projektach podobny problem wygląda inaczej: łączenie raportów w różnych formatach i dopasowywanie płatności do zapisów księgowych przy pomocy dopasowania przybliżonego (fuzzy matching), bo te same dane w dwóch systemach nigdy nie są zapisane identycznie.

Ile kosztują złe dane?

Więcej, niż widać w budżecie IT. Według Gartnera słaba jakość danych kosztuje organizacje średnio 12,9 mln USD rocznie (szacunek z 2020 r.) (Gartner). To szacunek dla dużych firm, ale mechanizmy są te same w każdej skali:

  • Nieefektywność operacyjna. Ludzie poprawiają dane zamiast pracować: błędne stany magazynowe, pomyłki w wysyłkach i fakturach.
  • Złe decyzje. Prognozy i analizy oparte na niewiarygodnych danych prowadzą do błędnych strategii.
  • Utrata zaufania klientów. Złe adresy, zdublowane konta i niespójna komunikacja.
  • Ryzyko regulacyjne. Za naruszenia RODO grożą kary do 20 mln EUR lub 4% rocznego światowego obrotu (RODO, art. 83).
  • Nieudane projekty AI. Model nie nadrobi danych, które nie były gotowe.

Checklista: czy Twoje dane są gotowe na projekt AI?

Zanim zaczniesz rozmawiać o modelach, przejdź przez tę listę dla jednego, konkretnego przypadku użycia:

ObszarPytanie kontrolneGotowe, gdy
CelDo jakiej decyzji lub zadania dane mają posłużyć?Jest jeden przypadek użycia z metryką biznesową
InwentaryzacjaGdzie są dane i kto jest ich właścicielem?Lista źródeł z właścicielami i formatami
JakośćIle jest duplikatów, braków i błędów?Zmierzone na próbce, z progami akceptacji
SpójnośćCzy te same pojęcia są zapisane tak samo w systemach?Słownik pojęć i mapowanie identyfikatorów
KontekstCzy dane opisują okoliczności (promocje, sezon, zmiany procesu)?Kluczowe zdarzenia są oznaczone w danych
DokumentyCzy skany, tabele i wykresy są czytelne dla maszyny?OCR i ekstrakcja sprawdzone na próbce
Dostęp i RODOKto może używać danych i na jakiej podstawie?Zasady dostępu, minimalizacja, pseudonimizacja tam, gdzie się da
InfrastrukturaGdzie dane będą przetwarzane?Decyzja: chmura czy własne serwery, zgodna z wymaganiami
MonitoringJak wykryjesz, że jakość spada?Automatyczne testy jakości w potoku danych

Za zasady dostępu, odpowiedzialność i zgodność odpowiada data governance. Ten obszar rozwijamy w osobnym artykule: data governance, fundament wiarygodnego AI.

Czy AI może przyspieszyć przygotowanie danych?

Tak, i to jest dobra wiadomość. Modele językowe pomagają wykrywać niespójności, normalizować zapisy i klasyfikować dokumenty, a modele wizyjne odczytują skany i opisują wykresy. To praca, która kiedyś zajmowała tygodnie ręcznego przeglądu.

Warunek jest jeden: wynik automatyzacji też trzeba walidować. Reguły, próbki sprawdzane przez człowieka i testy w potoku danych to jedyny sposób, żeby błędy narzędzia nie trafiły dalej do modelu.

Zacznij od danych, nie od modelu

Firmy, którym AI działa, nie zaczynają od porównywania modeli. Zaczynają od uczciwej oceny swoich danych: gdzie są luki w kompletności, spójności i dostępności, i jak je systematycznie zamykać. Jakość wyniku AI jest przesądzona, zanim powstanie pierwszy prompt czy pierwsza epoka treningu.

Zanim zainwestujesz w zaawansowany model, zainwestuj w dane. Sprawdź, co masz, ustal, czego potrzebujesz, i wykonaj niewdzięczną, ale konieczną pracę: czyszczenie, standaryzację i porządkowanie.

Źródła