Szybka odpowiedź
Nowoczesny OCR (często nazywany Document AI albo inteligentnym przetwarzaniem dokumentów) nie tylko zamienia skan na tekst, ale rozumie dokument: rozpoznaje jego typ, znajduje potrzebne pola, odczytuje tabele i przekazuje dane prosto do systemów firmy. Za tym skokiem stoją modele wizyjno-językowe, które czytają stronę razem z jej układem. W praktyce oznacza to, że człowiek sprawdza wynik zamiast przepisywać dane.
Czym jest OCR, a czym Document AI?
OCR (Optical Character Recognition, optyczne rozpoznawanie znaków) to technologia, która zamienia obraz tekstu, na przykład skan albo zdjęcie, na tekst możliwy do edycji i przeszukiwania. Klasyczny OCR odpowiada na pytanie "jakie litery są na stronie".
Document AI (inaczej IDP, Intelligent Document Processing) idzie krok dalej i odpowiada na pytanie "co ten dokument mówi". Wie, czym faktura różni się od zamówienia, rozpoznaje, że "12345" to numer faktury, a "2 500 zł" obok "Razem do zapłaty" to kwota należności, i zwraca dane w strukturze gotowej do zapisania w systemie.
Model wizyjno-językowy (VLM, Vision-Language Model) to model AI, który przyjmuje na wejściu obraz i tekst jednocześnie. Dla dokumentów oznacza to, że model "patrzy" na całą stronę, rozumie jej układ i może od razu zwrócić tabelę, pola formularza albo streszczenie. Szerzej o tym, jak maszyny uczą się widzieć, piszemy w artykule computer vision: jak maszyny uczą się widzieć.
Dlaczego OCR ma dziś znaczenie?
Bo papier nie zniknął z biznesu, tylko przebrał się w cyfrowe przebranie. Faktury przychodzą jako PDF-y, umowy jako skany, formularze jako załączniki do maili, a notatki jako zdjęcia z telefonu. Problem pozostaje ten sam: ktoś musi przeczytać każdy dokument i ręcznie przenieść dane do systemów.
Polska ma tu sporo do nadrobienia. W 2025 r. z technologii AI korzystało 20% firm w UE zatrudniających co najmniej 10 osób, a w Polsce 8,4%, jeden z najniższych wyników we Wspólnocie. Najczęstszym zastosowaniem AI w firmach w UE była właśnie analiza tekstu pisanego (11,8% firm) (Eurostat, 2025).
Czy KSeF zastąpi OCR faktur?
Częściowo. Krajowy System e-Faktur jest obowiązkowy dla największych podatników od 1 lutego 2026 r., a dla pozostałych od 1 kwietnia 2026 r. (najmniejsi, u których sprzedaż na fakturach nie przekracza 10 000 zł brutto miesięcznie, mają czas do końca 2026 r.). Od 1 lutego 2026 r. wszyscy muszą też odbierać faktury przez KSeF (KSeF, podatki.gov.pl). Krajowa faktura B2B trafia więc do firmy jako ustrukturyzowany plik i nie trzeba jej odczytywać z obrazu.
Poza KSeF zostaje jednak sporo dokumentów: faktury od dostawców bez siedziby w Polsce, paragony i rachunki w rozliczeniach kosztów, umowy, protokoły, dokumenty przewozowe i celne, formularze wypełniane ręcznie, notatki ze spotkań z klientami. To one dziś są głównym polem dla nowoczesnego OCR.
Jak OCR ewoluował: od Tesseracta do modeli wizyjno-językowych?
OCR przeszedł trzy etapy: od rozpoznawania liter, przez potoki rozpoznające układ, do modeli, które rozumieją całą stronę.
Klasyczny OCR. Tesseract, jeden z najbardziej znanych silników OCR, powstał w laboratoriach Hewlett-Packarda w latach 1985-1994. HP udostępniło go jako open source w 2005 r., a od 2006 do 2017 r. rozwijał go Google. Wersja 4 dodała silnik oparty na sieci neuronowej LSTM, a dziś Tesseract rozpoznaje ponad 100 języków (Tesseract, GitHub). To był duży krok naprzód, ale z wyraźnymi ograniczeniami: potrzebował czystego wejścia, więc pomięty paragon, krzywy skan albo dokument z kolumnami i tabelami często dawały błędy. Traktował stronę jak płaski blok tekstu, bez pojęcia pól i układu. OCR potrafił odczytać litery, ale nie rozumiał dokumentu.
Potoki Document AI. Kolejny etap to łączenie kilku modeli: jeden wykrywa układ strony (nagłówki, tabele, pola), drugi odczytuje tekst, a reguły albo szablony przypisują wartości do pól. To działa dobrze przy powtarzalnych dokumentach, ale każdy nowy wzór wymaga konfiguracji.
Modele wizyjno-językowe. Przełom przyszedł z zastosowaniem do dokumentów tych samych technik AI, które wcześniej zmieniły tłumaczenie języka i rozpoznawanie obrazów. VLM czyta stronę w całości i może zwrócić od razu Markdown, tabelę albo JSON z polami. Koszt spada szybko: zespół Allen Institute for AI pokazał, że ich otwarty model olmOCR (7 mld parametrów) przetwarza milion stron PDF za około 176 USD, podczas gdy to samo zadanie przez API GPT-4o kosztowało ponad 6 240 USD (olmOCR, arXiv 2025). Publiczne benchmarki, takie jak OmniDocBench, porównują dziś klasyczne silniki (w tym Tesseract), potoki i modele VLM na tych samych dokumentach, z tabelami, wzorami i układami wielokolumnowymi (OmniDocBench, CVPR 2025).
| Kryterium | Klasyczny OCR (np. Tesseract) | Potok Document AI | Model wizyjno-językowy (VLM) |
|---|---|---|---|
| Wynik | Płaski tekst | Pola według szablonu | Struktura: Markdown, tabele, JSON |
| Układ i tabele | Słabo | Dobrze dla znanych wzorów | Dobrze, także dla nowych wzorów |
| Zdjęcia z telefonu, krzywe skany | Wymaga obróbki wstępnej | Zależnie od potoku | Radzi sobie lepiej, obróbka nadal pomaga |
| Nowy typ dokumentu | Bez zmian, bo i tak nie rozumie | Nowa konfiguracja | Zwykle wystarczy zmiana instrukcji |
| Główne ryzyko | Błędy znaków | Kruchość szablonów | Dopowiadanie treści, której nie ma |
| Wymagany sprzęt | CPU | CPU lub GPU | GPU (lokalnie albo przez API) |
Jakie są ograniczenia modeli wizyjno-językowych?
Największe ryzyko to halucynacje: model, który rozumie kontekst, potrafi "uzupełnić" nieczytelną cyfrę albo pole, którego na dokumencie nie ma, i zrobić to bardzo przekonująco. Klasyczny OCR myli się inaczej, zwraca śmieci, które łatwo zauważyć. Dlatego przy VLM potrzebne są walidacje (czy suma pozycji zgadza się z kwotą razem, czy NIP ma poprawną sumę kontrolną, czy data jest możliwa), progi pewności i człowiek przy wątpliwych przypadkach. Drugie ograniczenie to sprzęt: VLM potrzebuje GPU, więc przy dużych wolumenach trzeba policzyć koszt API albo własnej infrastruktury.
Jak to wygląda w praktyce?
Weźmy typowy przypadek: dokument fotografowany telefonem. Pracownik robi zdjęcie, system wykrywa krawędzie kartki, prostuje perspektywę, odczytuje tekst i przenosi potrzebne wartości do pól formularza. Człowiek sprawdza wynik, zamiast przepisywać dane ręcznie.
Dwie rzeczy są tu uniwersalne. Po pierwsze, jakość zaczyna się przed modelem: wykrycie krawędzi i wyprostowanie zdjęcia robi dużą różnicę przy dokumentach fotografowanych telefonem. Po drugie, wynik trafia do formularza, który człowiek zatwierdza, a nie prosto do bazy. To pozwala korzystać z szybkości AI bez oddawania mu ostatniego słowa.
OCR jest też pierwszym krokiem w budowie baz wiedzy. W naszej agentowej bazie wiedzy skany przechodzą przez OCR po polsku i angielsku, tabele zamieniamy na tekst z nagłówkami kolumn, a wykresy opisuje model wizyjny. Dopiero tak przygotowane dokumenty mogą być źródłem odpowiedzi dla modelu językowego, o czym piszemy w artykule jak RAG sprawia, że AI wie, a nie zgaduje.
Gdzie Document AI pomaga zespołom?
Wszędzie tam, gdzie powtarzalne dokumenty spowalniają proces. System wyciąga właściwe informacje i kieruje je tam, gdzie są potrzebne.
- Finanse i księgowość: faktury zagraniczne, paragony i rachunki w rozliczeniach kosztów, wyciągi, dopasowanie dokumentów do zapisów.
- Prawo i compliance: wyciąganie klauzul i zobowiązań z umów, oznaczanie nietypowych zapisów, przetwarzanie dokumentów regulacyjnych.
- HR: CV, dokumenty onboardingowe, formularze i akta pracownicze.
- Obsługa klienta: wnioski, formularze, dokumenty do szkód i reklamacji, mniej odsyłania w tę i z powrotem.
- Operacje i łańcuch dostaw: zamówienia, dokumenty przewozowe, papiery celne, pliki od dostawców.
Odczyt to zwykle tylko pierwszy krok. Dane z dokumentu trzeba jeszcze przenieść do systemów i uruchomić dalszy proces, a tu wchodzi automatyzacja, o której piszemy w artykule RPA czy BPA: którą automatyzację wybrać.
Jak wdrożyć nowoczesny OCR w firmie?
Zacznij tam, gdzie praca się piętrzy, i od pomiaru, a nie od wyboru modelu.
- Wybierz jeden typ dokumentu z dużym wolumenem i danymi, które dziś przepisuje się ręcznie.
- Zmierz stan wyjściowy: czas obsługi jednego dokumentu, liczbę błędów, liczbę dokumentów w miesiącu.
- Zbierz zestaw testowy prawdziwych dokumentów, także tych trudnych: krzywych zdjęć, pisma odręcznego, nietypowych wzorów. Na nim porównaj rozwiązania.
- Zaplanuj walidacje i miejsce dla człowieka: które pola sprawdzać automatycznie, kiedy wynik trafia do ręcznej weryfikacji.
- Zdecyduj, gdzie działa model. Dokumenty często zawierają dane osobowe, więc RODO wymaga wiedzy, gdzie są przetwarzane. Gdy nie mogą opuścić firmy, model uruchamia się na własnych serwerach. Jak wygląda AI na własnej infrastrukturze, pokazujemy na stronie Infrastruktura AI.
- Mierz po wdrożeniu i rozszerzaj na kolejne typy dokumentów.
Dokumenty bywają ukrytym wąskim gardłem firmy. Technologia, która je usuwa, jest dostępna już dziś. Pytanie nie brzmi, czy wdrożyć inteligentne przetwarzanie dokumentów, tylko od którego dokumentu zacząć.
Źródła
- Tesseract OCR, repozytorium i historia projektu (GitHub)
- Poznanski J. i in.: olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models, arXiv 2025
- OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations, CVPR 2025
- Eurostat: 20% of EU enterprises use AI technologies, 2025
- KSeF: Zakres obowiązkowego KSeF, podatki.gov.pl