Szybka odpowiedź
Computer vision (widzenie komputerowe) to dziedzina sztucznej inteligencji, w której system analizuje zdjęcia lub wideo i rozumie ich treść: rozpoznaje obiekty, wskazuje ich położenie, mierzy je i odczytuje tekst. Współczesne systemy uczą się tego na tysiącach oznaczonych przykładów, a nie z ręcznie spisanych reguł. Przełom nastąpił w 2012 r., gdy sieć neuronowa AlexNet osiągnęła w konkursie ImageNet błąd top-5 na poziomie 15,3% wobec 26,2% najlepszego rozwiązania klasycznego (Krizhevsky i in., 2012).
Czym właściwie jest computer vision?
To technologia, która zamienia piksele w informację, na podstawie której można działać. Człowiek patrzy na zdjęcie i od razu widzi samochód, pękniętą płytkę albo numer faktury. Dla komputera to tablica liczb, w której dopiero model musi odnaleźć znaczenie.
Warto odróżnić dwa pojęcia, które często się mieszają:
- Przetwarzanie obrazu zmienia piksele według stałych reguł: prostuje perspektywę, poprawia kontrast, wykrywa krawędzie.
- Computer vision interpretuje treść: co jest na obrazie, gdzie to jest i w jakim stanie.
W prawdziwych systemach oba podejścia działają razem. Weźmy odczyt dokumentów ze zdjęć z telefonu: system wykrywa krawędzie kartki, prostuje perspektywę, odczytuje tekst i przenosi wartości do formularza, a człowiek tylko sprawdza wynik.
Siła computer vision w biznesie nie polega na tym, że maszyna "widzi lepiej" od człowieka. Polega na tym, że patrzy cały czas, w tym samym standardzie i na każdej sztuce, a nie na próbce.
Jak maszyna uczy się widzieć?
Na przykładach. Zamiast opisywać regułami, jak wygląda rysa na lakierze, pokazuje się modelowi wiele zdjęć z rysami i bez nich, a on sam znajduje cechy, które je odróżniają. To podejście nazywa się uczeniem nadzorowanym: każdy przykład ma etykietę, czyli poprawną odpowiedź.
Proces wygląda tak:
- Zebranie i oznaczenie danych. Zdjęcia z realnych warunków, opisane przez ludzi: "defekt / brak defektu", ramka wokół obiektu albo obrys piksel po pikselu.
- Uczenie wzorców. Sieć neuronowa w kolejnych warstwach wykrywa coraz bardziej złożone cechy: najpierw krawędzie i kolory, potem tekstury i kształty, na końcu całe obiekty.
- Sprawdzenie na nowych danych. Model ocenia się na zdjęciach, których nie widział podczas nauki. Dopiero ten wynik mówi, czy poradzi sobie w produkcji.
- Wdrożenie i obserwacja. Model trafia do kamery, serwera albo aplikacji, a jego błędy wracają jako nowe przykłady do kolejnej rundy uczenia.
Skala danych miała tu ogromne znaczenie. Zbiór ImageNet, na którym trenowano przełomowe modele, liczy ponad 14 mln opisanych zdjęć w ponad 21 tys. kategorii (ImageNet). W firmie rzadko trzeba zaczynać od zera: zwykle bierze się model wstępnie wytrenowany na dużym zbiorze i dostraja go na własnych zdjęciach. To właśnie sprawiło, że computer vision stało się dostępne także dla średnich firm.
Jakie architektury stoją za współczesnymi systemami?
Przez dekadę dominowały sieci konwolucyjne (CNN), które przesuwają po obrazie małe filtry i dzięki temu dobrze wychwytują lokalne wzorce. Od 2020 r. coraz większą rolę grają transformery wizyjne (ViT), które dzielą obraz na fragmenty i analizują zależności między nimi, podobnie jak modele językowe analizują słowa (Dosovitskiy i in., 2020).
Trzeci, najnowszy kierunek to modele wizyjno-językowe (VLM), które łączą obraz z tekstem: można zapytać je, co jest na zdjęciu, albo poprosić o opis wykresu. Korzystamy z tego w naszej agentowej bazie wiedzy: wykresy z dokumentów firmy opisuje model wizyjny, dzięki czemu ich treść da się później wyszukać i zacytować.
Jakie zadania rozwiązuje computer vision?
Większość zastosowań biznesowych sprowadza się do czterech podstawowych zadań. Różnią się tym, o co pytamy obraz, ile kosztuje przygotowanie danych i jak mierzy się jakość.
| Zadanie | Pytanie, na które odpowiada | Przykład w firmie | Jak oznacza się dane |
|---|---|---|---|
| Klasyfikacja | Co jest na tym obrazie? | Produkt dobry albo wadliwy, typ dokumentu | Jedna etykieta na zdjęcie |
| Detekcja obiektów | Co i gdzie? | Pojazdy przy bramie, kask na głowie pracownika, produkty na półce | Ramka wokół każdego obiektu |
| Segmentacja | Które dokładnie piksele należą do obiektu? | Obrys rysy, powierzchnia uszkodzenia, zmiana na obrazie medycznym | Obrys piksel po pikselu |
| OCR | Jaki tekst jest na obrazie? | Faktury, formularze, notatki ze zdjęcia, tablice rejestracyjne | Tekst przypisany do fragmentu obrazu |
Klasyfikacja jest najprostsza i najtańsza w przygotowaniu danych. Wystarczy, gdy liczy się tylko odpowiedź "tak/nie" albo kategoria.
Detekcja dodaje położenie. Dzięki niej system policzy obiekty, sprawdzi, czy ktoś wszedł do strefy zakazanej, albo odczyta tablicę rejestracyjną z kadru, w którym jest też ulica i chodnik.
Segmentacja jest najdokładniejsza i najdroższa w etykietowaniu, bo człowiek obrysowuje każdy obiekt. Tu pomagają modele bazowe, takie jak Segment Anything, wytrenowany na ponad miliardzie masek z 11 mln zdjęć, który potrafi zaproponować obrys obiektu po jednym kliknięciu (Kirillov i in., 2023). Człowiek poprawia propozycję zamiast rysować od zera.
OCR (optyczne rozpoznawanie znaków) to osobna, bardzo praktyczna gałąź: zamiana obrazu tekstu na tekst, który można przeszukać i przetworzyć. Jak OCR ewoluował od prostych narzędzi do modeli rozumiejących układ dokumentu, opisujemy w artykule o nowoczesnym OCR w firmie.
Te zadania łączy się w łańcuchy. System kontroli dostępu najpierw wykrywa pojazd, potem wycina tablicę, a na końcu odczytuje ją przez OCR i porównuje z listą uprawnionych.
Gdzie computer vision już działa?
Wszędzie tam, gdzie dziś ktoś patrzy na coś wielokrotnie w ciągu dnia i ocenia to według powtarzalnych kryteriów. Najczęstsze obszary to kontrola jakości w produkcji, bezpieczeństwo pracy, logistyka i magazyn, handel, rolnictwo, dokumenty oraz medycyna.
Medycyna dobrze pokazuje dojrzałość tej technologii. Na prowadzonej przez amerykańską FDA liście urządzeń medycznych wykorzystujących AI jest już ponad 1600 pozycji, z czego około trzy czwarte to radiologia, czyli właśnie analiza obrazu (nasze zliczenie z listy w stanie na 4 września 2026 r.; FDA zaznacza, że lista nie jest kompletna) (FDA). Konkretne zastosowania biznesowe, z liczbami i sposobem liczenia zwrotu z inwestycji, omawiamy w artykule o 5 zastosowaniach computer vision w biznesie.
Jakie są ograniczenia computer vision?
Model jest tak dobry, jak dane, na których się uczył, i tylko w warunkach podobnych do tych z nauki. To najważniejsza rzecz, którą warto wiedzieć przed pierwszym projektem.
- Zmiana warunków (domain shift). Nowa kamera, inne oświetlenie, zmiana opakowania produktu albo pora roku mogą wyraźnie obniżyć skuteczność modelu, który na testach wypadał świetnie. Dlatego dane testowe muszą pochodzić z realnego środowiska, a działanie modelu trzeba monitorować po wdrożeniu.
- Rzadkie przypadki. Defekty, których jest mało, model widzi rzadko i rozpoznaje gorzej. Trzeba je celowo zbierać, a czasem generować syntetycznie.
- Jakość etykiet. Jeśli dwie osoby inaczej oceniają, co jest defektem, model nauczy się tej niepewności. Zanim zaczniesz etykietować, spisz kryteria.
- Brak zdrowego rozsądku. Model nie "rozumie" świata. Potrafi pomylić się w sposób, którego człowiek by nie popełnił, i nie zawsze zasygnalizuje, że nie jest pewny.
- Koszt błędu. W każdym systemie trzeba wybrać kompromis między przeoczeniami a fałszywymi alarmami. Ten wybór jest decyzją biznesową, nie techniczną.
Dlatego dobre systemy zostawiają człowieka w pętli tam, gdzie błąd jest drogi: model wskazuje, człowiek decyduje. Tak działa dobrze zaprojektowany odczyt dokumentów i tak działają systemy wspierające radiologów.
Co z prywatnością i AI Act?
Obraz, na którym da się rozpoznać osobę, to dane osobowe w rozumieniu RODO, a dane biometryczne służące identyfikacji to szczególna kategoria danych (art. 9 RODO), której przetwarzanie jest co do zasady zakazane, poza określonymi wyjątkami (RODO).
AI Act idzie dalej. Od 2 lutego 2025 r. zakazane jest m.in. rozpoznawanie emocji w miejscu pracy i w edukacji (poza celami medycznymi i bezpieczeństwa) oraz tworzenie baz do rozpoznawania twarzy przez nieukierunkowane pozyskiwanie wizerunków z internetu lub nagrań monitoringu (AI Act, art. 5). Systemy biometryczne wymienione w załączniku III to systemy wysokiego ryzyka; po zmianie rozporządzeniem (UE) 2026/1744 obowiązki dla nich stosuje się od 2 grudnia 2027 r. (rozporządzenie (UE) 2026/1744).
Większość zastosowań przemysłowych (defekty, palety, odczyt dokumentów) nie dotyczy ludzi i tych ograniczeń nie uruchamia. Gdy kamera obejmuje pracowników lub klientów, zacznij od analizy prawnej. Pomaga też przetwarzanie lokalne: obrazy nie opuszczają wtedy firmy. Jak wygląda AI na własnej infrastrukturze, pokazujemy na stronie Infrastruktura AI.
Jak zacząć projekt computer vision?
Od jednego, dobrze opisanego problemu i zdjęć z prawdziwego środowiska. Kolejność, która sprawdza się w praktyce:
- Zdefiniuj decyzję. Co system ma rozstrzygać i co kosztuje błąd w każdą stronę.
- Zbierz próbkę z realnych warunków. Różne zmiany, kamery, oświetlenie, a przede wszystkim przypadki trudne.
- Spisz kryteria etykietowania. Jedna, wspólna definicja tego, co jest "dobre", a co "złe".
- Zmierz punkt odniesienia. Ile czasu i jakich błędów generuje dzisiejszy, ręczny proces.
- Zaplanuj miejsce działania modelu. Chmura, serwer w firmie czy urządzenie przy kamerze, w zależności od czasu reakcji i wymagań dotyczących danych.
- Zostaw człowieka tam, gdzie błąd jest drogi, i zbieraj jego poprawki jako nowe dane.
Computer vision nie jest już eksperymentem dla największych firm. Jest narzędziem do bardzo konkretnej pracy: patrzenia na rzeczy, na które ludzie patrzą dziś ręcznie, szybciej i w stałym standardzie.
Źródła
- Krizhevsky, Sutskever, Hinton: ImageNet Classification with Deep Convolutional Neural Networks (NeurIPS 2012)
- ImageNet
- Dosovitskiy i in.: An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (2020)
- Kirillov i in.: Segment Anything (2023)
- FDA: Artificial Intelligence-Enabled Medical Devices
- Rozporządzenie (UE) 2016/679 (RODO)
- Rozporządzenie (UE) 2024/1689 (AI Act)
- Rozporządzenie (UE) 2026/1744 (Digital Omnibus on AI)