Szybka odpowiedź

AI w pracowni polisomnografii skraca ręczne punktowanie: dzieli noc na 30-sekundowe epoki, przypisuje im fazy snu (W, N1, N2, N3, REM), wykrywa bezdechy, spłycenia oddechu, desaturacje i wybudzenia. Najlepsze systemy zgadzają się z ekspertami mniej więcej tak często, jak eksperci zgadzają się ze sobą. Nie stawiają jednak diagnozy. Dopuszczone w USA programy, takie jak SleepStageML i SOMNUM v3.0, działają pod nadzorem lekarza, tylko u dorosłych i tylko w zakresie, który przeszedł walidację. Wynik przegląda i zatwierdza człowiek. Tak samo traktujemy analizę w naszym pipeline'ie dla Fundacji MT5: jako materiał poglądowy i badawczy, a nie opis lekarski.

Co się punktuje w badaniu PSG

Polisomnografia rejestruje całą noc w kilkunastu zsynchronizowanych kanałach: EEG, ruchy gałek ocznych (EOG), napięcie mięśni podbródka (EMG), EKG, przepływ powietrza, pracę pasów piersiowego i brzusznego, saturację (SpO2), pozycję ciała i ruchy kończyn. Punktowanie odbywa się według podręcznika AASM (AASM Manual for the Scoring of Sleep and Associated Events). Aktualna wersja 3 ukazała się w lutym 2023 r., a placówki akredytowane przez AASM musiały ją wdrożyć do końca 2023 r.

Główne elementy punktowania:

  • Fazy snu. Każda 30-sekundowa epoka dostaje jedną etykietę: czuwanie (W), N1, N2, N3 albo REM. Z sekwencji epok powstaje hipnogram.
  • Wybudzenia (arousals). Nagła zmiana częstotliwości EEG trwająca co najmniej 3 sekundy, poprzedzona stabilnym snem. W REM potrzebny jest dodatkowo wzrost napięcia mięśni podbródka.
  • Zdarzenia oddechowe. Bezdech (zatrzymanie przepływu) i spłycenie oddechu (hypopnea). Bezdech klasyfikuje się jako obturacyjny, centralny albo mieszany, zależnie od tego, czy klatka i brzuch próbują oddychać.
  • Desaturacje. Spadek SpO2 o co najmniej 3% albo 4% od wartości wyjściowej. Reguła rekomendowana przez AASM liczy spłycenie oddechu przy desaturacji o co najmniej 3% albo przy wybudzeniu. W wersji 3 podręcznika kryterium 4% zmieniło status z „akceptowalnego” na „opcjonalne”.

Z tych elementów powstają wskaźniki, na których opiera się opis badania. Dla automatycznej analizy ważne jest jedno: część tych reguł jest czysto sygnałowa (spadek SpO2 o 3% da się policzyć deterministycznie), a część wymaga interpretacji wzorca (czy ta epoka to już N1, czy jeszcze czuwanie).

Punkt odniesienia: ludzie też się nie zgadzają

Zanim zapytamy, jak dokładne jest AI, trzeba zapytać: dokładne względem czego? W punktowaniu snu nie ma niezależnego wzorca prawdy. Jest ocena eksperta, a eksperci się różnią.

Największe dane na ten temat pochodzą z programu zgodności AASM. Rosenberg i Van Hout (2013) przeanalizowali ponad 3,2 mln decyzji ponad 2500 osób punktujących na 1800 epokach. Średnia zgodność z oceną większości wyniosła 82,6%. Najwyższa była dla REM, potem dla N2 i czuwania. Dla N3 spadała do 67,4%, a dla N1 do 63,0%.

Przy zdarzeniach oddechowych jest podobnie. W analizie z 2014 r. zgodność dla epok z dowolnym zdarzeniem oddechowym wyniosła 88,4%, ale dla samych spłyceń oddechu już 65,4% (κ = 0,57), a dla bezdechów centralnych 52,4% (κ = 0,41).

Bakker i in. (2023) poszli dalej i dali te same nagrania do oceny 6, 9 i 12 ekspertom. Odsetek epok, co do których zgodzili się wszyscy, wyniósł odpowiednio 46%, 38% i 32%. Autorzy zaproponowali, żeby zamiast jednej etykiety na epokę raportować prawdopodobieństwa faz (hipnodensję). To dobra rama do myślenia o AI: model, który mówi „ta epoka to w 60% N1, w 40% N2”, opisuje noc uczciwiej niż model udający pewność.

Co mówią badania walidacyjne

Poniżej kilka prac, które warto znać, bo porównują system automatyczny z ludźmi na danych klinicznych. To nie jest pełny przegląd literatury.

BadanieCo porównanoWynikNa co uważać
Punjabi i in., Sleep 2015 (Somnolyzer)97 nagrań punktowanych ręcznie w 4 pracowniach i automatyczniekorelacja AHI automat-ludzie 0,93, między pracowniami 0,92; dobra zgodność wskaźnika wybudzeń, czasu snu, wydajności snunajwiększe różnice w odsetku N1, N2 i N3; kryteria AASM z 2007 r.
Perslev i in., npj Digital Medicine 2021 (U-Sleep)model uczony na nagraniach 15 660 osób z 16 badań klinicznychna danych z kliniki niewidzianej w treningu dorównał najlepszemu z ekspertówtylko fazy snu, bez zdarzeń oddechowych
Bakker i in., Sleep 202395 nagrań, każde oceniane przez 6-12 ekspertów, porównanie hipnodensjiICC między prawdopodobieństwami faz z automatu i od ludzi 0,91pokazuje też, jak mała jest pełna zgodność między ekspertami

Dwa wnioski wracają w tych pracach. Po pierwsze, na poziomie wskaźników z całej nocy (czas snu, AHI, wskaźnik wybudzeń) automat i ludzie zgadzają się dobrze. Po drugie, na poziomie pojedynczych epok błędy skupiają się w tych samych miejscach, w których ludzie są niepewni: przejścia między fazami, N1, głębokość snu, typ spłycenia oddechu.

Stanowisko AASM z 2020 r. w sprawie AI w medycynie snu wskazuje automatyczny scoring PSG jako najbliższe praktyczne zastosowanie, ale stawia warunki: jasno opisana populacja i cel narzędzia, walidacja na niezależnych danych i przejrzystość wobec pracowni, która z niego korzysta.

Co jest dopuszczone do użytku klinicznego

W USA automatyczna analiza PSG przechodzi ścieżkę 510(k) w FDA. Dwa przykłady z ostatnich lat:

  • SleepStageML (Beacon Biosignals), 510(k) K233438, decyzja z marca 2024 r. Punktuje fazy snu z EEG w nagraniach PSG u dorosłych i ma wspierać klinicystę w ocenie snu. Jako pierwsze urządzenie w medycynie snu dostało wcześniej zatwierdzony plan zmian (PCCP), który pozwala aktualizować model bez nowego zgłoszenia, o ile każda wersja przejdzie ustalone testy.
  • SOMNUM v3.0 (HoneyNaps), 510(k) K253390, ogłoszone w lipcu 2026 r. Analizuje nagrania PSG pierwszego poziomu u dorosłych od 22. roku życia: fazy snu, wybudzenia, ruchy kończyn, bezdechy i spłycenia, z podziałem bezdechów na obturacyjne, centralne i mieszane. Według zamierzonego zastosowania działa pod nadzorem lekarza, który może poprawiać i usuwać zdarzenia.

AASM prowadzi też własną certyfikację oprogramowania do autoscoringu. Pilotaż z 2023 r. obejmował tylko fazy snu u dorosłych, a pierwszym certyfikowanym produktem był Sleepware G3 z Somnolyzerem. W kwietniu 2026 r. AASM ogłosiła program dla pełnej PSG: fazy, zdarzenia oddechowe, wybudzenia i ruchy kończyn, oceniane na wieloośrodkowym zbiorze nagrań. Warunkiem jest dopuszczenie FDA albo trwające zgłoszenie.

W Unii Europejskiej oprogramowanie, które dostarcza informacji do decyzji diagnostycznych, jest zwykle wyrobem medycznym. Reguła 11 załącznika VIII rozporządzenia MDR daje mu co najmniej klasę IIa, a więc z udziałem jednostki notyfikowanej. System AI w takim wyrobie jest w AI Act systemem wysokiego ryzyka. Rozporządzenie (UE) 2026/1744, tzw. omnibus AI, przesunęło stosowanie tych obowiązków dla systemów AI w produktach regulowanych, takich jak wyroby medyczne, na 2 sierpnia 2028 r. Narzędzie używane wyłącznie w projekcie badawczym, bez wpływu na decyzje o konkretnym pacjencie, jest w innej sytuacji, ale granicę trzeba wyznaczyć świadomie.

To nie jest porada prawna. Klasyfikację konkretnego oprogramowania warto ustalić ze specjalistą od regulacji wyrobów medycznych.

Co AI robi dobrze, a gdzie potrzebny jest człowiek

ZadanieAutomatRola człowieka
Desaturacje (spadek SpO2 ≥ 3% lub 4%)reguła sygnałowa, powtarzalnasprawdzić artefakty czujnika, zsunięty pulsoksymetr
Fazy W, N2, REMzwykle na poziomie zgodności między ekspertamiprzegląd hipnogramu, zwłaszcza na przejściach
N1 i granica N2/N3najwięcej rozbieżności, u ludzi teżdecyzja przy niepewnych epokach
Wybudzeniawykrywanie z EEG i EMG, wrażliwe na jakość sygnałuweryfikacja, bo wpływają na liczenie spłyceń
Typ bezdechu i spłyceniatrudne, ludzie zgadzają się słaboocena kliniczna w kontekście pacjenta
Brakujące lub zaszumione kanaływiele modeli traci jakośćdecyzja, czy nagranie nadaje się do oceny
Populacje spoza walidacji (dzieci, choroby neurologiczne)brak gwarancjinarzędzie poza zakresem, ręczna ocena
Opis badania i rozpoznaniepoza zakresem automatuwyłącznie lekarz

W praktyce sensowny podział wygląda tak: automat robi pierwszy przebieg całej nocy, oznacza epoki i zdarzenia o niskiej pewności, a technik lub lekarz przegląda przede wszystkim te miejsca. Zysk czasu bierze się z tego, że nie trzeba punktować od zera ośmiu godzin zapisu, a nie z tego, że nikt już nie patrzy na sygnał.

Jak to wygląda u nas: pipeline dla Fundacji MT5

Fundacja MT5 prowadzi pracownie snu w szpitalach. Dziś nagrywają one około stu nocy miesięcznie. Dostarczyliśmy stronę techniczną: sprzęt, wdrożenie, drogę danych i klaster GPU NVIDIA Blackwell, który stoi w fundacji. Pełną historię opisujemy w realizacji dla Fundacji MT5.

Pipeline wygląda tak:

  1. Zapis. Rejestrator NOX A1s zapisuje noc do jednego pliku EDF+. Przykładowa noc z naszej opowieści to 90 kanałów w pliku, 8 godzin zapisu i około 495 mln próbek.
  2. Przygotowanie. Anonimizacja, filtracja (dla EEG pasmo 0,3-35 Hz), wspólna siatka próbkowania i wyrównanie kanałów co do próbki.
  3. Opis nocy. Pipeline automatycznie wykrywa zatrzymania przepływu, desaturacje o co najmniej 3% i wybudzenia oraz wylicza poglądowy hipnogram z EEG, EOG i aktywności. Zdarzenia opisujemy neutralnie, bez klasyfikowania ich typu.
  4. Okna dla modelu. Noc jest cięta na 30-sekundowe okna, na których trenujemy własny model. W każdym oknie zakrywamy jeden kanał, np. saturację, a model ma go odtworzyć z pozostałych. Żeby to zrobić, musi nauczyć się, jak oddech, serce, mózg i ruch zależą od siebie.

Cała ta analiza ma charakter poglądowy i badawczy. Nie jest opisem lekarskim i nie służy do diagnozowania pacjentów. Pytania badawcze, nad którymi pracujemy, są otwarte. Nie mamy jeszcze wyników i nie będziemy ich ogłaszać przed rzetelną weryfikacją. Dane pacjentów nie opuszczają fundacji, bo pipeline, model i dane są na sprzęcie w jej infrastrukturze. Jak podchodzimy do takich projektów, opisujemy na stronie filaru R&D.

Lista kontrolna przed wdrożeniem automatycznego scoringu

  1. Cel. Czy narzędzie ma wspierać opis kliniczny, czy służy tylko do badań? Od tego zależy, jakich dopuszczeń potrzebujesz.
  2. Populacja. Czy walidacja obejmuje Twoich pacjentów: wiek, choroby współistniejące, typ badania (PSG w pracowni czy badanie domowe)?
  3. Kanały i sprzęt. Czy model był walidowany na montażu i rejestratorze, którego używasz? Co robi, gdy brakuje kanału albo sygnał jest zaszumiony?
  4. Wersja reguł. Która wersja podręcznika AASM i które kryterium spłycenia oddechu (3% lub wybudzenie, czy 4%)? Musi się zgadzać z tym, co raportujesz.
  5. Własna walidacja. Porównaj automat z co najmniej dwoma osobami punktującymi na kilkudziesięciu Waszych nagraniach. Mierz zgodność z ludźmi i zgodność ludzi między sobą.
  6. Niepewność. Czy system pokazuje, które epoki i zdarzenia są niepewne? Przegląd powinien zaczynać się od nich.
  7. Ślad decyzji. Czy widać, co zrobił automat, a co poprawił człowiek? To ważne przy kontroli jakości i przy aktualizacjach modelu.
  8. Dane. Gdzie są przetwarzane nagrania? Jeśli poza placówką, na jakiej podstawie i z jakimi zabezpieczeniami? Jeśli na miejscu, kto utrzymuje serwer.

Źródła