Szybka odpowiedź
AI w pracowni polisomnografii skraca ręczne punktowanie: dzieli noc na 30-sekundowe epoki, przypisuje im fazy snu (W, N1, N2, N3, REM), wykrywa bezdechy, spłycenia oddechu, desaturacje i wybudzenia. Najlepsze systemy zgadzają się z ekspertami mniej więcej tak często, jak eksperci zgadzają się ze sobą. Nie stawiają jednak diagnozy. Dopuszczone w USA programy, takie jak SleepStageML i SOMNUM v3.0, działają pod nadzorem lekarza, tylko u dorosłych i tylko w zakresie, który przeszedł walidację. Wynik przegląda i zatwierdza człowiek. Tak samo traktujemy analizę w naszym pipeline'ie dla Fundacji MT5: jako materiał poglądowy i badawczy, a nie opis lekarski.
Co się punktuje w badaniu PSG
Polisomnografia rejestruje całą noc w kilkunastu zsynchronizowanych kanałach: EEG, ruchy gałek ocznych (EOG), napięcie mięśni podbródka (EMG), EKG, przepływ powietrza, pracę pasów piersiowego i brzusznego, saturację (SpO2), pozycję ciała i ruchy kończyn. Punktowanie odbywa się według podręcznika AASM (AASM Manual for the Scoring of Sleep and Associated Events). Aktualna wersja 3 ukazała się w lutym 2023 r., a placówki akredytowane przez AASM musiały ją wdrożyć do końca 2023 r.
Główne elementy punktowania:
- Fazy snu. Każda 30-sekundowa epoka dostaje jedną etykietę: czuwanie (W), N1, N2, N3 albo REM. Z sekwencji epok powstaje hipnogram.
- Wybudzenia (arousals). Nagła zmiana częstotliwości EEG trwająca co najmniej 3 sekundy, poprzedzona stabilnym snem. W REM potrzebny jest dodatkowo wzrost napięcia mięśni podbródka.
- Zdarzenia oddechowe. Bezdech (zatrzymanie przepływu) i spłycenie oddechu (hypopnea). Bezdech klasyfikuje się jako obturacyjny, centralny albo mieszany, zależnie od tego, czy klatka i brzuch próbują oddychać.
- Desaturacje. Spadek SpO2 o co najmniej 3% albo 4% od wartości wyjściowej. Reguła rekomendowana przez AASM liczy spłycenie oddechu przy desaturacji o co najmniej 3% albo przy wybudzeniu. W wersji 3 podręcznika kryterium 4% zmieniło status z „akceptowalnego” na „opcjonalne”.
Z tych elementów powstają wskaźniki, na których opiera się opis badania. Dla automatycznej analizy ważne jest jedno: część tych reguł jest czysto sygnałowa (spadek SpO2 o 3% da się policzyć deterministycznie), a część wymaga interpretacji wzorca (czy ta epoka to już N1, czy jeszcze czuwanie).
Punkt odniesienia: ludzie też się nie zgadzają
Zanim zapytamy, jak dokładne jest AI, trzeba zapytać: dokładne względem czego? W punktowaniu snu nie ma niezależnego wzorca prawdy. Jest ocena eksperta, a eksperci się różnią.
Największe dane na ten temat pochodzą z programu zgodności AASM. Rosenberg i Van Hout (2013) przeanalizowali ponad 3,2 mln decyzji ponad 2500 osób punktujących na 1800 epokach. Średnia zgodność z oceną większości wyniosła 82,6%. Najwyższa była dla REM, potem dla N2 i czuwania. Dla N3 spadała do 67,4%, a dla N1 do 63,0%.
Przy zdarzeniach oddechowych jest podobnie. W analizie z 2014 r. zgodność dla epok z dowolnym zdarzeniem oddechowym wyniosła 88,4%, ale dla samych spłyceń oddechu już 65,4% (κ = 0,57), a dla bezdechów centralnych 52,4% (κ = 0,41).
Bakker i in. (2023) poszli dalej i dali te same nagrania do oceny 6, 9 i 12 ekspertom. Odsetek epok, co do których zgodzili się wszyscy, wyniósł odpowiednio 46%, 38% i 32%. Autorzy zaproponowali, żeby zamiast jednej etykiety na epokę raportować prawdopodobieństwa faz (hipnodensję). To dobra rama do myślenia o AI: model, który mówi „ta epoka to w 60% N1, w 40% N2”, opisuje noc uczciwiej niż model udający pewność.
Co mówią badania walidacyjne
Poniżej kilka prac, które warto znać, bo porównują system automatyczny z ludźmi na danych klinicznych. To nie jest pełny przegląd literatury.
| Badanie | Co porównano | Wynik | Na co uważać |
|---|---|---|---|
| Punjabi i in., Sleep 2015 (Somnolyzer) | 97 nagrań punktowanych ręcznie w 4 pracowniach i automatycznie | korelacja AHI automat-ludzie 0,93, między pracowniami 0,92; dobra zgodność wskaźnika wybudzeń, czasu snu, wydajności snu | największe różnice w odsetku N1, N2 i N3; kryteria AASM z 2007 r. |
| Perslev i in., npj Digital Medicine 2021 (U-Sleep) | model uczony na nagraniach 15 660 osób z 16 badań klinicznych | na danych z kliniki niewidzianej w treningu dorównał najlepszemu z ekspertów | tylko fazy snu, bez zdarzeń oddechowych |
| Bakker i in., Sleep 2023 | 95 nagrań, każde oceniane przez 6-12 ekspertów, porównanie hipnodensji | ICC między prawdopodobieństwami faz z automatu i od ludzi 0,91 | pokazuje też, jak mała jest pełna zgodność między ekspertami |
Dwa wnioski wracają w tych pracach. Po pierwsze, na poziomie wskaźników z całej nocy (czas snu, AHI, wskaźnik wybudzeń) automat i ludzie zgadzają się dobrze. Po drugie, na poziomie pojedynczych epok błędy skupiają się w tych samych miejscach, w których ludzie są niepewni: przejścia między fazami, N1, głębokość snu, typ spłycenia oddechu.
Stanowisko AASM z 2020 r. w sprawie AI w medycynie snu wskazuje automatyczny scoring PSG jako najbliższe praktyczne zastosowanie, ale stawia warunki: jasno opisana populacja i cel narzędzia, walidacja na niezależnych danych i przejrzystość wobec pracowni, która z niego korzysta.
Co jest dopuszczone do użytku klinicznego
W USA automatyczna analiza PSG przechodzi ścieżkę 510(k) w FDA. Dwa przykłady z ostatnich lat:
- SleepStageML (Beacon Biosignals), 510(k) K233438, decyzja z marca 2024 r. Punktuje fazy snu z EEG w nagraniach PSG u dorosłych i ma wspierać klinicystę w ocenie snu. Jako pierwsze urządzenie w medycynie snu dostało wcześniej zatwierdzony plan zmian (PCCP), który pozwala aktualizować model bez nowego zgłoszenia, o ile każda wersja przejdzie ustalone testy.
- SOMNUM v3.0 (HoneyNaps), 510(k) K253390, ogłoszone w lipcu 2026 r. Analizuje nagrania PSG pierwszego poziomu u dorosłych od 22. roku życia: fazy snu, wybudzenia, ruchy kończyn, bezdechy i spłycenia, z podziałem bezdechów na obturacyjne, centralne i mieszane. Według zamierzonego zastosowania działa pod nadzorem lekarza, który może poprawiać i usuwać zdarzenia.
AASM prowadzi też własną certyfikację oprogramowania do autoscoringu. Pilotaż z 2023 r. obejmował tylko fazy snu u dorosłych, a pierwszym certyfikowanym produktem był Sleepware G3 z Somnolyzerem. W kwietniu 2026 r. AASM ogłosiła program dla pełnej PSG: fazy, zdarzenia oddechowe, wybudzenia i ruchy kończyn, oceniane na wieloośrodkowym zbiorze nagrań. Warunkiem jest dopuszczenie FDA albo trwające zgłoszenie.
W Unii Europejskiej oprogramowanie, które dostarcza informacji do decyzji diagnostycznych, jest zwykle wyrobem medycznym. Reguła 11 załącznika VIII rozporządzenia MDR daje mu co najmniej klasę IIa, a więc z udziałem jednostki notyfikowanej. System AI w takim wyrobie jest w AI Act systemem wysokiego ryzyka. Rozporządzenie (UE) 2026/1744, tzw. omnibus AI, przesunęło stosowanie tych obowiązków dla systemów AI w produktach regulowanych, takich jak wyroby medyczne, na 2 sierpnia 2028 r. Narzędzie używane wyłącznie w projekcie badawczym, bez wpływu na decyzje o konkretnym pacjencie, jest w innej sytuacji, ale granicę trzeba wyznaczyć świadomie.
To nie jest porada prawna. Klasyfikację konkretnego oprogramowania warto ustalić ze specjalistą od regulacji wyrobów medycznych.
Co AI robi dobrze, a gdzie potrzebny jest człowiek
| Zadanie | Automat | Rola człowieka |
|---|---|---|
| Desaturacje (spadek SpO2 ≥ 3% lub 4%) | reguła sygnałowa, powtarzalna | sprawdzić artefakty czujnika, zsunięty pulsoksymetr |
| Fazy W, N2, REM | zwykle na poziomie zgodności między ekspertami | przegląd hipnogramu, zwłaszcza na przejściach |
| N1 i granica N2/N3 | najwięcej rozbieżności, u ludzi też | decyzja przy niepewnych epokach |
| Wybudzenia | wykrywanie z EEG i EMG, wrażliwe na jakość sygnału | weryfikacja, bo wpływają na liczenie spłyceń |
| Typ bezdechu i spłycenia | trudne, ludzie zgadzają się słabo | ocena kliniczna w kontekście pacjenta |
| Brakujące lub zaszumione kanały | wiele modeli traci jakość | decyzja, czy nagranie nadaje się do oceny |
| Populacje spoza walidacji (dzieci, choroby neurologiczne) | brak gwarancji | narzędzie poza zakresem, ręczna ocena |
| Opis badania i rozpoznanie | poza zakresem automatu | wyłącznie lekarz |
W praktyce sensowny podział wygląda tak: automat robi pierwszy przebieg całej nocy, oznacza epoki i zdarzenia o niskiej pewności, a technik lub lekarz przegląda przede wszystkim te miejsca. Zysk czasu bierze się z tego, że nie trzeba punktować od zera ośmiu godzin zapisu, a nie z tego, że nikt już nie patrzy na sygnał.
Jak to wygląda u nas: pipeline dla Fundacji MT5
Fundacja MT5 prowadzi pracownie snu w szpitalach. Dziś nagrywają one około stu nocy miesięcznie. Dostarczyliśmy stronę techniczną: sprzęt, wdrożenie, drogę danych i klaster GPU NVIDIA Blackwell, który stoi w fundacji. Pełną historię opisujemy w realizacji dla Fundacji MT5.
Pipeline wygląda tak:
- Zapis. Rejestrator NOX A1s zapisuje noc do jednego pliku EDF+. Przykładowa noc z naszej opowieści to 90 kanałów w pliku, 8 godzin zapisu i około 495 mln próbek.
- Przygotowanie. Anonimizacja, filtracja (dla EEG pasmo 0,3-35 Hz), wspólna siatka próbkowania i wyrównanie kanałów co do próbki.
- Opis nocy. Pipeline automatycznie wykrywa zatrzymania przepływu, desaturacje o co najmniej 3% i wybudzenia oraz wylicza poglądowy hipnogram z EEG, EOG i aktywności. Zdarzenia opisujemy neutralnie, bez klasyfikowania ich typu.
- Okna dla modelu. Noc jest cięta na 30-sekundowe okna, na których trenujemy własny model. W każdym oknie zakrywamy jeden kanał, np. saturację, a model ma go odtworzyć z pozostałych. Żeby to zrobić, musi nauczyć się, jak oddech, serce, mózg i ruch zależą od siebie.
Cała ta analiza ma charakter poglądowy i badawczy. Nie jest opisem lekarskim i nie służy do diagnozowania pacjentów. Pytania badawcze, nad którymi pracujemy, są otwarte. Nie mamy jeszcze wyników i nie będziemy ich ogłaszać przed rzetelną weryfikacją. Dane pacjentów nie opuszczają fundacji, bo pipeline, model i dane są na sprzęcie w jej infrastrukturze. Jak podchodzimy do takich projektów, opisujemy na stronie filaru R&D.
Lista kontrolna przed wdrożeniem automatycznego scoringu
- Cel. Czy narzędzie ma wspierać opis kliniczny, czy służy tylko do badań? Od tego zależy, jakich dopuszczeń potrzebujesz.
- Populacja. Czy walidacja obejmuje Twoich pacjentów: wiek, choroby współistniejące, typ badania (PSG w pracowni czy badanie domowe)?
- Kanały i sprzęt. Czy model był walidowany na montażu i rejestratorze, którego używasz? Co robi, gdy brakuje kanału albo sygnał jest zaszumiony?
- Wersja reguł. Która wersja podręcznika AASM i które kryterium spłycenia oddechu (3% lub wybudzenie, czy 4%)? Musi się zgadzać z tym, co raportujesz.
- Własna walidacja. Porównaj automat z co najmniej dwoma osobami punktującymi na kilkudziesięciu Waszych nagraniach. Mierz zgodność z ludźmi i zgodność ludzi między sobą.
- Niepewność. Czy system pokazuje, które epoki i zdarzenia są niepewne? Przegląd powinien zaczynać się od nich.
- Ślad decyzji. Czy widać, co zrobił automat, a co poprawił człowiek? To ważne przy kontroli jakości i przy aktualizacjach modelu.
- Dane. Gdzie są przetwarzane nagrania? Jeśli poza placówką, na jakiej podstawie i z jakimi zabezpieczeniami? Jeśli na miejscu, kto utrzymuje serwer.
Źródła
- AASM: AASM releases updated version of scoring manual (wersja 3, 2023)
- AASM: Summary of Updates in Version 3 (PDF)
- AASM: AASM clarifies hypopnea scoring criteria
- Rosenberg, Van Hout: The AASM Inter-scorer Reliability Program, Sleep Stage Scoring, JCSM 2013
- Rosenberg, Van Hout: The AASM Inter-scorer Reliability Program, Respiratory Events, JCSM 2014
- Punjabi i in.: Computer-Assisted Automated Scoring of Polysomnograms Using the Somnolyzer System, Sleep 2015
- Perslev i in.: U-Sleep, resilient high-frequency sleep staging, npj Digital Medicine 2021
- Bakker i in.: Scoring sleep with artificial intelligence enables quantification of sleep stage ambiguity, Sleep 2023
- Goldstein i in.: Artificial intelligence in sleep medicine, an AASM position statement, JCSM 2020
- AASM: Beacon Biosignals receives FDA clearance for sleep staging software
- AASM: FDA clears HoneyNaps SOMNUM v3.0 sleep analysis software
- AASM: pilotaż certyfikacji oprogramowania do autoscoringu (2023)
- AASM: Full PSG Autoscoring Certification Program (2026)
- MDCG 2019-11: Guidance on qualification and classification of software (MDR/IVDR)
- Rozporządzenie (UE) 2026/1744 (omnibus AI), EUR-Lex
