Komu służy kliniczna AI
Przetłumaczono z angielskiego. Przeczytaj oryginał

Kilka lat temu niezależnie oceniono najszerzej wdrożony model przewidywania sepsy w amerykańskich szpitalach. Sepsa to stan, w którym zwykła infekcja wprawia organizm w reakcję łańcuchową, która zaczyna wyłączać narządy. Może zabić w ciągu kilku godzin, często zanim ktokolwiek zorientuje się, jak ciężko chory jest pacjent. Model zbudowany po to, żeby ją wychwytywać, wychwycił zaledwie jeden na trzy rzeczywiste przypadki, a co piątego hospitalizowanego pacjenta oznaczył jako pacjenta wysokiego ryzyka.
Klinicyści szybko wyciągnęli wnioski. Alert odzywa się bez przerwy u pacjentów, których stan się nie pogarsza, i przeocza większość tych, u których się pogarsza. Po kilku tygodniach przestaje się mu ufać. Trzeba przestać mu ufać. Alert staje się szumem. System kupiony po to, żeby wychwytywać pogorszenie, nauczył wszystkich ignorować pogorszenie.
To pierwszy problem: zła matematyka. Nie naprawi go żadna decyzja o tym, dokąd trafia wynik. Zepsutego systemu nie da się podłączyć tak, żeby służył pacjentom. Model sepsy oblał walidację i nic, co dzieje się dalej, tego nie zmieni.
To był rok 2021. W tym miesiącu MIRA trafiła na łamy Nature. To autonomiczny agent medycznej AI: czyta historię choroby pacjentów, zleca badania, interpretuje wyniki i pisze plany leczenia. Na identycznych przypadkach MIRA osiągnęła trafność diagnostyczną 87,8% wobec 78,1% u lekarzy specjalistów. Konsekwentniej niż lekarze, z którymi ją porównywano, trzyma się standardów postępowania. Tak dziś wygląda czołówka.
MIRA przeszła walidację. Matematyka się zgadza. I właśnie dlatego pilne staje się inne pytanie.
Ten sam model, z identycznymi wynikami, służy zupełnie innym ludziom w zależności od jednego wyboru: dokąd trafia predykcja.
Jeśli wynik trafia najpierw do klinicysty, służy pacjentowi, bo klinicysta może na jego podstawie działać.
Jeśli trafia najpierw do decyzji o pokryciu kosztów, służy ubezpieczycielowi. Pacjentów wysokiego ryzyka oznacza się do odmowy, zanim w ogóle zachorują, a sam pacjent nigdy tego sygnału nie zobaczy.
Wystarczy skierować go do działu zarządzania łóżkami, a zacznie służyć logistyce szpitala i przyspieszać rotację pacjentów na łóżkach. Ta sama trafność, inny pan. Pacjent i tak w końcu dostanie diagnozę, ale to szpital zdecydował, dokąd trafia wynik, nie on.
Model się nie zmienił. Matematyka jest w porządku. To, komu służy, sprowadza się do tego, kto zdecydował, dokąd trafia sygnał.
Pytanie, które warto zadać o każdy z tych systemów, brzmi więc: kto widzi wynik, kto na jego podstawie działa i kto płaci, kiedy wynik jest błędny.
W przypadku modelu sepsy to pytanie jest niemal bez znaczenia, bo model jest zepsuty. Koszt spada na wszystkich. Na lekarza czy pielęgniarkę, którzy nauczyli się nie słyszeć alarmów, na szpital, który ponosi odpowiedzialność prawną, a pod tym wszystkim na pacjenta, którego pogorszenia nikt nie zauważa, bo wszyscy ignorują system, który zbyt wiele razy podnosił fałszywy alarm.
W przypadku MIRA odpowiedź nie jest dziełem przypadku. Ktoś zdecydował, dokąd trafia sygnał, i zbudował system tak, żeby go tam wysyłał.
I ta odpowiedź musi być konkretna. „Służy pacjentom” to coś, co brzmi dobrze i do niczego nie zobowiązuje. „Służy zespołowi zarządzającemu łóżkami, który widzi wynik, jakiego pacjent nigdy nie zobaczy” to konkret. Jeśli nie da się wskazać tej strony, odpowiedzi tak naprawdę nie ma.
Jeśli pracujecie w szpitalu, który kupuje tę technologię, i tak musicie ją zwalidować. Dowody kliniczne, testy pod kątem stronniczości, udokumentowane scenariusze błędów. To prawdziwa praca i MIRA przeszła ją w ośmiu rozpoznaniach, podczas gdy model sepsy nie przeszedł jej wcale.
Ale walidacja mówi tylko, czy AI albo model predykcyjny działa. Nie mówi nic o tym, komu służy. Model może przejść każdy test, jakim się go sprawdzi, i nadal być podłączony tak, że służy niewłaściwej stronie. Doskonałe dowody i złe bodźce świetnie dogadują się w jednym systemie. To dwa różne problemy, a rozwiązanie pierwszego w ogóle nie dotyka drugiego.
Potrzeba jednego i drugiego. Dobrej matematyki, a potem prawdziwej odpowiedzi na pytanie, komu to służy. Większości systemów nigdy nie udaje się dopracować matematyki. Większość tych, którym się udaje, nigdy nie zadaje drugiego pytania.
Modele LLM ogólnego przeznaczenia wchodzą teraz prosto do szpitali. Pacjenci używają ChatGPT, Claude'a i całej reszty, żeby czytać własne wyniki badań i decydować, czy z czymś warto iść do lekarza. Szpitale je wdrażają, nigdy nie decydując, dokąd wynik ma właściwie trafiać. Nie to jednak jest niepokojące.
Niepokojące jest to, że pacjent po cichu sam został zwrotniczym. Ktoś czyta wynik badania, pyta chatbota, co on oznacza, i cała ta wymiana odbywa się poza jakimkolwiek szpitalem, jakimkolwiek klinicystą, jakimikolwiek ramami stworzonymi po to, żeby odpowiadać przed tą osobą. Cokolwiek kształtuje tę odpowiedź, zostało ustalone wcześniej i gdzie indziej, przez tego, kto wytrenował model i ustawił jego bodźce. Nie przez nikogo, kto odpowiada przed pacjentem.
Klinicysta, który przestał słyszeć zepsuty alarm, to porażka lokalna, jedna zła decyzja zakupowa w jednym szpitalu. Pacjent, który diagnozuje się sam przez konsumenckiego chatbota, to coś większego: osąd kliniczny całkowicie opuszcza klinikę i przenosi się do systemów, których nikt w medycynie nie kontroluje. Pytanie nie brzmi już, dokąd szpital wysyła sygnał. Brzmi: co według firmy, która zbudowała model, powinniście wiedzieć.
Nic z tego nie wymaga rozumienia, jak działa sieć neuronowa. Wymaga tylko zadania pytania. Komu to służy, z odpowiedzią na tyle konkretną, żeby dało się ją zapisać: tej rzeczywistej stronie, której interesy ukształtowały to, co wolno wam zobaczyć. ((Z))