Hvem klinisk AI tjener
Oversat fra engelsk. Læs originalen

For nogle år siden blev den mest udbredte model til at forudsige sepsis på amerikanske hospitaler evalueret uafhængigt. Sepsis er det, der sker, når en almindelig infektion vælter kroppen ud i en kædereaktion, der begynder at lukke organer ned. Den kan slå ihjel inden for timer, ofte før nogen indser, hvor syg patienten er. Modellen, der var bygget til at fange den, fangede kun ét ud af tre reelle tilfælde og markerede hver femte indlagte patient som højrisiko.
Klinikerne lærte det hurtigt. Alarmen går hele tiden på patienter, der ikke bliver dårligere, og overser de fleste af dem, der gør. Efter et par uger holder man op med at stole på den. Man er nødt til at holde op med at stole på den. Alarmen bliver til støj. Et system, der var købt for at fange forværring, havde lært alle at ignorere forværring.
Det er det første problem: dårlig matematik. Ingen beslutning om, hvor outputtet skal hen, retter op på det. Man kan ikke koble et defekt system op, så det tjener patienterne. Sepsismodellen dumpede ved valideringen, og intet længere nede i kæden ændrer på det.
Det var i 2021. I denne måned udkom MIRA i Nature. Det er en autonom medicinsk AI-agent, der læser patienters sygehistorie, bestiller undersøgelser, fortolker resultaterne og skriver behandlingsplaner. På identiske tilfælde ramte den 87,8 % diagnostisk træfsikkerhed mod 78,1 % for speciallæger. Den følger standardbehandlingen mere konsekvent end de læger, den blev målt op imod. Sådan ser forskningsfronten ud i dag.
MIRA bestod valideringen. Matematikken holder. Og netop derfor bliver et andet spørgsmål presserende.
Den samme model, med identiske output, tjener helt forskellige mennesker afhængigt af ét valg: hvor forudsigelsen sendes hen.
Hvis outputtet først når en kliniker, tjener det patienten, fordi klinikeren kan handle på det.
Hvis det først når en afgørelse om forsikringsdækning, tjener det forsikringsselskabet. Højrisikopatienter bliver markeret til afslag, før de overhovedet bliver syge, og patienten ser aldrig signalet.
Send det til sengeplanlægningen, og det tjener hospitalets logistik og flytter patienter hurtigere gennem sengene. Samme træfsikkerhed, en anden herre. Patienten bliver stadig diagnosticeret til sidst, men det var hospitalet, der besluttede, hvor signalet skulle hen, ikke patienten.
Modellen ændrede sig aldrig. Matematikken er solid. Hvem den tjener, afhænger af, hvem der besluttede, hvor signalet skal hen.
Så det spørgsmål, der er værd at stille om ethvert af disse systemer, er, hvem der ser outputtet, hvem der handler på det, og hvem der betaler, når det tager fejl.
For sepsismodellen er det spørgsmål nærmest ligegyldigt, fordi modellen ikke virker. Regningen lander alle steder. Hos lægen eller sygeplejersken, der har lært at lukke ørerne for alarmer, hos hospitalet, der står med ansvaret, og under det hele hos patienten, hvis forværring går upåagtet hen, mens alle ignorerer et system, der har slået falsk alarm for mange gange.
For MIRA er svaret ikke et tilfælde. Nogen besluttede, hvor signalet skal hen, og byggede systemet til at sende det derhen.
Og svaret skal være konkret. ”Den tjener patienterne” er den slags, der lyder rigtigt og ikke forpligter til noget. ”Den tjener sengeplanlægningen, som ser et output, patienten aldrig får at se” er konkret. Hvis du ikke kan navngive parten, har du ikke rigtig svaret.
Hvis du arbejder på et hospital, der køber denne teknologi, skal du stadig validere den. Klinisk evidens, test for bias, de dokumenterede måder, den fejler på. Det arbejde er reelt, og MIRA klarede det på tværs af otte diagnoser, hvor sepsismodellen slet ikke kunne klare det.
Men validering fortæller dig kun, om en AI eller en forudsigelsesmodel virker. Den fortæller dig intet om, hvem den tjener. En model kan bestå alle de test, du udsætter den for, og stadig være koblet op til at tjene den forkerte part. Perfekt evidens og dårlige incitamenter lever fint side om side i det samme system. Det er to forskellige problemer, og at bestå det første rører ikke ved det andet.
Du har brug for begge dele. God matematik og derefter et reelt svar på, hvem den tjener. De fleste systemer får aldrig matematikken på plads. De fleste af dem, der gør, stiller aldrig det andet spørgsmål.
Generelle LLM'er rykker nu direkte ind på hospitalerne. Patienter bruger ChatGPT, Claude og de andre til at læse deres egne prøvesvar og til at afgøre, om noget er et lægebesøg værd. Hospitaler tager dem i brug uden nogensinde at beslutte, hvor outputtet skal hen. Det er ikke det foruroligende.
Det foruroligende er, at patienten i al stilhed selv er blevet den, der bestemmer, hvor signalet går hen. Nogen læser en blodprøveværdi, spørger en chatbot, hvad den betyder, og hele udvekslingen foregår uden for ethvert hospital, enhver kliniker og enhver ramme, der er bygget til at stå til ansvar over for dem. Hvad der end former svaret, blev besluttet længere oppe i kæden, af dem, der trænede modellen og satte dens incitamenter. Ikke af nogen, der står til ansvar over for patienten.
En kliniker, der lukker ørerne for en defekt alarm, er en lokal fejl, én dårlig indkøbsbeslutning på ét hospital. En patient, der diagnosticerer sig selv via en chatbot for forbrugere, er noget større: klinisk dømmekraft, der helt forlader klinikken og flytter ind i systemer, som ingen i medicinen har kontrol over. Spørgsmålet er ikke længere, hvor hospitalet sender signalet hen. Det er, hvad virksomheden, der byggede modellen, har besluttet, at du skal vide.
Intet af dette kræver, at man forstår, hvordan et neuralt netværk fungerer. Det kræver kun, at man stiller spørgsmålet. Hvem tjener det her, så konkret, at du kunne skrive det ned: den faktiske part, hvis interesser har formet, hvad du får lov at se. ((Z))