Al servizio di chi è l'IA clinica
Tradotto dall'inglese. Leggi l'originale

Qualche anno fa il modello di previsione della sepsi più diffuso negli ospedali americani è stato valutato in modo indipendente. La sepsi è ciò che accade quando una comune infezione spinge l'organismo in una reazione a catena che inizia a spegnere gli organi. Può uccidere nel giro di poche ore, spesso prima che qualcuno si renda conto di quanto il paziente sia grave. Il modello costruito per intercettarla individuava solo un caso reale su tre, e segnalava come ad alto rischio un paziente ricoverato su cinque.
I clinici hanno imparato in fretta. L'allerta scatta di continuo su pazienti che non stanno peggiorando, e manca la maggior parte di quelli che peggiorano. Dopo qualche settimana si smette di fidarsene. Si è costretti a smettere di fidarsene. L'allerta diventa rumore. Un sistema acquistato per intercettare il peggioramento aveva insegnato a tutti a ignorare il peggioramento.
Questo è il primo problema: la matematica sbagliata. Nessuna scelta su dove instradare l'output lo risolve. Non si può cablare un sistema guasto perché serva i pazienti. Il modello della sepsi ha fallito alla validazione e niente a valle cambia questo fatto.
Era il 2021. Questo mese MIRA è uscito su Nature. È un agente di IA medica autonomo che legge le anamnesi dei pazienti, prescrive esami, ne interpreta i risultati e scrive piani di trattamento. Sugli stessi casi ha raggiunto un'accuratezza diagnostica dell'87,8%, contro il 78,1% dei medici specialisti. Segue gli standard di cura con più coerenza dei medici con cui è stato confrontato. Ecco com'è oggi la frontiera.
MIRA ha superato la validazione. La matematica funziona. Il che rende urgente un'altra domanda.
Lo stesso modello, con output identici, serve persone completamente diverse a seconda di una sola scelta: dove va la previsione.
Se l'output arriva prima a un clinico, serve il paziente, perché il clinico può agire di conseguenza.
Se arriva prima a una decisione sulla copertura assicurativa, serve l'assicuratore. I pazienti ad alto rischio vengono segnalati per il rifiuto della copertura prima ancora di ammalarsi, e il paziente quel segnale non lo vede nemmeno.
Se lo si manda alla gestione dei posti letto, serve la logistica dell'ospedale e fa ruotare i pazienti nei letti più in fretta. Stessa accuratezza, padrone diverso. Prima o poi il paziente riceve comunque la diagnosi, ma la decisione su dove mandare il segnale l'ha presa l'ospedale, non lui.
Il modello non è mai cambiato. La matematica è solida. Chi serve dipende da chi ha deciso dove va il segnale.
Quindi la domanda da porsi su qualsiasi sistema di questo tipo è chi vede l'output, chi agisce di conseguenza e chi paga quando sbaglia.
Per il modello della sepsi, questa domanda è quasi irrilevante, perché il modello è guasto. Il costo ricade ovunque. Sul medico o sull'infermiere che ha imparato a non sentire più gli allarmi, sull'ospedale che si fa carico della responsabilità, e sotto a tutto sul paziente, il cui peggioramento passa inosservato mentre tutti ignorano un sistema che ha gridato al lupo troppe volte.
Per MIRA, la risposta non è un caso. Qualcuno ha deciso dove va il segnale e ha costruito il sistema per mandarlo lì.
E la risposta deve essere specifica. “Serve i pazienti” è il genere di frase che suona giusta e non impegna a niente. “Serve il team di gestione dei posti letto, che vede un output che il paziente non vedrà mai” è specifica. Se non si sa nominare la parte in causa, non si è davvero risposto.
Se lavora in un ospedale che sta acquistando questa tecnologia, deve comunque validarla. Evidenze cliniche, test sui bias, modalità di errore documentate. È un lavoro vero, e MIRA lo ha superato su otto diagnosi, mentre il modello della sepsi non era riuscito a superarlo affatto.
Ma la validazione dice solo se un'IA o un modello predittivo funziona. Non dice nulla su chi serve. Un modello può superare ogni test a cui lo si sottopone ed essere comunque cablato per servire la parte sbagliata. Evidenze perfette e incentivi sbagliati convivono tranquillamente nello stesso sistema. Sono problemi diversi, e superare il primo non tocca il secondo.
Servono entrambe le cose. Una matematica corretta, e poi una risposta vera alla domanda su chi serve. La maggior parte dei sistemi non arriva mai a una matematica corretta. La maggior parte di quelli che ci arrivano non si pone mai la seconda domanda.
Gli LLM generalisti stanno ormai entrando direttamente negli ospedali. I pazienti usano ChatGPT, Claude e gli altri per leggere i risultati delle proprie analisi e per decidere se valga la pena farsi visitare. Gli ospedali li adottano senza mai decidere dove debba andare l'output. Non è questa la parte inquietante.
La parte inquietante è che il paziente, in silenzio, è diventato lui il punto di smistamento. Qualcuno legge un valore di laboratorio, chiede a un chatbot che cosa significa, e tutto lo scambio avviene fuori da qualsiasi ospedale, da qualsiasi clinico, da qualsiasi quadro costruito per rendere conto a lui. Qualunque cosa plasmi quella risposta è stata decisa a monte, da chi ha addestrato il modello e ne ha fissato gli incentivi. Non da qualcuno che risponde al paziente.
Un clinico che non sente più un allarme guasto è un fallimento locale, una cattiva decisione d'acquisto in un ospedale. Un paziente che si fa la diagnosi da solo con un chatbot per il grande pubblico è qualcosa di più grande: il giudizio clinico che esce del tutto dalla clinica e si sposta in sistemi che nessuno in medicina controlla. La domanda non è più dove l'ospedale manda il segnale. È che cosa l'azienda che ha costruito il modello ha deciso che Lei debba sapere.
Niente di tutto questo richiede di capire come funziona una rete neurale. Richiede solo di porsi la domanda. Chi serve, detto in modo abbastanza specifico da poterlo mettere per iscritto: la parte reale i cui interessi hanno deciso che cosa Le è concesso vedere. ((Z))