ZohaibAkhtar

Escritos

Compartir

A quién sirve la IA clínica

Traducido del inglés. Leer el original

Hace unos años se evaluó de forma independiente el modelo de predicción de sepsis más implantado en los hospitales estadounidenses. La sepsis es lo que ocurre cuando una infección corriente desencadena en el cuerpo una reacción en cadena que empieza a hacer fallar los órganos. Puede matar en cuestión de horas, a menudo antes de que nadie se dé cuenta de lo grave que está el paciente. El modelo creado para detectarla solo detectó uno de cada tres casos reales, y marcó como de alto riesgo a uno de cada cinco pacientes hospitalizados.

El personal clínico aprendió rápido. La alerta salta constantemente con pacientes que no se están deteriorando, y se le escapan la mayoría de los que sí. Al cabo de unas semanas, uno deja de fiarse de ella. Uno tiene que dejar de fiarse de ella. La alerta se convierte en ruido. Un sistema comprado para detectar el deterioro había enseñado a todo el mundo a ignorar el deterioro.

Este es el primer problema: las malas matemáticas. Ninguna decisión sobre a dónde va el resultado lo arregla. No se puede conectar un sistema roto para que sirva a los pacientes. El modelo de sepsis fracasó en la validación y nada de lo que venga después cambia eso.

Eso fue en 2021. Este mes, MIRA se publicó en Nature. Es un agente autónomo de IA médica que lee historias clínicas, pide pruebas, interpreta resultados y redacta planes de tratamiento. Con casos idénticos, alcanzó un 87,8 % de precisión diagnóstica, frente al 78,1 % de médicos especialistas certificados. Sigue el estándar de atención con más constancia que los médicos con los que se le comparó. Así es hoy la frontera.

MIRA superó la validación. Las matemáticas funcionan. Y eso vuelve urgente otra pregunta.

Ese mismo modelo, con resultados idénticos, sirve a personas completamente distintas según una sola decisión: a dónde va la predicción.

Si el resultado llega primero a un clínico, sirve al paciente, porque el clínico puede actuar en consecuencia.

Si llega primero a una decisión de cobertura, sirve a la aseguradora. A los pacientes de alto riesgo se les marca para denegarles la cobertura antes incluso de que enfermen, y el paciente nunca llega a ver la señal.

Si se envía a la gestión de camas, sirve a la logística del hospital, que mueve a los pacientes por las camas más deprisa. La misma precisión, distinto amo. El paciente acaba recibiendo su diagnóstico, pero quien decidió a dónde iba la señal fue el hospital, no él.

El modelo nunca cambió. Las matemáticas son sólidas. A quién sirve depende de quién decidió a dónde va la señal.

Así que la pregunta que vale la pena hacerse sobre cualquiera de estos sistemas es quién ve el resultado, quién actúa en consecuencia y quién paga cuando se equivoca.

En el caso del modelo de sepsis, esa pregunta casi no viene al caso, porque el modelo está roto. El precio lo paga todo el mundo. El médico o la enfermera que aprendió a desconectar de las alarmas, el hospital que carga con la responsabilidad legal y, por debajo de todo, el paciente, cuyo deterioro pasa desapercibido mientras todos ignoran un sistema que dio demasiadas falsas alarmas.

En el caso de MIRA, la respuesta no es fruto del azar. Alguien decidió a dónde va la señal y construyó el sistema para enviarla allí.

Y la respuesta tiene que ser concreta. “Sirve a los pacientes” es de esas frases que suenan bien y no comprometen a nada. “Sirve al equipo de gestión de camas, que ve un resultado que el paciente nunca verá” es concreto. Si no se puede nombrar a la parte, en realidad no se ha respondido.

Si usted trabaja en un hospital que compra esta tecnología, sigue teniendo que validarla. Evidencia clínica, pruebas de sesgo, modos de fallo documentados. Ese trabajo es real, y MIRA lo superó en ocho diagnósticos, mientras que el modelo de sepsis no consiguió superarlo en absoluto.

Pero la validación solo dice si un modelo de IA o de predicción funciona. No dice nada de a quién sirve. Un modelo puede superar todas las pruebas que se le pongan y seguir conectado para servir a quien no debe. Una evidencia perfecta y unos malos incentivos conviven sin problema en el mismo sistema. Son problemas distintos, y superar el primero no toca el segundo.

Hacen falta las dos cosas. Buenas matemáticas y, después, una respuesta real a la pregunta de a quién sirve. La mayoría de los sistemas nunca aciertan con las matemáticas. La mayoría de los que lo consiguen nunca se hacen la segunda pregunta.

Los LLM generalistas ya están entrando directamente en los hospitales. Los pacientes usan ChatGPT, Claude y los demás para leer sus propios resultados de laboratorio y decidir si algo merece una consulta. Los hospitales los implantan sin decidir nunca a dónde se supone que debe ir el resultado. Eso no es lo inquietante.

Lo inquietante es que el paciente se ha convertido, sin que nadie lo note, en quien decide a dónde va la señal. Alguien lee un valor de laboratorio, le pregunta a un chatbot qué significa, y todo el intercambio ocurre fuera de cualquier hospital, de cualquier clínico, de cualquier marco pensado para rendirle cuentas. Lo que moldea esa respuesta se decidió antes, aguas arriba, por quien entrenó el modelo y fijó sus incentivos. No por alguien que responda ante el paciente.

Un clínico que desconecta de una alarma rota es un fallo local, una mala decisión de compra en un hospital. Un paciente que se diagnostica a sí mismo con un chatbot de consumo es algo mayor: el juicio clínico saliendo por completo de la consulta, hacia sistemas que nadie en la medicina controla. La pregunta ya no es a dónde envía el hospital la señal. Es qué decidió que usted debía saber la empresa que construyó el modelo.

Nada de esto exige entender cómo funciona una red neuronal. Solo exige hacer la pregunta. A quién sirve esto, dicho con la precisión suficiente como para poder escribirlo: la parte concreta cuyos intereses determinaron lo que a usted se le permite ver. ((Z))