ZohaibAkhtar

Textos

Compartilhar

A quem serve a IA clínica

Traduzido do inglês. Ler o original

Há alguns anos, o modelo de previsão de sepse mais usado nos hospitais americanos passou por uma avaliação independente. Sepse é o que acontece quando uma infecção comum leva o corpo a uma reação em cadeia que começa a fazer os órgãos pararem. Pode matar em questão de horas, muitas vezes antes que alguém perceba o quanto o paciente está grave. O modelo criado para detectá-la pegava só um em cada três casos reais, e marcava como alto risco um em cada cinco pacientes internados.

As equipes aprenderam rápido. O alerta dispara o tempo todo em pacientes que não estão piorando, e deixa passar a maioria dos que estão. Depois de algumas semanas, você para de confiar nele. Você precisa parar de confiar nele. O alerta vira ruído. Um sistema comprado para detectar a piora tinha treinado todo mundo a ignorar a piora.

Este é o primeiro problema: matemática ruim. Nenhuma decisão de roteamento conserta isso. Não dá para configurar um sistema quebrado para servir aos pacientes. O modelo de sepse falhou na validação, e nada do que vem depois muda isso.

Isso foi em 2021. Este mês, o MIRA saiu na Nature. É um agente autônomo de IA médica que lê o histórico dos pacientes, pede exames, interpreta resultados e escreve planos de tratamento. Nos mesmos casos, chegou a 87,8% de acurácia diagnóstica, contra 78,1% de médicos com título de especialista. Segue o padrão de cuidado com mais consistência do que os médicos com quem foi comparado. Esta é a cara da fronteira atual.

O MIRA passou na validação. A matemática funciona. E é isso que torna urgente uma outra pergunta.

Esse mesmo modelo, com resultados idênticos, serve a pessoas completamente diferentes dependendo de uma única escolha: para onde vai a previsão.

Se o resultado chega primeiro a um médico, ele serve ao paciente, porque o médico pode agir a partir dele.

Se chega primeiro a uma decisão de cobertura, serve à seguradora. Pacientes de alto risco são marcados para negativa antes mesmo de adoecer, e o paciente nunca chega a ver o sinal.

Mande-o para a gestão de leitos e ele serve à logística do hospital, fazendo os pacientes passarem pelos leitos mais depressa. Mesma acurácia, outro dono. O paciente acaba recebendo o diagnóstico, mas quem tomou a decisão de roteamento foi o hospital, não ele.

O modelo nunca mudou. A matemática é sólida. A quem ele serve depende de quem decidiu para onde vai o sinal.

Então a pergunta que vale fazer sobre qualquer um desses sistemas é quem vê o resultado, quem age a partir dele e quem paga quando ele erra.

No caso do modelo de sepse, essa pergunta é quase irrelevante, porque o modelo está quebrado. O custo cai em todo lugar. O médico ou a enfermeira que aprendeu a ignorar alarmes, o hospital que arca com a responsabilidade e, por baixo de tudo, o paciente, cuja piora passa despercebida enquanto todos ignoram um sistema que deu alarme falso vezes demais.

No caso do MIRA, a resposta não é um acaso. Alguém decidiu para onde vai o sinal e construiu o sistema para mandá-lo para lá.

E a resposta tem que ser específica. “Ele serve aos pacientes” é o tipo de frase que soa certa e não se compromete com nada. “Ele serve à equipe de gestão de leitos, que vê um resultado que o paciente nunca vai ver” é específico. Se você não consegue nomear quem é servido, ainda não respondeu de verdade.

Se você trabalha num hospital que está comprando essa tecnologia, ainda precisa validá-la. Evidência clínica, testes de viés, os modos de falha documentados. Esse trabalho é real, e o MIRA passou por ele em oito diagnósticos, enquanto o modelo de sepse não passou de jeito nenhum.

Mas a validação só diz se uma IA ou um modelo de previsão funciona. Não diz nada sobre a quem ele serve. Um modelo pode passar em todos os testes que você aplicar e ainda assim estar configurado para servir à parte errada. Evidência perfeita e incentivos ruins convivem tranquilamente no mesmo sistema. São problemas diferentes, e resolver o primeiro não toca no segundo.

Você precisa dos dois. Boa matemática e, depois, uma resposta de verdade sobre a quem o sistema serve. A maioria dos sistemas nunca acerta a matemática. A maioria dos que acertam nunca faz a segunda pergunta.

Os LLMs de uso geral estão entrando direto nos hospitais. Pacientes usam o ChatGPT, o Claude e os demais para ler os próprios resultados de exames e decidir se algo vale uma consulta. Hospitais os estão implantando sem nunca decidir para onde o resultado deveria ir. Essa não é a parte inquietante.

A parte inquietante é que o paciente, sem alarde, virou o roteador. Alguém lê o valor de um exame, pergunta a um chatbot o que significa, e a conversa inteira acontece fora de qualquer hospital, de qualquer médico, de qualquer estrutura criada para prestar contas a essa pessoa. O que molda essa resposta foi decidido antes, por quem treinou o modelo e definiu seus incentivos. Não por alguém que responda ao paciente.

Um médico que passa a ignorar um alarme quebrado é uma falha local, uma má decisão de compra em um hospital. Um paciente que se autodiagnostica com um chatbot de consumo é algo maior: o julgamento clínico saindo de vez da clínica e indo para sistemas que ninguém na medicina controla. A pergunta já não é para onde o hospital envia o sinal. É o que a empresa que construiu o modelo decidiu que você deveria saber.

Nada disso exige entender como funciona uma rede neural. Só exige fazer a pergunta. A quem isso serve, dito de forma específica o bastante para que você possa pôr no papel: a parte real cujos interesses definiram o que você tem permissão para ver. ((Z))