ZohaibAkhtar

글

공유

임상 AI는 누구를 위해 일하는가

영어 원문을 번역했습니다. 원문 보기

몇 년 전, 미국 병원에서 가장 널리 도입된 패혈증 예측 모델이 독립적으로 평가되었습니다. 패혈증은 평범한 감염이 몸을 연쇄 반응으로 몰아넣어 장기가 멈추기 시작하는 상태입니다. 패혈증이 목숨을 앗아가는 데는 몇 시간이면 충분하며, 환자가 얼마나 위중한지 아무도 깨닫기 전에 그렇게 되는 경우가 많습니다. 이를 잡아내라고 만든 모델은 실제 사례를 세 건 중 한 건밖에 잡아내지 못했고, 입원 환자 다섯 명 중 한 명을 고위험으로 표시했습니다.

임상의들은 금세 배웠습니다. 경보는 악화되지 않는 환자에게 끊임없이 울리고, 정작 악화되는 환자는 대부분 놓칩니다. 몇 주만 지나면 경보를 믿지 않게 됩니다. 믿지 않을 수밖에 없습니다. 경보는 소음이 됩니다. 악화를 잡아내려고 사들인 시스템이 모두에게 악화를 무시하도록 가르친 셈입니다.

이것이 첫 번째 문제, 나쁜 수학입니다. 출력을 어디로 보낼지 정하는 것으로는 이 문제를 고칠 수 없습니다. 고장 난 시스템은 어떻게 연결해도 환자를 위해 일하게 만들 수 없습니다. 그 패혈증 모델은 검증 단계에서 실패했고, 그 뒤에 무엇을 해도 그 사실은 바뀌지 않습니다.

그게 2021년이었습니다. 이번 달 MIRA가 Nature에 실렸습니다. 환자 병력을 읽고, 검사를 지시하고, 결과를 해석하고, 치료 계획을 작성하는 자율형 의료 AI 에이전트입니다. 동일한 사례에서 MIRA의 진단 정확도는 87.8%로, 전문의 자격을 갖춘 의사들의 78.1%를 앞섰습니다. 비교 대상이 된 의사들보다 표준 진료를 더 일관되게 따릅니다. 지금의 최전선은 이런 모습입니다.

MIRA는 검증을 통과했습니다. 수학은 제대로 작동합니다. 그래서 다른 질문이 시급해집니다.

똑같은 출력을 내는 바로 그 모델이, 단 하나의 선택에 따라 완전히 다른 사람들을 위해 일하게 됩니다. 예측이 어디로 가느냐입니다.

출력이 임상의에게 먼저 닿으면, 모델은 환자를 위해 일합니다. 임상의가 그에 따라 행동할 수 있기 때문입니다.

보험 적용 결정에 먼저 닿으면, 모델은 보험사를 위해 일합니다. 고위험 환자는 아프기도 전에 거절 대상으로 표시되고, 환자는 그 신호를 끝내 보지 못합니다.

병상 관리로 보내면 모델은 병원의 물류를 위해 일하며, 환자를 병상에서 더 빨리 회전시킵니다. 정확도는 같은데 주인이 다릅니다. 환자는 결국 진단을 받기는 하지만, 경로를 정한 것은 환자가 아니라 병원입니다.

모델은 한 번도 바뀌지 않았습니다. 수학에도 문제가 없습니다. 모델이 누구를 위해 일하느냐는, 신호가 어디로 갈지 누가 정했느냐에 달려 있습니다.

그러니 이런 시스템 무엇에 대해서든 물어볼 가치가 있는 질문은, 누가 그 출력을 보고, 누가 그에 따라 행동하며, 틀렸을 때 누가 대가를 치르느냐는 것입니다.

그 패혈증 모델에는 이 질문이 거의 무의미합니다. 모델 자체가 고장 났기 때문입니다. 비용은 모두에게 돌아갑니다. 경보를 흘려듣게 된 의사나 간호사, 법적 책임을 떠안은 병원, 그리고 그 모든 것의 밑바닥에는 환자가 있습니다. 너무 여러 번 헛경보를 울린 시스템을 모두가 무시하는 동안, 환자의 악화는 아무도 모르게 지나갑니다.

MIRA에서는 그 답이 우연이 아닙니다. 누군가 신호가 어디로 갈지 정했고, 그곳으로 보내도록 시스템을 만들었습니다.

그리고 답은 구체적이어야 합니다. “환자를 위해 일한다”는 옳게 들리지만 아무것도 약속하지 않는 말입니다. “환자는 결코 보지 못할 출력을 보는 병상 관리팀을 위해 일한다”는 구체적입니다. 그 당사자를 지목할 수 없다면, 아직 제대로 답한 것이 아닙니다.

이 기술을 구매하는 병원에서 일한다면, 그래도 검증은 해야 합니다. 임상적 근거, 편향 검사, 문서화된 실패 양상. 그것은 엄연히 해야 할 일이고, MIRA는 여덟 가지 진단에서 그 관문을 넘었습니다. 그 패혈증 모델은 아예 넘지 못한 관문입니다.

하지만 검증이 알려 주는 것은 AI나 예측 모델이 작동하는지뿐입니다. 그것이 누구를 위해 일하는지는 전혀 알려 주지 않습니다. 모델은 어떤 시험이든 다 통과하고도 엉뚱한 쪽을 위해 일하도록 연결되어 있을 수 있습니다. 완벽한 근거와 나쁜 인센티브는 한 시스템 안에서 아무 문제 없이 공존합니다. 둘은 서로 다른 문제이고, 첫 번째를 통과했다고 두 번째가 해결되지는 않습니다.

둘 다 필요합니다. 좋은 수학, 그리고 누구를 위해 일하느냐에 대한 진짜 답. 대부분의 시스템은 수학부터 제대로 하지 못합니다. 수학을 제대로 해낸 시스템도 대부분 두 번째 질문은 던지지 않습니다.

이제 범용 LLM이 병원으로 곧장 들어오고 있습니다. 환자들은 ChatGPT, Claude 같은 것들로 자기 검사 결과를 읽고, 병원에 가 볼 만한 일인지 판단합니다. 병원은 출력이 어디로 가야 하는지 정하지도 않은 채 이것들을 도입합니다. 불안한 건 그게 아닙니다.

불안한 것은 어느새 환자가 직접 신호의 경로를 정하는 사람이 되어 버렸다는 점입니다. 누군가 검사 수치를 읽고, 챗봇에게 그게 무슨 뜻인지 묻습니다. 그 대화 전체가 어떤 병원도, 어떤 임상의도, 그 사람에게 책임을 지도록 만들어진 어떤 체계도 거치지 않고 이루어집니다. 그 답을 빚어내는 것이 무엇이든, 그것은 이미 상류에서, 모델을 훈련시키고 그 인센티브를 정한 쪽이 결정한 것입니다. 환자에게 책임을 지는 누군가가 결정한 것이 아닙니다.

고장 난 경보를 흘려듣는 임상의는 국지적인 실패입니다. 한 병원의 잘못된 구매 결정 하나일 뿐입니다. 소비자용 챗봇으로 스스로를 진단하는 환자는 그보다 큰 일입니다. 임상적 판단이 진료실을 완전히 떠나, 의학계의 누구도 통제하지 못하는 시스템 속으로 옮겨 가는 것입니다. 이제 질문은 병원이 신호를 어디로 보내느냐가 아닙니다. 모델을 만든 회사가 당신이 무엇을 알아야 한다고 정했느냐입니다.

이 모든 것에 신경망의 작동 원리를 이해할 필요는 없습니다. 질문을 던지기만 하면 됩니다. 이것은 누구를 위해 일하는가. 그 답은 받아 적을 수 있을 만큼 구체적이어야 합니다. 당신이 무엇을 볼 수 있는지를 자기 이해관계에 따라 정한, 바로 그 실제 당사자. ((Z))