临床 AI 为谁服务
译自英文。 阅读原文

几年前,美国医院中部署最广泛的脓毒症预测模型接受了独立评估。脓毒症是指一次普通感染引发身体的连锁反应,导致器官开始衰竭。它可以在几小时内致命,往往还没有人意识到患者病得有多重。这个专为捕捉脓毒症而建的模型,只捕捉到三分之一的真实病例,却把五分之一的住院患者标记为高风险。
临床医生很快就学乖了。警报对没有恶化的患者响个不停,却漏掉了大多数正在恶化的患者。几周之后,你就不再信任它。你不得不停止信任它。警报变成了噪音。一个为捕捉病情恶化而买来的系统,反倒训练所有人去忽视病情恶化。
这是第一个问题:糟糕的数学。无论把输出送往哪里,都修复不了它。一个坏掉的系统,怎么接线也没法为患者服务。这个脓毒症模型在验证阶段就失败了,下游做什么都改变不了这一点。
那是2021年的事。这个月,MIRA 发表在 Nature 上。它是一个自主的医疗 AI 智能体,能阅读患者病史、开检查、解读结果、撰写治疗方案。在相同的病例上,它的诊断准确率达到87.8%,而获得专科委员会认证的医生为78.1%。它比用来和它对比的医生更一致地遵循诊疗标准。这就是当前前沿的样子。
MIRA 通过了验证。数学没问题。这让另一个问题变得紧迫起来。
同一个模型,输出完全相同,却会因为一个选择而服务于完全不同的人:预测被送往哪里。
如果输出先到达临床医生,它就服务于患者,因为临床医生可以据此行动。
如果它先到达承保决策,它就服务于保险公司。高风险患者还没生病就被标记为拒保对象,而患者自始至终都看不到这个信号。
把它接到床位管理,它就服务于医院的运营,让患者更快地在病床间周转。同样的准确率,不同的主人。患者最终还是会得到诊断,但信号送往哪里,是医院决定的,不是患者。
模型从未改变。数学是可靠的。它服务于谁,归根结底取决于谁决定了信号的去向。
所以,对任何这类系统,真正值得问的问题是:谁看到输出,谁据此行动,出了错由谁买单。
对那个脓毒症模型来说,这个问题几乎无关紧要,因为模型本身就是坏的。代价落在每一个人身上。学会了对警报充耳不闻的医生或护士,承担法律责任的医院,而在这一切之下是患者:所有人都在无视一个喊了太多次“狼来了”的系统,患者的病情恶化就这样无人察觉。
对 MIRA 来说,答案并非偶然。有人决定了信号去往哪里,并为此搭好了系统,把信号送到那里。
而且答案必须具体。“它服务于患者”这种话听起来没错,却什么也没承诺。“它服务于床位管理团队,他们看到的输出,患者永远看不到”才算具体。如果你说不出是哪一方,你其实就没有回答。
如果你在一家正在采购这项技术的医院工作,你仍然必须验证它。临床证据,偏倚测试,有据可查的失效模式。这项工作实实在在,MIRA 在八种诊断上都过了这一关,而那个脓毒症模型根本过不了。
但验证只能告诉你一个 AI 或预测模型管不管用。至于它服务于谁,验证什么也告诉不了你。一个模型可以通过你拿来考它的每一项测试,却仍然被接线去为错误的一方服务。完美的证据和糟糕的激励,可以在同一个系统里相安无事。它们是两个不同的问题,解决了第一个,丝毫触及不到第二个。
两者你都需要。好的数学,然后是对“它服务于谁”的真正回答。大多数系统从来没把数学做对。而在做对了数学的系统里,大多数从来不问第二个问题。
通用大语言模型正在直接进入医院。患者在用 ChatGPT、Claude 之类的工具解读自己的化验结果,判断某件事值不值得去看一趟医生。医院在部署它们,却从未决定输出应该送往哪里。这还不是让人不安的部分。
让人不安的是,患者已经悄悄变成了路由器。有人读到一个化验值,问聊天机器人这是什么意思,整个过程发生在任何医院、任何临床医生、任何为对患者负责而建立的框架之外。左右这个答案的一切,都在上游就已决定,由训练模型、设定其激励的人决定。而不是由任何需要对患者负责的人决定。
临床医生对一个坏掉的警报充耳不闻,是局部的失败,是一家医院的一次糟糕采购。患者通过面向消费者的聊天机器人给自己诊断,则是更大的事情:临床判断彻底离开了诊室,进入了医学界无人掌控的系统。问题不再是医院把信号送到哪里。而是构建模型的那家公司,决定让你知道什么。
这一切都不需要你懂神经网络如何运作。只需要你提出这个问题。它服务于谁,具体到你能把它写下来:真实存在的那一方,正是它的利益决定了你被允许看到什么。 ((Z))