意外发现(Chroneme)
译自英文。 阅读原文

本周的意外发现。大多数临床 AI 模型还没进入第二家医院就停滞了。Epic 的脓毒症模型就是教科书式的例子。它是美国部署最广泛的临床 AI 工具之一,在数百家医院运行。它被宣传为一种能在患者发生脓毒症数小时前就向医生预警的手段。
2021年,密歇根的一个团队对它进行了独立测试,并将结果发表在 JAMA Internal Medicine 上。该模型只捕捉到三分之一的脓毒症病例,标记了大约五分之一的住院病例,准确率比 Epic 自己报告的低了13到20个百分点。
这并不罕见。这种现象有个名字:跨数据库崩溃。模型学会的是一个机构如何记录数据,一旦遇到另一个机构,它的优势就荡然无存。
我建立 Chroneme,基于的是一个不同的前提。一个读取身体随时间实际如何变化、而不是医院如何记录这些变化的系统,应该能够在医院之间迁移。而且它不应该局限于一种病症。Epic 预测脓毒症。Chroneme 读取的是轨迹,所以同一个引擎可以标记出任何严重到需要血管加压药、气管插管或透析的病情恶化。
我在两个庞大且完全独立的 ICU 数据库上测试了它。不同的医院,不同的电子健康记录系统,不同的年代。两边的结果相差不到半个百分点。在临床 AI 中,跨数据库一致性这么高的情况很少见,尤其是对于一个在任何干预之前就进行测量的复合结局。崩溃不是自然法则。它是大多数模型构建方式的一种属性。Chroneme 表明,还有另一条路。
半个百分点的差距之所以重要,是因为它把什么从方程里去掉了。大多数临床 AI 在每一个新地点都要重新验证、重新调参,有时还要重新训练。正是这种成本,让好模型停滞不前。如果一个系统能在不同的医院、电子健康记录系统和年代之间保持准确率,部署工作的形态就会改变。监管机构可以只评估一次。医疗体系可以在它之上构建,而不必重建它。临床 AI 的天花板一直是泛化能力。Chroneme 表明,这个天花板是可以移动的。
如果你从事临床 AI,告诉我这在哪里站不住脚。

((Z))