意外的發現(Chroneme)
譯自英文。 閱讀原文

這週有一些意外的發現。多數臨床 AI 模型還沒走到第二家醫院就停滯了。Epic 的敗血症模型就是教科書級的案例。它是美國部署最廣的臨床 AI 工具之一,在數百家醫院運作。它的賣點是能在病人發生敗血症的幾小時前,就向醫師發出警示。
2021年,密西根的一個團隊獨立測試了它,並把結果發表在 JAMA Internal Medicine。這個模型只抓到三分之一的敗血症病例,對大約五分之一的住院發出了警示,而且準確度比 Epic 自己公布的數字低了13到20個點。
這並不罕見。這個現象有個名字:跨資料庫崩潰。一個模型學會的是某一家院所如何記錄資料,一看到另一家的資料,就失去了優勢。
我打造 Chroneme,是基於一個不同的前提。一套系統如果讀的是身體實際上如何隨時間變化,而不是醫院如何記錄它,就應該能在不同醫院之間通用。而且它不應該只局限於一種疾病。Epic 預測敗血症。Chroneme 讀的是軌跡,所以同一個引擎能標記出任何嚴重到需要升壓劑、插管或透析的惡化。
我在兩個大型、完全獨立的加護病房資料庫上測試它。不同的醫院、不同的電子病歷系統、不同的年代。結果相差不到半個點。在臨床 AI 中,這麼接近的跨資料庫一致性相當罕見,尤其是針對一個在任何介入之前就測量的複合結果。這種崩潰不是自然法則。它是大多數模型建構方式的一種特性。Chroneme 的結果暗示,還有另一條路。
半個點的差距之所以重要,在於它從等式中拿掉了什麼。大多數臨床 AI 都必須在每一個新院所重新驗證、重新調校,有時甚至重新訓練。這個成本,正是好模型停滯的原因。如果一套系統能在不同醫院、不同電子病歷、不同年代之間維持準確度,部署的工作就會改變形狀。主管機關可以只評估一次。醫療體系可以在它之上建構,而不必重建它。臨床 AI 的天花板一直都是泛化能力。Chroneme 的結果暗示,這個天花板是可以移動的。
如果你在臨床 AI 領域工作,告訴我這套說法會在哪裡站不住腳。

((Z))