ZohaibAkhtar

文章

分享

臨床 AI 為誰服務

譯自英文。 閱讀原文

幾年前,美國醫院中部署最廣的敗血症預測模型接受了獨立評估。敗血症是一般的感染讓身體陷入連鎖反應,器官開始逐一衰竭的狀況。它可能在幾小時內致命,往往在還沒有人察覺病人病得有多重之前。這個為了抓出敗血症而打造的模型,只抓到三分之一的真實病例,卻把五分之一的住院病人都標記為高風險。

臨床人員很快就學乖了。警示不斷在沒有惡化的病人身上響起,卻漏掉大多數正在惡化的人。幾週之後,你就不再相信它。你不得不停止相信它。警示變成了噪音。一套買來偵測病情惡化的系統,反倒訓練所有人對病情惡化視而不見。

這是第一個問題:數學錯了。不管把它的結果送到哪裡,都修不好它。你無法把一套壞掉的系統接上線,讓它為病人服務。這個敗血症模型在驗證階段就失敗了,下游的任何安排都改變不了這一點。

那是2021年。這個月,MIRA 登上了 Nature。它是一個自主運作的醫療 AI 代理,能閱讀病人病史、開立檢查、判讀結果,並擬定治療計畫。在相同的病例上,它的診斷正確率達到87.8%,具專科醫師資格的醫師則是78.1%。比起拿來與它比較的那些醫師,它更一致地遵循照護標準。這就是目前最前沿的樣貌。

MIRA 通過了驗證。數學站得住。這反而讓另一個問題變得急迫。

同一個模型、完全相同的輸出,服務的對象卻可能截然不同,全看一個選擇:預測被送到哪裡。

如果輸出先到臨床醫師手上,它服務的是病人,因為臨床醫師能據此採取行動。

如果它先送到承保決策那裡,它服務的是保險公司。高風險病人還沒生病,就先被標記為拒保對象,而病人自始至終都看不到這個訊號。

把它送到病床管理,它服務的就是醫院的營運調度,讓病人更快周轉病床。正確率一樣,主人不同。病人最後還是會得到診斷,但決定訊號去向的是醫院,不是病人。

模型從來沒變。數學沒有問題。它服務誰,取決於誰決定了訊號送往哪裡。

所以,對任何一套這類系統,真正值得問的是:誰看到輸出、誰據此行動、出錯時誰來買單。

對那個敗血症模型來說,這個問題幾乎無關緊要,因為模型本身就是壞的。代價落在每個地方。學會對警報充耳不聞的醫師或護理師、承擔法律責任的醫院,而在這一切底下的是病人:當所有人都在忽略一套喊了太多次「狼來了」的系統,他的病情惡化就沒有人注意到。

對 MIRA 來說,答案不是偶然。有人決定了訊號要送往哪裡,並把系統打造成會送到那裡。

而且答案必須具體。「它服務病人」這種話聽起來沒錯,卻什麼也沒承諾。「它服務病床管理團隊,他們看到的輸出,病人永遠看不到」才叫具體。如果你說不出是哪一方,你其實還沒有回答。

如果你在一家要採購這項技術的醫院工作,你仍然必須驗證它。臨床證據、偏誤測試、有紀錄可查的失效模式。這些工作是實實在在的,MIRA 在八種診斷上都過關了,而那個敗血症模型完全過不了。

但驗證只能告訴你,一個 AI 或預測模型有沒有用。它完全無法告訴你,它為誰服務。一個模型可以通過你丟給它的每一項測試,卻仍然被接成替錯誤的一方服務。完美的證據和糟糕的誘因,可以在同一套系統裡相安無事。這是兩個不同的問題,通過了第一個,絲毫碰不到第二個。

兩者缺一不可。數學要對,然後要真正回答它為誰服務。大多數系統連數學都做不對。做對的那些,大多從來沒問過第二個問題。

通用的大型語言模型如今正直接走進醫院。病人用 ChatGPT、Claude 和其他工具解讀自己的檢驗報告,決定某個狀況值不值得去看醫生。醫院在部署它們時,從來沒決定過輸出應該送往哪裡。這還不是令人不安的地方。

令人不安的是,病人已經悄悄成了決定訊號去向的人。有人看到一項檢驗數值,問聊天機器人那是什麼意思,整個過程都發生在任何醫院、任何臨床醫師、任何為了對他們負責而建立的體制之外。塑造那個答案的一切,都在上游就決定好了,由訓練模型、設定其誘因的人決定。而不是由任何需要對病人負責的人。

臨床醫師對一個壞掉的警報充耳不聞,是局部的失敗,是一家醫院裡一次糟糕的採購決定。病人透過消費級聊天機器人自我診斷,則是更大的事:臨床判斷整個離開了診間,移進醫學界沒有人掌控的系統裡。問題不再是醫院把訊號送到哪裡,而是打造模型的公司決定了你應該知道什麼。

這一切都不需要你懂神經網路怎麼運作。只需要你問出這個問題。它為誰服務,具體到你能把答案寫下來:真正的那一方,是他們的利益決定了你被允許看到什麼。 ((Z))