臨床AIは誰のためにあるのか
英語からの翻訳です。 原文を読む

数年前、米国の病院で最も広く導入されていた敗血症予測モデルが、独立した評価を受けました。敗血症とは、ありふれた感染症をきっかけに体が連鎖反応に陥り、臓器が機能を失い始める状態です。命を奪うまで、わずか数時間のこともあり、多くの場合、患者がどれほど重篤なのか誰も気づかないうちに進みます。これを捉えるために作られたモデルは、実際の症例の3件に1件しか捉えられず、しかも入院患者の5人に1人を高リスクとして警告していました。
臨床医はすぐに学びました。アラートは悪化していない患者に絶えず鳴り、悪化している患者の大半を見逃します。数週間もすれば、信用しなくなります。信用するのをやめざるをえないのです。アラートは雑音になります。悪化を捉えるために購入されたシステムが、悪化を無視するよう全員を訓練してしまったのです。
これが第一の問題、計算の誤りです。出力をどこへ振り分けても、これは直りません。壊れたシステムを、患者のために働くようにつなぎ直すことはできないのです。敗血症モデルは検証の段階で失敗しており、その先で何をしても、それは変わりません。
それが2021年のことです。今月、MIRAがNatureに掲載されました。患者の病歴を読み、検査をオーダーし、結果を解釈し、治療計画を書く、自律型の医療AIエージェントです。同一の症例で、診断精度は87.8%に達し、専門医資格を持つ医師の78.1%を上回りました。比較対象となった医師たちよりも、一貫して標準治療に従います。これが、現在の最前線の姿です。
MIRAは検証に合格しました。計算は合っています。だからこそ、別の問いが差し迫ったものになります。
同じモデルが、まったく同じ出力のままで、ある一つの選択次第で、まったく別の人々のために働くことになります。予測がどこへ送られるか、です。
出力が最初に臨床医に届けば、それは患者のために働きます。臨床医がそれに基づいて行動できるからです。
最初に保険の適用判断に届けば、保険会社のために働きます。高リスクの患者は、病気になるより前に支払い拒否の対象として目をつけられ、患者本人はそのシグナルを目にすることすらありません。
病床管理に回せば、病院の物流のために働き、病床の回転を速めます。精度は同じで、仕える主人が違うだけです。患者もいずれは診断されますが、振り分けを決めたのは病院であって、患者ではありません。
モデルは一度も変わっていません。計算に問題はありません。誰のために働くかは、シグナルの行き先を誰が決めたかに尽きます。
だから、こうしたシステムのどれについても問うべきなのは、誰が出力を見て、誰がそれに基づいて動き、それが間違っていたときに誰が代償を払うのか、ということです。
敗血症モデルの場合、この問いはほとんど的外れです。モデルが壊れているからです。代償はあらゆるところに降りかかります。アラームを聞き流すことを覚えた医師や看護師、責任を負う病院、そしてそのすべての下には患者がいます。すっかりオオカミ少年になったシステムを誰もが無視するあいだに、その患者の悪化は見過ごされていくのです。
MIRAの場合、その答えは偶然ではありません。誰かがシグナルの行き先を決め、そこへ送るようにシステムを作ったのです。
そして、その答えは具体的でなければなりません。「患者のために働く」というのは、正しく聞こえて、何も約束しない類いの言葉です。「病床管理チームのために働く。彼らは、患者が決して目にすることのない出力を見ている」なら、具体的です。相手を名指しできないなら、実は答えていないのです。
このテクノロジーを購入する病院で働いているなら、それでも検証は必要です。臨床エビデンス、バイアスの検証、文書化された失敗モード。その作業には確かな意味があり、MIRAは8つの診断にわたってそれをクリアしました。敗血症モデルがまったくクリアできなかったものです。
しかし検証が教えてくれるのは、AIや予測モデルが機能するかどうかだけです。誰のために働くのかについては、何も教えてくれません。モデルは、どんなテストを課しても合格し、それでいて間違った相手のために働くようにつながれていることがあります。完璧なエビデンスと悪いインセンティブは、同じシステムの中で平然と同居します。両者は別の問題であり、一つ目に合格しても、二つ目にはまったく触れていないのです。
両方が必要です。正しい計算、そのうえで、誰のために働くのかへの本当の答え。大半のシステムは、計算を正しくすることすらできません。それができたシステムの大半も、二つ目の問いを立てることはありません。
汎用LLMが今、病院へまっすぐ入り込もうとしています。患者はChatGPTやClaudeなどを使って、自分の検査結果を読み、受診すべきかどうかを決めています。病院は、出力がどこへ行くべきかを一度も決めないまま、それらを導入しています。ただ、不穏なのはそこではありません。
不穏なのは、患者がいつのまにか振り分け役になっていることです。誰かが検査値を読み、チャットボットにその意味を尋ねる。そのやりとりは丸ごと、どの病院も、どの臨床医も、その人に対して責任を負うために作られたどの枠組みも関わらないところで起きています。その答えを形づくるものは、上流で決められています。モデルを訓練し、そのインセンティブを設定した誰かによって。患者に対して責任を負う誰かによってではありません。
壊れたアラームを聞き流す臨床医は、局所的な失敗です。一つの病院の、一つのまずい調達判断にすぎません。消費者向けのチャットボットで自己診断する患者は、もっと大きな何かです。臨床判断が診療の場を完全に離れ、医療界の誰も制御できないシステムへ移っていくということです。問題はもはや、病院がシグナルをどこへ送るかではありません。モデルを作った企業が、あなたが何を知るべきだと決めたか、なのです。
これを理解するのに、ニューラルネットワークの仕組みを知る必要はありません。必要なのは、問いを立てることだけです。これは誰のために働くのか。それを、書き留められるほど具体的に名指しすることです。あなたが見てよいものを、自らの利害で形づくった、実在の当事者を。 ((Z))