ZohaibAkhtar

予想外の発見(Chroneme)

英語からの翻訳です。 原文を読む

今週、予想外の発見がありました。臨床AIモデルの多くは、2つ目の病院にたどり着く前に行き詰まります。Epicの敗血症モデルはその典型例です。米国で最も広く導入されている臨床AIツールの一つで、数百の病院で稼働しています。売り文句は、患者が敗血症を発症する数時間前に医師に警告できる、というものです。

2021年、ミシガンのチームがこれを独自に検証し、その結果をJAMA Internal Medicineに発表しました。モデルが捉えた敗血症症例は3分の1にとどまり、入院のおよそ5件に1件を警告対象とし、精度はEpicが報告していた値より13から20ポイント低いものでした。

これは珍しいことではありません。この現象には名前があります。データベース間崩壊です。モデルはある施設がどのようにデータを記録するかを学習し、別の施設のデータを見た瞬間に強みを失います。

私はChronemeを、別の前提の上に作りました。病院がどう記録するかではなく、体が時間とともに実際にどう変化するかを読むシステムなら、病院から病院へと移っていけるはずだ、という前提です。そして、一つの病態に限られるべきでもありません。Epicは敗血症を予測します。Chronemeは軌跡を読むので、同じエンジンが、昇圧薬、挿管、透析を必要とするほど重い悪化であれば、何でも検知します。

私はこれを、完全に独立した二つの大規模なICUデータベースで検証しました。異なる病院、異なる電子カルテ、異なる年代。結果の差は半ポイント未満でした。これほど緊密なデータベース間の一致は、臨床AIでは稀です。とりわけ、あらゆる介入の前に測定する複合アウトカムではなおさらです。崩壊は自然法則ではありません。ほとんどのモデルの作り方から生じる性質です。Chronemeは、別のやり方があることを示唆しています。

半ポイントの差が重要なのは、それが方程式から何を取り除くかにあります。臨床AIの多くは、新しい施設のたびに再検証、再調整、ときには再訓練をしなければなりません。そのコストこそが、良いモデルが行き詰まる理由です。システムが病院、電子カルテ、年代をまたいで精度を保つなら、導入という仕事そのものの形が変わります。規制当局は一度評価すればよくなります。医療機関は、作り直すことなくその上に構築できます。臨床AIの天井は、これまでずっと汎化でした。Chronemeは、その天井が動くことを示唆しています。

臨床AIに携わっているなら、これがどこで破綻するのか教えてください。

((Z))