Wem klinische KI dient
Aus dem Englischen übersetzt. Original lesen

Vor einigen Jahren wurde das in amerikanischen Krankenhäusern am weitesten verbreitete Modell zur Sepsis-Vorhersage unabhängig evaluiert. Sepsis entsteht, wenn eine gewöhnliche Infektion den Körper in eine Kettenreaktion stürzt, die beginnt, Organe abzuschalten. Sie kann innerhalb von Stunden töten, oft bevor irgendjemand merkt, wie krank der Patient ist. Das Modell, das sie erkennen sollte, erkannte nur einen von drei echten Fällen und stufte jeden fünften Krankenhauspatienten als Hochrisikofall ein.
Ärzte und Pflegekräfte lernten schnell. Der Alarm schlägt ständig bei Patienten an, deren Zustand sich nicht verschlechtert, und übersieht die meisten, bei denen es so ist. Nach ein paar Wochen vertraut man ihm nicht mehr. Man muss aufhören, ihm zu vertrauen. Der Alarm wird zu Rauschen. Ein System, das angeschafft wurde, um Verschlechterungen zu erkennen, hatte allen beigebracht, Verschlechterungen zu ignorieren.
Das ist das erste Problem: schlechte Mathematik. Keine Entscheidung darüber, wohin das Ergebnis geht, behebt es. Ein kaputtes System lässt sich nicht so verdrahten, dass es Patienten dient. Das Sepsis-Modell ist an der Validierung gescheitert, und nichts, was danach kommt, ändert daran etwas.
Das war 2021. Diesen Monat erschien MIRA in Nature. Es ist ein autonomer medizinischer KI-Agent, der Krankengeschichten liest, Untersuchungen anordnet, Befunde interpretiert und Behandlungspläne schreibt. Bei identischen Fällen erreichte er eine diagnostische Genauigkeit von 87,8 Prozent, gegenüber 78,1 Prozent bei Fachärzten. Er hält sich konsequenter an den Versorgungsstandard als die Ärzte, mit denen er verglichen wurde. So sieht die vorderste Front heute aus.
MIRA hat die Validierung bestanden. Die Mathematik stimmt. Und genau das macht eine andere Frage dringend.
Dasselbe Modell, mit identischen Ergebnissen, dient völlig unterschiedlichen Menschen, abhängig von einer einzigen Entscheidung: wohin die Vorhersage geht.
Erreicht das Ergebnis zuerst einen Arzt, dient es dem Patienten, denn der Arzt kann danach handeln.
Erreicht es zuerst eine Entscheidung über den Versicherungsschutz, dient es dem Versicherer. Hochrisikopatienten werden zur Ablehnung markiert, bevor sie überhaupt krank werden, und der Patient bekommt das Signal nie zu sehen.
Leitet man es an das Bettenmanagement, dient es der Logistik des Krankenhauses und schleust Patienten schneller durch die Betten. Gleiche Genauigkeit, anderer Herr. Der Patient wird irgendwann trotzdem diagnostiziert, aber den Weg des Signals hat das Krankenhaus bestimmt, nicht er.
Das Modell hat sich nie verändert. Die Mathematik ist solide. Wem es dient, hängt allein davon ab, wer entschieden hat, wohin das Signal geht.
Die Frage, die man bei jedem dieser Systeme stellen sollte, lautet also: Wer sieht das Ergebnis, wer handelt danach, und wer zahlt, wenn es falsch ist?
Beim Sepsis-Modell ist diese Frage fast nebensächlich, denn das Modell ist kaputt. Die Kosten landen überall. Bei der Ärztin oder dem Pfleger, die gelernt haben, Alarme auszublenden, beim Krankenhaus, das die Haftung trägt, und unter alledem beim Patienten, dessen Verschlechterung unbemerkt bleibt, während alle ein System ignorieren, das zu oft falschen Alarm geschlagen hat.
Bei MIRA ist die Antwort kein Zufall. Jemand hat entschieden, wohin das Signal geht, und das System so gebaut, dass es dort ankommt.
Und die Antwort muss konkret sein. „Es dient den Patienten“ ist die Art Satz, die richtig klingt und zu nichts verpflichtet. „Es dient dem Bettenmanagement, das ein Ergebnis sieht, das der Patient nie sehen wird“ ist konkret. Wenn Sie die Partei nicht benennen können, haben Sie die Frage nicht wirklich beantwortet.
Wenn Sie in einem Krankenhaus arbeiten, das diese Technologie kauft, müssen Sie sie trotzdem validieren. Klinische Evidenz, Tests auf Verzerrungen, die dokumentierten Fehlermodi. Diese Arbeit ist echte Arbeit, und MIRA hat sie bei acht Diagnosen bestanden, während das Sepsis-Modell sie überhaupt nicht bestehen konnte.
Aber die Validierung sagt Ihnen nur, ob eine KI oder ein Vorhersagemodell funktioniert. Darüber, wem es dient, sagt sie nichts. Ein Modell kann jeden Test bestehen, dem Sie es unterziehen, und trotzdem so verdrahtet sein, dass es der falschen Partei dient. Perfekte Evidenz und schlechte Anreize leben bequem im selben System. Das sind verschiedene Probleme, und wer das erste löst, hat das zweite damit noch nicht berührt.
Man braucht beides. Gute Mathematik und dann eine echte Antwort darauf, wem das System dient. Die meisten Systeme bekommen die Mathematik nie hin. Die meisten, denen es gelingt, stellen die zweite Frage nie.
Allgemeine LLMs ziehen inzwischen direkt in die Krankenhäuser ein. Patienten nutzen ChatGPT, Claude und die anderen, um ihre eigenen Laborwerte zu lesen und zu entscheiden, ob sich ein Arztbesuch lohnt. Krankenhäuser setzen sie ein, ohne je zu entscheiden, wohin das Ergebnis eigentlich gehen soll. Das ist nicht das Beunruhigende.
Das Beunruhigende ist, dass der Patient stillschweigend selbst zum Weichensteller geworden ist. Jemand liest einen Laborwert, fragt einen Chatbot, was er bedeutet, und der ganze Austausch findet außerhalb jedes Krankenhauses statt, ohne jeden Arzt, außerhalb jedes Rahmens, der geschaffen wurde, um ihm gegenüber Rechenschaft abzulegen. Was auch immer diese Antwort prägt, wurde vorher an anderer Stelle entschieden, von dem, der das Modell trainiert und seine Anreize gesetzt hat. Nicht von jemandem, der dem Patienten Rechenschaft schuldet.
Ein Arzt, der einen kaputten Alarm ausblendet, ist ein lokales Versagen, eine schlechte Beschaffungsentscheidung in einem Krankenhaus. Ein Patient, der sich über einen Chatbot für Verbraucher selbst diagnostiziert, ist etwas Größeres: Das klinische Urteil verlässt die Klinik ganz und wandert in Systeme, die niemand in der Medizin kontrolliert. Die Frage ist nicht mehr, wohin das Krankenhaus das Signal schickt. Sie lautet, was Sie nach dem Willen des Unternehmens, das das Modell gebaut hat, wissen sollen.
Nichts davon setzt voraus, dass man versteht, wie ein neuronales Netz funktioniert. Es setzt nur voraus, dass man die Frage stellt. Wem dient das, so konkret benannt, dass man es aufschreiben könnte: die tatsächliche Partei, deren Interessen bestimmt haben, was Sie sehen dürfen. ((Z))