Untuk siapa AI klinis bekerja
Diterjemahkan dari bahasa Inggris. Baca versi aslinya

Beberapa tahun lalu, model prediksi sepsis yang paling luas digunakan di rumah sakit Amerika dievaluasi secara independen. Sepsis terjadi ketika infeksi biasa mendorong tubuh ke dalam reaksi berantai yang mulai melumpuhkan organ. Sepsis dapat membunuh dalam hitungan jam, sering kali sebelum ada yang menyadari betapa parah kondisi pasien. Model yang dibuat untuk mendeteksinya hanya menangkap satu dari tiga kasus yang sebenarnya, dan menandai satu dari setiap lima pasien rawat inap sebagai berisiko tinggi.
Para klinisi cepat belajar. Peringatan itu terus berbunyi pada pasien yang kondisinya tidak memburuk, dan melewatkan sebagian besar pasien yang memburuk. Setelah beberapa minggu, Anda berhenti memercayainya. Anda memang harus berhenti memercayainya. Peringatan itu menjadi sekadar bising. Sistem yang dibeli untuk mendeteksi perburukan justru melatih semua orang untuk mengabaikan perburukan.
Inilah masalah pertama: matematika yang buruk. Keputusan soal ke mana hasilnya dikirim tidak bisa memperbaikinya. Anda tidak bisa menyambungkan sistem yang rusak agar melayani pasien. Model sepsis itu gagal dalam validasi, dan tidak ada apa pun di hilir yang bisa mengubahnya.
Itu tahun 2021. Bulan ini MIRA terbit di Nature. MIRA adalah agen AI medis otonom yang membaca riwayat pasien, meminta pemeriksaan, menafsirkan hasil, dan menyusun rencana pengobatan. Pada kasus yang identik, akurasi diagnostiknya mencapai 87,8%, dibandingkan 78,1% pada dokter spesialis bersertifikat. MIRA mengikuti standar perawatan secara lebih konsisten daripada para dokter yang menjadi pembandingnya. Seperti inilah wujud garis depan saat ini.
MIRA lolos validasi. Matematikanya berfungsi. Justru karena itu, muncul pertanyaan lain yang mendesak.
Model yang sama, dengan keluaran yang identik, melayani orang yang sama sekali berbeda tergantung pada satu pilihan: ke mana prediksi itu dikirim.
Jika keluarannya sampai lebih dulu ke klinisi, model itu melayani pasien, karena klinisi bisa bertindak berdasarkan keluaran itu.
Jika keluarannya sampai lebih dulu ke keputusan pertanggungan, model itu melayani perusahaan asuransi. Pasien berisiko tinggi ditandai untuk ditolak bahkan sebelum mereka jatuh sakit, dan pasien itu sama sekali tidak pernah melihat sinyal tersebut.
Arahkan ke manajemen tempat tidur, dan model itu melayani logistik rumah sakit, mempercepat perputaran pasien di tempat tidur. Akurasinya sama, tuannya berbeda. Pasien tetap terdiagnosis pada akhirnya, tetapi rumah sakitlah yang memutuskan ke mana sinyal itu dikirim, bukan pasien.
Modelnya tidak pernah berubah. Matematikanya benar. Siapa yang dilayaninya bergantung pada siapa yang memutuskan ke mana sinyal itu pergi.
Jadi, pertanyaan yang layak diajukan tentang sistem mana pun seperti ini adalah siapa yang melihat keluarannya, siapa yang bertindak berdasarkan keluaran itu, dan siapa yang menanggung akibatnya ketika keluaran itu salah.
Untuk model sepsis, pertanyaan itu nyaris tidak relevan, karena modelnya rusak. Kerugiannya jatuh ke mana-mana. Dokter atau perawat yang terbiasa tidak menggubris alarm, rumah sakit yang menanggung risiko hukum, dan di bawah semua itu, pasien, yang perburukannya luput dari perhatian sementara semua orang mengabaikan sistem yang sudah terlalu sering membunyikan alarm palsu.
Untuk MIRA, jawabannya bukan kebetulan. Seseorang memutuskan ke mana sinyal itu pergi dan membangun sistemnya untuk mengirimnya ke sana.
Dan jawabannya harus spesifik. “Sistem ini melayani pasien” adalah jenis kalimat yang terdengar benar tetapi tidak menjanjikan apa pun. “Sistem ini melayani tim manajemen tempat tidur, yang melihat keluaran yang tidak akan pernah dilihat pasien” itu spesifik. Jika Anda tidak bisa menyebut pihaknya, Anda sebenarnya belum menjawab.
Jika Anda bekerja di rumah sakit yang membeli teknologi ini, Anda tetap harus memvalidasinya. Bukti klinis, uji bias, mode kegagalan yang terdokumentasi. Pekerjaan itu nyata, dan MIRA lolos di delapan diagnosis, sementara model sepsis sama sekali tidak bisa lolos.
Namun validasi hanya memberi tahu Anda apakah sebuah AI atau model prediksi bekerja. Validasi tidak memberi tahu apa pun tentang siapa yang dilayaninya. Sebuah model bisa lolos dari setiap uji yang Anda berikan dan tetap dirangkai untuk melayani pihak yang salah. Bukti yang sempurna dan insentif yang buruk bisa hidup berdampingan dengan nyaman dalam sistem yang sama. Keduanya masalah yang berbeda, dan lolos dari yang pertama sama sekali tidak menyentuh yang kedua.
Anda butuh keduanya. Matematika yang baik, lalu jawaban yang sungguh-sungguh tentang siapa yang dilayaninya. Sebagian besar sistem tidak pernah berhasil membereskan matematikanya. Sebagian besar dari yang berhasil tidak pernah mengajukan pertanyaan kedua.
LLM umum kini masuk langsung ke rumah sakit. Pasien memakai ChatGPT, Claude, dan sejenisnya untuk membaca hasil laboratorium mereka sendiri dan memutuskan apakah suatu keluhan perlu diperiksakan. Rumah sakit menerapkannya tanpa pernah memutuskan ke mana keluarannya seharusnya pergi. Bukan itu bagian yang meresahkan.
Bagian yang meresahkan adalah bahwa pasien diam-diam telah menjadi penentu arahnya sendiri. Seseorang membaca sebuah nilai laboratorium, bertanya kepada chatbot apa artinya, dan seluruh percakapan itu terjadi di luar rumah sakit mana pun, di luar klinisi mana pun, di luar kerangka apa pun yang dibangun agar bertanggung jawab kepada mereka. Apa pun yang membentuk jawaban itu sudah diputuskan di hulu, oleh siapa pun yang melatih modelnya dan menetapkan insentifnya. Bukan oleh seseorang yang bertanggung jawab kepada pasien.
Klinisi yang tidak lagi menggubris alarm yang rusak adalah kegagalan lokal, satu keputusan pengadaan yang buruk di satu rumah sakit. Pasien yang mendiagnosis dirinya sendiri lewat chatbot konsumen adalah sesuatu yang lebih besar: penilaian klinis meninggalkan klinik sepenuhnya, berpindah ke sistem yang tidak dikendalikan siapa pun di dunia kedokteran. Pertanyaannya bukan lagi ke mana rumah sakit mengirim sinyal. Pertanyaannya adalah apa yang diputuskan oleh perusahaan pembuat model itu untuk Anda ketahui.
Semua ini tidak menuntut pemahaman tentang cara kerja jaringan saraf. Yang dibutuhkan hanyalah mengajukan pertanyaannya. Untuk siapa sistem ini bekerja, disebutkan cukup spesifik sehingga Anda bisa menuliskannya: pihak nyata yang kepentingannya membentuk apa yang boleh Anda lihat. ((Z))