Résultats inattendus (Chroneme)
Traduit de l'anglais. Lire l'original

Des résultats inattendus cette semaine. La plupart des modèles d'IA clinique s'enlisent avant d'atteindre un deuxième hôpital. Le modèle de sepsis d'Epic en est l'exemple type. C'est l'un des outils d'IA clinique les plus déployés aux États-Unis, utilisé dans des centaines d'hôpitaux. Il est vendu comme un moyen d'avertir les médecins des heures avant qu'un patient ne développe un sepsis.
En 2021, une équipe du Michigan l'a testé de façon indépendante et a publié les résultats dans JAMA Internal Medicine. Le modèle n'a détecté qu'un tiers des cas de sepsis, a signalé environ un séjour hospitalier sur cinq, et a perdu 13 à 20 points de précision par rapport à ce qu'Epic avait annoncé.
Ce n'est pas inhabituel. Le phénomène a un nom : l'effondrement inter-bases. Un modèle apprend la façon dont un site enregistre ses données et perd son avantage dès qu'il en voit un autre.
J'ai construit Chroneme sur une autre prémisse. Un système qui lit la façon dont un corps change réellement au fil du temps, plutôt que la façon dont un hôpital le documente, devrait pouvoir voyager d'un hôpital à l'autre. Et il ne devrait pas se limiter à une seule pathologie. Epic prédit le sepsis. Chroneme lit des trajectoires, si bien que le même moteur signale toute dégradation assez grave pour nécessiter des vasopresseurs, une intubation ou une dialyse.
Je l'ai testé sur deux immenses bases de données de réanimation, totalement indépendantes. Des hôpitaux différents, des dossiers informatisés différents, une décennie différente. Les résultats sont tombés à moins d'un demi-point d'écart. Une parité aussi serrée entre bases de données est rare en IA clinique, surtout pour un critère composite mesuré avant toute intervention. L'effondrement n'est pas une loi de la nature. C'est une conséquence de la façon dont la plupart des modèles sont construits. Chroneme suggère qu'il existe une autre voie.
Un écart d'un demi-point compte à cause de ce qu'il retire de l'équation. La plupart des IA cliniques doivent être revalidées, réajustées, parfois réentraînées sur chaque nouveau site. Ce coût explique pourquoi les bons modèles s'enlisent. Si un système garde sa précision d'un hôpital, d'un dossier informatisé et d'une décennie à l'autre, le travail de déploiement change de forme. Les régulateurs peuvent l'évaluer une seule fois. Les systèmes de santé peuvent bâtir dessus sans avoir à le reconstruire. Le plafond de l'IA clinique a toujours été la généralisation. Chroneme suggère que ce plafond se déplace.
Si vous travaillez dans l'IA clinique, dites-moi où ça casse.

((Z))