Новый подход к прогнозированию ухудшения состояния
Клиническое ухудшение пациента — это не единичный диагноз, а сложный процесс, описываемый множеством частично наблюдаемых показателей. Команда исследователей во главе с Вэйчжи Нием (Weizhi Nie) представила архитектуру PGP-Clinical-TimeKAN. Это фреймворк, ориентированный на траектории, который объединяет временные энкодеры, учитывающие пропуски в данных, и «мягкие» априорные знания о системах органов.
Ключевая инновация — использование нелинейных сообщений Колмогорова-Арнольда (Kolmogorov-Arnold messages) и многомерной Student-t головы с низким рангом. Это позволяет модели учитывать не только средние значения, но и корреляции между показателями разных органов.
Результаты на когорте MIMIC-IV
Модель была протестирована на замороженной выборке из 6 882 пациентов и 54 694 временных окон (история 24 часа, прогноз на 6 часов вперед). Эксперименты проводились с 5 разными случайными семенами. PGP-Clinical-TimeKAN показал выдающиеся результаты по метрикам ошибки, особенно в вероятностном прогнозировании.
| Метрика | PGP-Clinical-TimeKAN | Примечание |
|---|---|---|
| Normalized MAE | 0.37727 ± 0.00029 | 2-й лучший результат среди 13 моделей |
| RMSE | 0.52656 ± 0.00034 | Лучший результат (lowest) |
| Улучшение MAE | +0.52% | По сравнению с детерминированным TimeKAN |
| Маргинальный NLL | 0.66380 | Для вероятностного прогнозирования |
| CRPS | 0.27301 | Continuous Ranked Probability Score |
Анализ калибровки и ограничений
Модель демонстрирует высокую степень калибровки доверительных интервалов. Эмпирическое покрытие для номинальных интервалов 50%, 80% и 95% составило соответственно 0.533, 0.831 и 0.958. Это означает, что модель точно оценивает свою неопределенность.
Абляционные исследования показали, что удаление реляционной структуры (учета связей между пациентами) приводит к наибольшей потере качества. Однако авторы отмечают важный клинический нюанс: хотя модель отлично прогнозирует физиологические траектории, риск-скор, полученный из этих траекторий, уступает специализированному классификатору GRU-D в обнаружении событий (AUROC 0.603 против 0.650). Это доказывает, что точный прогноз физиологии сам по себе не гарантирует калиброванного детектора критических событий.
Источник: arXiv cs.AI ↗
