Отказ от сложной архитектуры в пользу простоты
Большинство современных систем клинического прогнозирования полагаются на сложные архитектуры слияния (fusion), где для каждого типа данных (текст, лабораторные показатели, жизненные показатели) используются отдельные энкодеры, а их результаты объединяются через обучаемые механизмы. Это требует перенастройки под каждую новую задачу. Авторы исследования предлагают радикально более простое решение: конвертировать все данные пациента — от свободных текстовых заметок врачей до структурированных лабораторных значений — в единую последовательность естественного языка и дообучать одну большую языковую модель (LLM) end-to-end без модификации архитектуры.
Масштабное тестирование на трех клинических задачах
Подход был протестирован на трех различных клинических сценариях, что подтверждает его универсальность:
- Прогноз внутрибольничной смертности на датасете MIMIC-III.
- Прогноз отторжения трансплантата с использованием лонгитюдных данных из немецкого трансплантационного центра.
- Классификация экстренного триажирования на основе записей скорой помощи.
В качестве базовых моделей для дообучения использовались как энкодерные (ModernBERT), так и декодерные архитектуры (Llama 3.1, Gemma, DeepSeek-R1-Qwen, Qwen3). Результаты сравнивались с established мультимодальными бенчмарками.
Победитель: LLM против клинического стандарта
Ключевой вывод исследования заключается в том, что унифицированный текстовый подход не просто сопоставим со специализированными мультимодальными моделями, но и превосходит их в ряде случаев. Особенно показателен результат на задаче прогноза отторжения трансплантата: текстовая сериализация LLM превзошла градиентный бустинг (gradient boosting), который в данный момент используется в клинической практике для управления состоянием пациентов после трансплантации.
Сравнительные результаты
Ниже приведена сводка по эффективности подхода унифицированной текстовой сериализации (Unified Textual Serialization) по сравнению с альтернативами:
| Клиническая задача | Сравнение | Результат |
|---|---|---|
| Прогноз отторжения трансплантата | LLM (текстовая сериализация) vs. Градиентный бустинг (клинический стандарт) | LLM превосходит градиентный бустинг |
| Прогноз отторжения трансплантата | LLM vs. Специализированные мультимодальные базовые модели | LLM сопоставим или превосходит |
| Прогноз внутрибольничной смертности | LLM (ModernBERT, Llama 3.1 и др.) vs. Мультимодальные базовые модели | Сопоставимо или превосходит |
| Экстренное триажирование | LLM vs. Мультимодальные базовые модели | Сопоставимо или превосходит |
Почему это важно для индустрии
Результаты исследования указывают на то, что парадигма унифицированной сериализации достаточна для мультимодального клинического прогнозирования. Это позволяет существенно снизить сложность систем, отказавшись от разработки bespoke-архитектур для каждого нового медицинского кейса. Вместо этого достаточно иметь одну хорошо дообученную LLM, способную работать с разнородными данными как с единым контекстом.
Источник: arXiv cs.CL ↗
