Суть открытия: LLM как «приблизительные оценщики выживаемости»
Команда исследователей во главе с Хуаном Мануэлем Замбрано Чавесом представила фреймворк Survprompt, который преобразует структурированные ковариаты пациента (анализы, диагнозы, возраст) в текстовые клинические сценарии. Эти сценарии подаются на вход предварительно обученным LLM в режиме zero-shot (без дообучения) для прогнозирования времени до наступления события (смерти или рецидива). Это первый строгий бенчмарк, сравнивающий «голые» LLM с традиционными методами анализа выживаемости.
Методология и данные
Оценка проводилась на двух мультиинституциональных пан-раковых когортах:
- MSK-CHORD — публичный набор данных из Memorial Sloan Kettering Cancer Center.
- Providence St. Joseph Health Network — новый набор данных, собранный с помощью LLM-based medical abstraction framework.
В качестве базовой линии (baseline) использовались Random Survival Forests (RSF) — специализированные модели, обученные именно для задач выживаемости. Метрики: cMAE (censored Mean Absolute Error — средняя абсолютная ошибка с учетом цензурирования) и c-index (конкордантность, способность различать пациентов с разным риском).
Ключевые результаты: точность против дискриминации
Результаты выявили парадоксальную ситуацию: LLM демонстрируют высокую точность в предсказании конкретного времени выживания, но плохо справляются с ранжированием пациентов по риску. Модель GPT-5.6-Sol показала cMAE в пределах 10% от лучших RSF-моделей для ряда видов рака и превзошла их при раке простаты в когорте MSK-CHORD.
| Метрика / Модель | RSF (Специализированная) | LLM (GPT-5.6-Sol / Zero-shot) | Вывод |
|---|---|---|---|
| cMAE (Точность времени) | Высокая (Baseline) | Сопоставимая (±10%) или лучше (рак простаты) | LLM умеют «угадывать» срок выживания почти так же хорошо, как узкоспециализированные алгоритмы. |
| c-index (Дискриминация риска) | Высокая | Низкая / Непоследовательная | LLM плохо различают группы высокого и низкого риска, что критично для клинических решений. |
| Абляция признаков | Строгая статистика | Приоритизируют те же клинические переменные | LLM фокусируются на релевантных медицинских факторах, аналогично RSF. |
Почему это важно для индустрии и медицины
Результаты подтверждают гипотезу, что LLM обладают внутренним «медицинским знанием», достаточным для приблизительной оценки прогнозов без дообучения на медицинских данных. Однако нестабильность результатов между разными типами рака и медицинскими учреждениями делает их использование в чистом виде опасным для клинической практики. LLM могут служить мощным инструментом предварительной оценки или «второго мнения», но не заменой валидированных статистических моделей при принятии решений о лечении.
Источник: arXiv cs.CL ↗
