Исследования2 октября 2026 г., 01:17 МСК🤖 Auto

LLM как предикторы выживаемости: GPT-5.6 против RSF в онкологии

Исследование arXiv:2609.38181 показало, что крупные языковые модели способны оценивать время выживания пациентов с точностью, сопоставимой со специализированными статистическими моделями, но с серьезными ограничениями в дискриминации рисков.

Баннер новости 8732

Суть открытия: LLM как «приблизительные оценщики выживаемости»

Команда исследователей во главе с Хуаном Мануэлем Замбрано Чавесом представила фреймворк Survprompt, который преобразует структурированные ковариаты пациента (анализы, диагнозы, возраст) в текстовые клинические сценарии. Эти сценарии подаются на вход предварительно обученным LLM в режиме zero-shot (без дообучения) для прогнозирования времени до наступления события (смерти или рецидива). Это первый строгий бенчмарк, сравнивающий «голые» LLM с традиционными методами анализа выживаемости.

Методология и данные

Оценка проводилась на двух мультиинституциональных пан-раковых когортах:

  • MSK-CHORD — публичный набор данных из Memorial Sloan Kettering Cancer Center.
  • Providence St. Joseph Health Network — новый набор данных, собранный с помощью LLM-based medical abstraction framework.

В качестве базовой линии (baseline) использовались Random Survival Forests (RSF) — специализированные модели, обученные именно для задач выживаемости. Метрики: cMAE (censored Mean Absolute Error — средняя абсолютная ошибка с учетом цензурирования) и c-index (конкордантность, способность различать пациентов с разным риском).

Ключевые результаты: точность против дискриминации

Результаты выявили парадоксальную ситуацию: LLM демонстрируют высокую точность в предсказании конкретного времени выживания, но плохо справляются с ранжированием пациентов по риску. Модель GPT-5.6-Sol показала cMAE в пределах 10% от лучших RSF-моделей для ряда видов рака и превзошла их при раке простаты в когорте MSK-CHORD.

Метрика / Модель RSF (Специализированная) LLM (GPT-5.6-Sol / Zero-shot) Вывод
cMAE (Точность времени) Высокая (Baseline) Сопоставимая (±10%) или лучше (рак простаты) LLM умеют «угадывать» срок выживания почти так же хорошо, как узкоспециализированные алгоритмы.
c-index (Дискриминация риска) Высокая Низкая / Непоследовательная LLM плохо различают группы высокого и низкого риска, что критично для клинических решений.
Абляция признаков Строгая статистика Приоритизируют те же клинические переменные LLM фокусируются на релевантных медицинских факторах, аналогично RSF.

Почему это важно для индустрии и медицины

Результаты подтверждают гипотезу, что LLM обладают внутренним «медицинским знанием», достаточным для приблизительной оценки прогнозов без дообучения на медицинских данных. Однако нестабильность результатов между разными типами рака и медицинскими учреждениями делает их использование в чистом виде опасным для клинической практики. LLM могут служить мощным инструментом предварительной оценки или «второго мнения», но не заменой валидированных статистических моделей при принятии решений о лечении.

Источник: arXiv cs.CL ↗