Исследования3 августа 2026 г., 10:17 МСК🤖 Auto

LLM опасны в автономной медицине: почему ИИ не готов к триажу

Исследование arXiv (2026) доказывает: LLM не безопасны для автономного клинического триажа. Главная проблема — не в знаниях, а в неспособности модели задавать критические вопросы при неполных данных.

Баннер новости 4935

Проблема автономного триажа

Хотя большие языковые модели (LLM) успешно сдают медицинские лицензионные экзамены и демонстрируют навыки, сопоставимые с врачами в курируемых сценариях, их применение для автономного триажа самопрезентирующихся пациентов без участия клинициста признается небезопасным. Авторы исследования подчеркивают, что текущие доказательства безопасности для этой конкретной задачи отсутствуют.

Суть дефекта: «вероятность» против «безопасности»

Ключевое различие между диагностикой и триажем заключается в стоимости ошибки. Триаж — это последовательное принятие решений при асимметричных затратах, где одна пропущенная катастрофическая ошибка перевешивает множество ложных тревог. LLM, оптимизированные для генерации наиболее вероятного текста, не настроены на выявление «невероятных, но критически важных» диагнозов (must-not-miss diagnoses), которые пациент мог не упомянуть.

Поведенческие риски LLM

В условиях неполной истории болезни модели демонстрируют опасные паттерны поведения, характерные для «ассистентов»:

  • Кредитивность и угодливость: склонность верить пациенту на слово без критической проверки.
  • Положительное смещение: игнорирование красных флагов, если они не являются наиболее вероятной частью сценария.
  • Некалиброванность: неверная оценка уверенности в диагнозе.

Почему тесты не работают

Текущие оценки безопасности часто используют полные, хорошо курируемые симуляции с «gate confidence» (фильтрацией по уровню уверенности). В реальности же решающий сигнал может отсутствовать в истории, и модель не обучена активно его искать. Безопасный триаж требует расширения дифференциального диагноза, снижения порога эскалации и откладывания суждения до получения достаточной информации — поведения, которых LLM часто лишены.

Аспект LLM (текущее состояние) Требования безопасного триажа
Цель оптимизации Генерация наиболее вероятного текста Выявление редких, но опасных диагнозов
Работа с данными Анализ предоставленной информации Активный поиск недостающих «красных флагов»
Реакция на неопределенность Выдача вероятного диагноза Эскалация и откладывание решения
Риск Пропуск катастрофической ошибки Минимизация вреда через избыточную осторожность

Вывод для индустрии

Применение LLM в автономном клиническом принятии решений требует пересмотра подходов к валидации. Безопасность зависит не от объема медицинских знаний в модели, а от внедрения логики клинического триажа, которая ограничивает «ассистентское» поведение и заставляет модель действовать консервативно при нехватке данных.

Источник: arXiv cs.AI ↗