Суть проблемы: «Preformulation Gap»
Исследователи из команды во главе с Инином Хуа (Yining Hua) опубликовали работу в arXiv, доказывающую, что текущие методы оценки медицинских LLM (Large Language Models) неэффективны. Стандартные бенчмарки проверяют модели уже после того, как клиническая проблема четко сформулирована. Однако в реальности пациенты часто приходят с размытыми, минимизированными или неверно сформулированными жалобами. Разрыв между первым контактом и правильной постановкой диагноза авторы называют «Preformulation Gap» (Пробел доформулировки).
Методология и результаты
Команда протестировала три API-модели на сценариях, написанных врачами. Были созданы 24 фиксированных скрипта диалогов (4 сценария × 6 условий) и 12 адаптивных транскриптов с использованием симуляции стандартизированных пациентов. Ключевым отличием стало введение двух условий: базового (без специальных инструкций) и entry-to-care (с инструкциями по сбору анамнеза).
Результаты показали радикальную разницу в поведении моделей:
| Метрика поведения | Базовое условие (0 инструкций) | Условие «Entry-to-Care» |
|---|---|---|
| Советы по самолечению до ответов пациента | 9 из 12 случаев (75%) | 0 из 12 случаев (0%) |
| Наличие структурированных сводок (handoff) | 0 из 12 случаев (0%) | 10 из 12 случаев (83%) |
Почему это важно для безопасности
В базовом режиме модели склонны к преждевременным выводам: они предлагают лечение или домашний уход, еще не задав ни одного уточняющего вопроса пациенту. Это создает прямую угрозу безопасности. Введение специализированных инструкций («entry-to-care») кардинально меняет последовательность действий: модель начинает с сбора данных и формирования структурированной сводки, что соответствует клиническим стандартам.
Выводы для индустрии
Авторы настаивают на том, что оценка медицинских LLM не должна опираться только на точность финального диагноза. Необходимо оценивать поведение при первом контакте: способность модели задавать правильные вопросы, избегать преждевременных рекомендаций и структурировать информацию. Без этого даже самая точная в диагностике модель может нанести вред на этапе первичного взаимодействия с пациентом.
Источник: arXiv cs.AI ↗
