Проблема статичного мышления ИИ
Применение правил безопасности лекарств без учета конкретных условий пациента ведет к ошибочным решениям. Существующие медицинские оценки часто используют изолированные сценарии, где модель может просто вспомнить ассоциацию «лекарство-риск», не анализируя, применимо ли это правило к текущему пациенту. Авторы работы из arXiv (2026) предлагают решение — MedPIC-Bench, набор из 467 вопросов, аннотированных по шести клиническим и рассуждающим измерениям.
Методология: контрфактуальный анализ
Ключевая особенность бенчмарка — использование парных контрфактуальных вопросов. В них контролируемое изменение информации о пациенте (например, добавление или удаление конкретного атрибута) должно менять вывод модели о применимости правила безопасности. Это позволяет измерить не просто знание фактов, а способность к условному применению правил.
Результаты: разрыв между «знанием» и «рассуждением»
Тестирование 28 моделей (медицинских, общих и проприетарных) выявило критический недостаток: ни одна модель не справилась с контрфактуальными вопросами так же хорошо, как с базовыми. Средняя точность упала с 63,6% до 45,1%.
Интересно, что модели хорошо работают, когда явный атрибут пациента сигнализирует о знакомом противопоказании. Однако они терпят неудачу, когда информация о пациенте должна сузить или отменить предупреждение о безопасности. При этом рассуждения моделей часто признают измененные данные, но финальный ответ остается прежним.
| Метрика | Значение | Комментарий |
|---|---|---|
| Базовая точность (стандартные вопросы) | 63,6% | Способность применять правила в фиксированных сценариях |
| Точность на контрфактах (MedPIC-Bench) | 45,1% | Способность пересматривать решение при изменении данных |
| Падение производительности | 18,5 п.п. | Критический разрыв в надежности |
| Сравнение категорий моделей | Мед. LLM < Общие LLM | Специализированные модели показали худшие результаты в CF-задачах |
Почему это важно
Результаты показывают, что статичная точность в вопросах безопасности лекарств не является надежным индикатором надежности ИИ для персонализированной медицины. Уязвимость сохраняется даже среди медицинских LLM, которые в среднем отстают от общих моделей в контрфактуальных задачах. MedPIC-Bench делает измеримым применение условных правил и подчеркивает необходимость новых стандартов оценки для клинических ассистентов.
Источник: arXiv cs.AI ↗
