Исследования5 августа 2026 г., 22:16 МСК🤖 Auto

MedPIC-Bench: LLM теряют 18% точности при изменении данных о пациенте

Исследователи представили MedPIC-Bench — первый бенчмарк, проверяющий способность ИИ пересматривать решения о безопасности лекарств при изменении анамнеза. Показано, что даже медицинские модели не умеют корректно отменять предупреждения.

Баннер новости 5153

Проблема статичного мышления ИИ

Применение правил безопасности лекарств без учета конкретных условий пациента ведет к ошибочным решениям. Существующие медицинские оценки часто используют изолированные сценарии, где модель может просто вспомнить ассоциацию «лекарство-риск», не анализируя, применимо ли это правило к текущему пациенту. Авторы работы из arXiv (2026) предлагают решение — MedPIC-Bench, набор из 467 вопросов, аннотированных по шести клиническим и рассуждающим измерениям.

Методология: контрфактуальный анализ

Ключевая особенность бенчмарка — использование парных контрфактуальных вопросов. В них контролируемое изменение информации о пациенте (например, добавление или удаление конкретного атрибута) должно менять вывод модели о применимости правила безопасности. Это позволяет измерить не просто знание фактов, а способность к условному применению правил.

Результаты: разрыв между «знанием» и «рассуждением»

Тестирование 28 моделей (медицинских, общих и проприетарных) выявило критический недостаток: ни одна модель не справилась с контрфактуальными вопросами так же хорошо, как с базовыми. Средняя точность упала с 63,6% до 45,1%.

Интересно, что модели хорошо работают, когда явный атрибут пациента сигнализирует о знакомом противопоказании. Однако они терпят неудачу, когда информация о пациенте должна сузить или отменить предупреждение о безопасности. При этом рассуждения моделей часто признают измененные данные, но финальный ответ остается прежним.

Метрика Значение Комментарий
Базовая точность (стандартные вопросы) 63,6% Способность применять правила в фиксированных сценариях
Точность на контрфактах (MedPIC-Bench) 45,1% Способность пересматривать решение при изменении данных
Падение производительности 18,5 п.п. Критический разрыв в надежности
Сравнение категорий моделей Мед. LLM < Общие LLM Специализированные модели показали худшие результаты в CF-задачах

Почему это важно

Результаты показывают, что статичная точность в вопросах безопасности лекарств не является надежным индикатором надежности ИИ для персонализированной медицины. Уязвимость сохраняется даже среди медицинских LLM, которые в среднем отстают от общих моделей в контрфактуальных задачах. MedPIC-Bench делает измеримым применение условных правил и подчеркивает необходимость новых стандартов оценки для клинических ассистентов.

Источник: arXiv cs.AI ↗