Исследования13 июля 2026 г., 10:16 МСК🤖 Auto

MedRealMM: ИИ в медицине проигрывает врачам по безопасности

Новый бенчмарк MedRealMM на 5620 реальных случаях показал, что даже топовые LLM уступают врачам в безопасности ответов, несмотря на рост клинических навыков.

Баннер новости 3436

Реальные данные вместо симуляций

Исследователи представили MedRealMM — первый крупномасштабный мультимодальный бенчмарк, основанный на реальных деидентифицированных диалогах между пациентами и врачами в китайских онлайн-клиниках. В отличие от предыдущих наборов данных, использующих синтетические сценарии или текстовые симуляторы, MedRealMM включает 5 620 случаев из 64 клинических отделений. Каждый кейс содержит не только текст, но и загруженные пациентами медицинские изображения, что критически важно для оценки реальной диагностической способности ИИ.

Метрика MCCP и оценка безопасности

Для оценки качества ответов авторы разработали фреймворк Multimodal Clinical Challenge Point (MCCP). Он выделяет ключевые моменты консультации, где требуется наиболее сложная клиническая реакция. Оценка производится не по лексическому совпадению, а по специфическим рубрикам, утвержденным врачами. Система оценивает два типа критериев:

  • Положительные: клинически желательные действия (точный диагноз, корректные рекомендации).
  • Отрицательные: опасные, необоснованные или противоречивые ответы (галлюцинации, игнорирование симптомов).

Итоги тестирования 19 моделей

В исследовании протестированы 19 моделей общего и медицинского назначения, включая текстовые и мультимодальные. Результаты выявили парадокс: некоторые передовые модели удовлетворяют большему числу положительных критериев, чем врачи, но при этом совершают больше ошибок, попадающих под «отрицательные» критерии. Это указывает на то, что главная проблема сейчас — не в интеллекте, а в безопасности (safety-sensitive error avoidance).

Метрика / Аспект Результат / Наблюдение
Размер датасета 5 620 реальных случаев
Охват специальностей 64 клинических отделения
Ключевой вывод по изображениям Наличие медицинских изображений критически важно для надежности
Сравнение с врачами ИИ уступает врачам по общему качеству из-за частых «отрицательных» ошибок
Доступность данных Публично на Hugging Face

Почему это важно

MedRealMM демонстрирует, что текущие LLM еще не готовы к полной автономии в телемедицине. Модель может быть «умной» в теории, но нести риски для пациента. Этот бенчмарк становится новым стандартом для проверки не только знаний, но и клинической ответственности ИИ-систем.

Источник: arXiv cs.AI ↗