Исследования30 июня 2026 г., 12:16 МСК🤖 Auto

IMCBench: Почему мультимодальные LLM опасны в медицине

Новый бенчмарк IMCBench, принятый в ECML PKDD 2026, выявил критические пробелы в безопасности медицинских ИИ-ассистентов при анализе снимков.

Баннер новости 2555

Проблема фрагментированных тестов

Существующие медицинские benchmarks часто ограничены: одни поддерживают многооборотный диалог, но не работают с изображениями, другие анализируют мультимодальные данные, но только в формате одиночных вопросов. Исследователи из Meta (Dilek Hakkani-Tur, Maria Xenochristou и др.) создали IMCBench — первый бенчмарк, объединяющий реальные клинические изображения, синтетические профили пациентов и многооборотные диалоги для оценки безопасности, точности и уместности использования неопределенности в диагнозах.

Результаты тестирования флагманов

Команда протестировала восемь передовых мультимодальных моделей из четырех семейств (Claude, GPT, Nova, Llama). Оценка проводилась по шкале 1-5 с использованием метода LLM-as-Jury, калиброванного экспертами-клиницистами. Лидерство удерживает Claude, однако ни одна модель не доминирует во всех аспектах.

Модель Семейство Общий балл (1-5)
Claude Opus 4.6 Claude 3.61
Claude Sonnet 4.6 Claude 3.30
GPT-5.2 GPT 3.29

Критический спад безопасности

Самая тревожная находка: безопасность моделей резко падает при работе с злокачественными опухолями и редкими заболеваниями. Разница в баллах безопасности составляет Δ = -0.27 для обеих категорий. Это означает, что даже топовые модели могут давать опасные рекомендации в сложных клинических случаях, несмотря на высокую общую точность.

Влияние визуального контекста и EHR

Абляционные исследования показали, что визуальный ввод и история болезни (EHR) критически важны для безопасного ведения пациента. Удаление визуального контекста снижает безопасность в среднем на 0.18, а удаление данных EHR — на 0.23. Более сильные модели эффективнее используют визуальные признаки, но общая проблема «безопасности в сложных случаях» остается нерешенной.

Вывод для индустрии

IMCBench доказывает, что точное описание клинической картины не гарантирует безопасного руководства для пациента. Индустрии необходим переход от одношаговых QA-тестов к многомерным фреймворкам оценки, учитывающим риск в редких и онкологических случаях.

Источник: arXiv cs.AI ↗