Исследования6 августа 2026 г., 06:16 МСК🤖 Auto

Парадокс клинического ИИ: почему «любимые» модели опасны

Исследование MOOVE с участием 736 врачей показало: рейтинги на основе парных предпочтений (RLHF) не гарантируют безопасность. Топовые модели часто содержат критические ошибки в узких специализациях.

Баннер новости 5180

Крах парных предпочтений как метрики безопасности

Новое исследование, опубликованное в arXiv (авторы: Fay Elhassan, David Sasu и соавт.), ставит под сомнение фундаментальный подход к оценке LLM в медицине. Команда проанализировала 26 804 пары суждений от более чем 736 клиницистов из 28 стран. Цель — понять, коррелирует ли выбор врача «более приятного» ответа с его клинической безопасностью. Вывод однозначен: парадное предпочтение — плохой прокси для безопасности.

Модели, занимающие высокие позиции в агрегированных рейтингах, демонстрируют существенные уровни клинически значимых сбоев (оценки ≤ -1 по шкале от -2 до +2) по таким критериям, как Безвредность (Harmlessness) и Точность (Accuracy). Это означает, что модель может быть «вежливой» и «убедительной», но при этом выдавать опасные рекомендации.

Доменная специфика и «зоны запрета»

Критические ошибки распределены неравномерно. Исследователи выявили так называемые «no-go zones» — узкие специализации, где даже топовые модели систематически ошибаются. Эти провалы не видны в общих лидербордах, что создает ложное чувство безопасности при внедрении ИИ в клиническую практику.

Почему врачи выбирают опасные ответы?

Анализ показал, что поверхностные характеристики текста (стиль, длина, уверенность тона) объясняют вариацию предпочтений врачей чуть лучше, чем реальные различия в безопасности по рубрикам. Значительная часть голосов не несет никакого положительного сигнала безопасности. Кроме того, поведение модели (отказ от ответа или эскалация) сильно влияет на выбор, маскируя реальные проблемы с точностью.

Предлагаемое решение: Clinically Adjusted Ranking

Авторы предлагают отказаться от чистой модели Брэдли-Терри (Bradley-Terry) в пользу клинически скорректированного ранжирования. Этот метод объединяет парные предпочтения с рубричными оценками, позволяя выявлять модели, которые действительно безопасны, а не просто приятны на слух.

Метрика / Характеристика Результаты исследования Значение для индустрии
Объем данных 26 804 парных суждения Статистически значимая выборка для клинических задач
Участники 736+ клиницистов, 28+ стран Глобальная репрезентативность мнений экспертов
Шкала оценки Дискретная [-2, +2] Отрицательные значения фиксируют клинически опасный контент
Ключевой инсайт Поверхностные признаки > Безопасность в предпочтениях RLHF-оптимизация может ухудшить клиническую надежность
Проблема лидербордов Скрытые «no-go zones» в специализациях Агрегированные рейтинги скрывают критические сбои

Выводы для разработчиков

Индустрии необходимо разделять понятия «предпочтение» и «безопасность». Оценка LLM для медицины должна включать прямое reporting failure rates (уровней отказов) по критическим параметрам и использовать клинически обоснованные корректировки, а не полагаться исключительно на человеческие предпочтения, обученные через RLHF.

Источник: arXiv cs.CL ↗