Крах парных предпочтений как метрики безопасности
Новое исследование, опубликованное в arXiv (авторы: Fay Elhassan, David Sasu и соавт.), ставит под сомнение фундаментальный подход к оценке LLM в медицине. Команда проанализировала 26 804 пары суждений от более чем 736 клиницистов из 28 стран. Цель — понять, коррелирует ли выбор врача «более приятного» ответа с его клинической безопасностью. Вывод однозначен: парадное предпочтение — плохой прокси для безопасности.
Модели, занимающие высокие позиции в агрегированных рейтингах, демонстрируют существенные уровни клинически значимых сбоев (оценки ≤ -1 по шкале от -2 до +2) по таким критериям, как Безвредность (Harmlessness) и Точность (Accuracy). Это означает, что модель может быть «вежливой» и «убедительной», но при этом выдавать опасные рекомендации.
Доменная специфика и «зоны запрета»
Критические ошибки распределены неравномерно. Исследователи выявили так называемые «no-go zones» — узкие специализации, где даже топовые модели систематически ошибаются. Эти провалы не видны в общих лидербордах, что создает ложное чувство безопасности при внедрении ИИ в клиническую практику.
Почему врачи выбирают опасные ответы?
Анализ показал, что поверхностные характеристики текста (стиль, длина, уверенность тона) объясняют вариацию предпочтений врачей чуть лучше, чем реальные различия в безопасности по рубрикам. Значительная часть голосов не несет никакого положительного сигнала безопасности. Кроме того, поведение модели (отказ от ответа или эскалация) сильно влияет на выбор, маскируя реальные проблемы с точностью.
Предлагаемое решение: Clinically Adjusted Ranking
Авторы предлагают отказаться от чистой модели Брэдли-Терри (Bradley-Terry) в пользу клинически скорректированного ранжирования. Этот метод объединяет парные предпочтения с рубричными оценками, позволяя выявлять модели, которые действительно безопасны, а не просто приятны на слух.
| Метрика / Характеристика | Результаты исследования | Значение для индустрии |
|---|---|---|
| Объем данных | 26 804 парных суждения | Статистически значимая выборка для клинических задач |
| Участники | 736+ клиницистов, 28+ стран | Глобальная репрезентативность мнений экспертов |
| Шкала оценки | Дискретная [-2, +2] | Отрицательные значения фиксируют клинически опасный контент |
| Ключевой инсайт | Поверхностные признаки > Безопасность в предпочтениях | RLHF-оптимизация может ухудшить клиническую надежность |
| Проблема лидербордов | Скрытые «no-go zones» в специализациях | Агрегированные рейтинги скрывают критические сбои |
Выводы для разработчиков
Индустрии необходимо разделять понятия «предпочтение» и «безопасность». Оценка LLM для медицины должна включать прямое reporting failure rates (уровней отказов) по критическим параметрам и использовать клинически обоснованные корректировки, а не полагаться исключительно на человеческие предпочтения, обученные через RLHF.
Источник: arXiv cs.CL ↗
