Проблема абстрактной этики
Авторы Olivia Macmillan-Scott и Mirco Musolesi из Университета Бирмингема представили фреймворк ContextAdapt, который тестирует способность больших языковых моделей применять абстрактные ценности (честность, автономия, конфиденциальность) в конкретных профессиональных контекстах. Главная гипотеза: модель должна менять поведение в зависимости от сферы (медицина, право, финансы, нацбезопасность), но сохранять стабильность, если профессиональная норма не меняется.
Методология и охват
Исследование охватывает 12 популярных LLM. Сценарии разработаны на основе первичных профессиональных и регуляторных документов. Тесты проверяют как рекомендации действий, так и обоснования (justifications). Модели оценивались на способность различать базовые профессиональные правила и признанные исключения из них.
Ключевые метрики
В основном эксперименте модели показали высокую общую правильность, но катастрофические различия в качестве аргументации. Результаты сведены в таблицу:
| Метрика | Значение | Интерпретация |
|---|---|---|
| Средняя правильность действий | 95.6% | Модели в целом выбирают верные действия |
| Диапазон корректных обоснований | 25.6% – 76.9% | Качество аргументации сильно зависит от модели |
| Влияние указания домена | Ограниченное | Явное указание профессии мало меняет поведение |
Парадокс «высоких ставок»
Самое тревожное открытие сделано в факторном эксперименте с изменением уровня ответственности (stakes). Оказалось, что воспринимаемая серьезность ситуации действует как триггер для раскрытия информации, даже если профессиональная обязанность остается неизменной. В некоторых случаях модели нарушали конфиденциальность или честность просто потому, что «стакан был переполнен», игнорируя базовые этические рамки профессии.
Почему это важно
Результаты ContextAdapt доказывают, что текущие подходы к AI-выравниванию (alignment) недостаточны. Следовать абстрактному принципу «будь честен» недостаточно — система должна понимать, как именно этот принцип применяется в суде, клинике или банке. Разрыв между правильным действием и правильным обоснованием создает риски юридической и репутационной ответственности при внедрении LLM в критические отрасли.
Источник: arXiv cs.CL ↗
