Ловушка метрик: когда «правильный» ответ обманчив
Традиционная оценка alignment (выравнивания) больших языковых моделей (LLM) опирается на согласие с человеческими аннотаторами. Однако новое исследование, представленное на AI Transparency Conference 2026, вскрывает критический пробел: совпадение финальных меток не означает совпадения моральных оснований. Два агента могут прийти к одному выводу, используя разные этические frameworks, контекстные допущения или интерпретации ситуации.
Методология: 500 кейсов и анализ аргументации
Авторы (Octavian M. Machidon и соавт.) использовали курированный бенчмарк из 500 элементов, производных от датасета ETHICS, охватывающий пять доменов морального суждения. В отличие от стандартных подходов, исследователи анализировали не только финальные ответы, но и поддерживающие рассуждения (rationales) как людей, так и моделей (как закрытых, так и open-source).
Результаты: Расхождение в моральных приоритетах
Хотя уровень согласия с большинством аннотаторов часто остается высоким, анализ на уровне аргументации выявил систематическое расхождение. Модели перераспределяют внимание между категориями этики, даже когда их итоговый выбор совпадает с человеческим. Ниже приведена структура моральных категорий, в которых наблюдается наибольшая дивергенция:
| Категория морального суждения | Суть расхождения | Пример влияния на вывод |
|---|---|---|
| Harm (Вред) | Модели часто игнорируют косвенный или долгосрочный вред, фокусируясь на прямом физическом воздействии. | Оправдание действий, ведущих к социальному ущербу, ради «общего блага». |
| Respect (Уважение) | LLM реже учитывают нарушение личного достоинства, если оно не нарушает закон. | Игнорирование этических норм общения в пользу информационной точности. |
| Promise-keeping (Верность слову) | Модели склонны нарушать обещания, если это максимизирует утилитарную выгоду. | Отказ от выполнения обязательства ради предотвращения гипотетического риска. |
| Justice/Desert (Справедливость/Заслуга) | Человек учитывает контекст и намерения; модель — только результат. | Наказание за неудачную попытку зла, которую человек бы не осудил так строго. |
| Excuse relevance (Уважение к оправданиям) | Модели слабо реагируют на смягчающие обстоятельства. | Жесткая оценка действий в условиях стресса или принуждения. |
Почему это важно для индустрии
Результаты показывают, что оценка на основе меток (label-based evaluation) может быть обманчиво успокаивающей. Если не дополнять её анализом причин, принципов и моральных приоритетов, заложенных в рассуждения модели, мы рискуем внедрить системы, которые «ведут себя правильно», но не «думают правильно». Это создает скрытые риски в критически важных сферах, где контекст и намерения важнее формального соответствия правилам.
Источник: arXiv cs.AI ↗
