Исследования10 сентября 2026 г., 07:17 МСК🤖 Auto

LLM судят строже людей: исследование метанорм и предвзятости санкций

Исследователи из Университета Пенсильвании представили датасет NormReact, доказавший, что современные LLM систематически переоценивают необходимость наказания за нарушение социальных норм, особенно при удалении от нарушителя.

Баннер новости 7140

От «что нельзя» к «как отреагируют»

Большинство усилий по выравниванию (alignment) ИИ сосредоточены на первом порядке социальных норм — базовых правилах вроде «не кради». Однако реальная социальная интеллигенция требует понимания метанорм (second-order norms): способности предсказать, кто именно отреагирует на нарушение и каким образом (публичное осуждение, игнорирование или тюремное заключение). Исследователи под руководством Сэнни Рая (Sunny Rai) из Университета Пенсильвании ввели новую метрику оценки LLM, разделяя реакцию на два измерения: эмоциональную оценку и поведенческий ответ.

Датасет NormReact: 450 сценариев с аннотациями

Для тестирования была создана база данных NormReact, содержащая 450 сценариев нарушения норм. Ключевая особенность датасета — ручная аннотация эмоций и реакций как нарушителей (само регуляция), так и наблюдателей (реакция других). Аннотации учитывают два критических фактора:

  • Пол нарушителя (гендерный аспект восприятия).
  • Социальную близость наблюдателя (насколько он близок к нарушителю).

Результаты: ИИ создает «жесткий» мир

При тестировании шести популярных моделей LLM выявлена систематическая ошибка: ИИ предсказывает негативные санкции там, где люди ожидали бы бездействия или терпимости. Эта предвзятость усиливается по мере увеличения социальной дистанции между наблюдателем и нарушителем. ИИ склонен игнорировать контекст и человеческую сдержанность, предлагая максимальное наказание.

Параметр оценки Поведение человека Поведение LLM (в среднем)
Реакция на нарушение Часто игнорирование или мягкое предупреждение Предсказание строгих санкций (осуждение, изоляция)
Влияние дистанции Реакция смягчается с удалением от нарушителя Жесткость санкций сохраняется или растет
Учет контекста Высокая чувствительность к социальным связям Низкая корреляция с человеческими суждениями

Почему это важно для индустрии

Результаты исследования указывают на риск создания искаженной картины социального регулирования в чувствительных доменах. Если ИИ-системы используются для медиации конфликтов, симуляции политики или модерации контента, их склонность к «гипернаказанию» может привести к несправедливым решениям. Исследователи подчеркивают, что для реальной интеграции ИИ в социум необходимо развивать не только знание правил, но и понимание нюансов человеческой терпимости и реляционной калибровки.

Источник: arXiv cs.AI ↗