От «что нельзя» к «как отреагируют»
Большинство усилий по выравниванию (alignment) ИИ сосредоточены на первом порядке социальных норм — базовых правилах вроде «не кради». Однако реальная социальная интеллигенция требует понимания метанорм (second-order norms): способности предсказать, кто именно отреагирует на нарушение и каким образом (публичное осуждение, игнорирование или тюремное заключение). Исследователи под руководством Сэнни Рая (Sunny Rai) из Университета Пенсильвании ввели новую метрику оценки LLM, разделяя реакцию на два измерения: эмоциональную оценку и поведенческий ответ.
Датасет NormReact: 450 сценариев с аннотациями
Для тестирования была создана база данных NormReact, содержащая 450 сценариев нарушения норм. Ключевая особенность датасета — ручная аннотация эмоций и реакций как нарушителей (само регуляция), так и наблюдателей (реакция других). Аннотации учитывают два критических фактора:
- Пол нарушителя (гендерный аспект восприятия).
- Социальную близость наблюдателя (насколько он близок к нарушителю).
Результаты: ИИ создает «жесткий» мир
При тестировании шести популярных моделей LLM выявлена систематическая ошибка: ИИ предсказывает негативные санкции там, где люди ожидали бы бездействия или терпимости. Эта предвзятость усиливается по мере увеличения социальной дистанции между наблюдателем и нарушителем. ИИ склонен игнорировать контекст и человеческую сдержанность, предлагая максимальное наказание.
| Параметр оценки | Поведение человека | Поведение LLM (в среднем) |
|---|---|---|
| Реакция на нарушение | Часто игнорирование или мягкое предупреждение | Предсказание строгих санкций (осуждение, изоляция) |
| Влияние дистанции | Реакция смягчается с удалением от нарушителя | Жесткость санкций сохраняется или растет |
| Учет контекста | Высокая чувствительность к социальным связям | Низкая корреляция с человеческими суждениями |
Почему это важно для индустрии
Результаты исследования указывают на риск создания искаженной картины социального регулирования в чувствительных доменах. Если ИИ-системы используются для медиации конфликтов, симуляции политики или модерации контента, их склонность к «гипернаказанию» может привести к несправедливым решениям. Исследователи подчеркивают, что для реальной интеграции ИИ в социум необходимо развивать не только знание правил, но и понимание нюансов человеческой терпимости и реляционной калибровки.
Источник: arXiv cs.AI ↗
