Проблема: человеческое поведение не имеет единственного правильного ответа
Традиционный подход к оценке LLM-симуляций опирается на метрику accuracy (точность): модель сравнивается с одним конкретным ответом человека. Однако авторы работы (Pei Wang, Xu Chen, Ji-Rong Wen) утверждают, что это фундаментальная ошибка. Человеческое поведение субъективно: один и тот же человек в одинаковой ситуации может поступить по-разному. Наблюдаемый ответ — это лишь один «выбор» из распределения возможных реакций, а не истина в последней инстанции.
Решение: коэффициент субъективности и SALT
Ученые ввели понятие subjectivity coefficient (коэффициент субъективности) — величину на основе энтропии, которая позволяет количественно оценить, насколько задача зависит от личного выбора. На основе этого коэффициента предложен метод Subjectivity-Adaptive soft-Label Training (SALT):
- Механизм: Модель обучается не на жесткой метке (hard label), а на распределении вероятностей (soft label), сформированном из ответов семантически близких контекстов.
- Адаптивность: Радиус агрегации ответов меняется в зависимости от вычисленного коэффициента субъективности. В «объективных» задачах (например, кодирование) метод автоматически переходит к стандартному обучению на одном ответе.
Новый стандарт: бенчмарк SUBJSIM
Поскольку существующие датасеты содержат только одиночные наблюдения, исследователи создали SUBJSIM — первый крупный бенчмарк для оценки распределительной верности. Он включает:
- 19 300 уникальных контекстов;
- 193 аннотатора (реальных людей);
- 100 субъективных вопросов.
Результаты и значимость
Эксперименты показали, что обучение на распределении ответов (distributional evaluation) значительно превосходит традиционные методы. Это критически важно для создания реалистичных агентов в социальных симуляциях, где важно не просто «угадать» действие, а воспроизвести спектр возможных человеческих реакций.
| Параметр | Традиционный подход | Предложенный метод (SALT + SUBJSIM) |
|---|---|---|
| Объект оценки | Один конкретный ответ человека | Распределение всех возможных ответов |
| Метрика | Accuracy (точность) | Корреляция с энтропией субъективности |
| Обучение | Hard-label (жесткая метка) | Soft-label (адаптивное распределение) |
| Данные | Сингулярные наблюдения | 19 300 контекстов от 193 аннотаторов |
Источник: arXiv cs.AI ↗
