Исследования21 августа 2026 г., 10:18 МСК🤖 Auto

Killer-accuracy: почему метрики точности убивают LLM-симуляции

Исследователи из Китая доказали, что оценка LLM по принципу «угадал/не угадал» некорректна для социальных задач. Предложен новый бенчмарк SUBJSIM и метод обучения SALT.

Баннер новости 6220

Проблема: человеческое поведение не имеет единственного правильного ответа

Традиционный подход к оценке LLM-симуляций опирается на метрику accuracy (точность): модель сравнивается с одним конкретным ответом человека. Однако авторы работы (Pei Wang, Xu Chen, Ji-Rong Wen) утверждают, что это фундаментальная ошибка. Человеческое поведение субъективно: один и тот же человек в одинаковой ситуации может поступить по-разному. Наблюдаемый ответ — это лишь один «выбор» из распределения возможных реакций, а не истина в последней инстанции.

Решение: коэффициент субъективности и SALT

Ученые ввели понятие subjectivity coefficient (коэффициент субъективности) — величину на основе энтропии, которая позволяет количественно оценить, насколько задача зависит от личного выбора. На основе этого коэффициента предложен метод Subjectivity-Adaptive soft-Label Training (SALT):

  • Механизм: Модель обучается не на жесткой метке (hard label), а на распределении вероятностей (soft label), сформированном из ответов семантически близких контекстов.
  • Адаптивность: Радиус агрегации ответов меняется в зависимости от вычисленного коэффициента субъективности. В «объективных» задачах (например, кодирование) метод автоматически переходит к стандартному обучению на одном ответе.

Новый стандарт: бенчмарк SUBJSIM

Поскольку существующие датасеты содержат только одиночные наблюдения, исследователи создали SUBJSIM — первый крупный бенчмарк для оценки распределительной верности. Он включает:

  • 19 300 уникальных контекстов;
  • 193 аннотатора (реальных людей);
  • 100 субъективных вопросов.

Результаты и значимость

Эксперименты показали, что обучение на распределении ответов (distributional evaluation) значительно превосходит традиционные методы. Это критически важно для создания реалистичных агентов в социальных симуляциях, где важно не просто «угадать» действие, а воспроизвести спектр возможных человеческих реакций.

Параметр Традиционный подход Предложенный метод (SALT + SUBJSIM)
Объект оценки Один конкретный ответ человека Распределение всех возможных ответов
Метрика Accuracy (точность) Корреляция с энтропией субъективности
Обучение Hard-label (жесткая метка) Soft-label (адаптивное распределение)
Данные Сингулярные наблюдения 19 300 контекстов от 193 аннотаторов

Источник: arXiv cs.AI ↗