Исследования30 июля 2026 г., 11:17 МСК🤖 Auto

Синтетические пользователи провалились: LLM не заменяют людей в опросах

Исследование arXiv (2026) доказывает, что LLM систематически искажают демографические связи и не могут заменить реальных респондентов в бизнес-аналитике.

Баннер новости 4705

Крах синтетических пользователей

Новое исследование, опубликованное в arXiv (28 июля 2026 г.), ставит крест на популярной практике использования больших языковых моделей (LLM) в качестве «синтетических пользователей» для имитации человеческих ответов в опросах. Авторы — Чжэнь Чэнь, Ди Чжу и Лей Ник Чжэн — провели кросс-доменный бенчмарк, показавший, что ни одна из протестированных моделей не смогла превзойти простые статистические базовые линии, обученные на реальных данных.

Методология и модели

Для проверки гипотезы использовались два независимых набора данных с реальными ответами людей: General Social Survey (GSS) (общественные настроения в США) и World Values Survey (WVS) (межкультурные ценности). Тестировались четыре модели из двух семейств с разбросом от 8B параметров до frontier-уровня. Все модели подвергались демографическому промптингу и сравнивались с non-LLM baselines, обученными на отложенных данных реальных людей.

Два критических сбоя

Исследование выявило два повторяющихся во всех доменах и моделях критических дефекта:

  • Превосходство статистики над ИИ: На индивидуальном уровне ни одна LLM не смогла превзойти даже сильнейшую базовую модель. В кросс-культурных данных разрыв был особенно заметен и сохранялся даже при использовании метрик, учитывающих расстояние (distance-aware) и правильные оценки (proper scoring).
  • Демографическая гипердетерминация: Модели систематически переоценивают влияние демографии на установки. Для LLM идентичность (пол, возраст, раса) является предиктором мнений гораздо сильнее, чем это есть в реальности. Это искажение устойчиво к инвариантным мерам кодирования и присутствует почти во всех группах вопросов.

Практические последствия для бизнеса

Анализ влияния на принятие решений показал, что использование таких данных опасно. В задаче сегментации рынка модели завышали разрывы между сегментами в 2–4 раза. Это приводило к выбору неверной целевой аудитории в 50% случаев для США и большинстве кросс-культурных кейсов, а также к созданию «фантомных» сегментов, которых не существует среди реальных людей.

Метрика / Аспект Результат LLM Результат Baseline (на реальных данных)
Точность предсказания ответов Хуже всех базовых моделей Наивысшая точность
Влияние демографии на мнение Сильное искажение (гипердетерминация) Реалистичное распределение
Разрыв между сегментами рынка Завышен в 2–4 раза Соответствует реальности
Риск ошибки в выборе сегмента 50% случаев (для США) Минимальный

Авторы подчеркивают: увеличение размера модели или её «умности» не решает проблему. Команда готова предоставить фреймворк оценки для проверки безопасности использования синтетических данных перед их внедрением в бизнес-процессы.

Источник: arXiv cs.CL ↗