Крах синтетических пользователей
Новое исследование, опубликованное в arXiv (28 июля 2026 г.), ставит крест на популярной практике использования больших языковых моделей (LLM) в качестве «синтетических пользователей» для имитации человеческих ответов в опросах. Авторы — Чжэнь Чэнь, Ди Чжу и Лей Ник Чжэн — провели кросс-доменный бенчмарк, показавший, что ни одна из протестированных моделей не смогла превзойти простые статистические базовые линии, обученные на реальных данных.
Методология и модели
Для проверки гипотезы использовались два независимых набора данных с реальными ответами людей: General Social Survey (GSS) (общественные настроения в США) и World Values Survey (WVS) (межкультурные ценности). Тестировались четыре модели из двух семейств с разбросом от 8B параметров до frontier-уровня. Все модели подвергались демографическому промптингу и сравнивались с non-LLM baselines, обученными на отложенных данных реальных людей.
Два критических сбоя
Исследование выявило два повторяющихся во всех доменах и моделях критических дефекта:
- Превосходство статистики над ИИ: На индивидуальном уровне ни одна LLM не смогла превзойти даже сильнейшую базовую модель. В кросс-культурных данных разрыв был особенно заметен и сохранялся даже при использовании метрик, учитывающих расстояние (distance-aware) и правильные оценки (proper scoring).
- Демографическая гипердетерминация: Модели систематически переоценивают влияние демографии на установки. Для LLM идентичность (пол, возраст, раса) является предиктором мнений гораздо сильнее, чем это есть в реальности. Это искажение устойчиво к инвариантным мерам кодирования и присутствует почти во всех группах вопросов.
Практические последствия для бизнеса
Анализ влияния на принятие решений показал, что использование таких данных опасно. В задаче сегментации рынка модели завышали разрывы между сегментами в 2–4 раза. Это приводило к выбору неверной целевой аудитории в 50% случаев для США и большинстве кросс-культурных кейсов, а также к созданию «фантомных» сегментов, которых не существует среди реальных людей.
| Метрика / Аспект | Результат LLM | Результат Baseline (на реальных данных) |
|---|---|---|
| Точность предсказания ответов | Хуже всех базовых моделей | Наивысшая точность |
| Влияние демографии на мнение | Сильное искажение (гипердетерминация) | Реалистичное распределение |
| Разрыв между сегментами рынка | Завышен в 2–4 раза | Соответствует реальности |
| Риск ошибки в выборе сегмента | 50% случаев (для США) | Минимальный |
Авторы подчеркивают: увеличение размера модели или её «умности» не решает проблему. Команда готова предоставить фреймворк оценки для проверки безопасности использования синтетических данных перед их внедрением в бизнес-процессы.
Источник: arXiv cs.CL ↗
