Суть эксперимента: 21 008 ответов на 101 вопрос
Команда исследователей (James Wedgwood, Pratiksha Thaker, Neil Kale, Virginia Smith) провела масштабный анализ культурной совместимости (value alignment) четырех ведущих языковых моделей. В качестве эталона человеческих ответов использовался World Values Survey (WVS) — глобальный опрос, охватывающий более 60 стран. Тестирование проводилось на 13 языково-страновых срезах, что позволило оценить не только языковые, но и культурные сдвиги.
В исследовании участвовали модели GPT-5.4, Claude Sonnet 4.6, Gemini 2.5 Flash и Qwen3-235B. Всего было сгенерировано 21 008 строк ответов, которые сравнивались с реальными распределениями мнений людей.
Три стратегии промптинга: кто победил?
Исследователи протестировали три подхода к формулировке запроса, чтобы понять, можно ли считать их взаимозаменяемыми:
- Language-only baseline: Базовый запрос без указания культурного контекста.
- User-country: Запрос от лица пользователя конкретной страны (персонализация).
- Persona-country: Ролевая игра, где ИИ должен представить себя жителем определенной страны.
- Third-person forecasting: Прогноз того, как люди из определенной страны ответили бы на вопрос (третье лицо).
Ключевые метрики и результаты
Главный вывод: культурные маркеры в промпте существенно меняют ответы, но не всегда в сторону большей точности. Наиболее сильное направлениельное совпадение с реальными человеческими ответами (strongest directional alignment) продемонстрировало третье лицо (forecasting) для трех из четырех моделей. Персонализация и ролевая игра оказались менее стабильными.
| Метрика / Аспект | Результат исследования |
|---|---|
| Лучший метод | Third-person forecasting (прогноз от третьего лица) |
| Слабые стороны | Персонализация и ролевая игра (Persona) |
| Сильные значения | Религиозность, гендерные роли, материальные ценности труда |
| Сложные значения | Доверие к институтам, вопросы демократии |
| Объем данных | 21 008 ответов, 101 вопрос, 13 срезов |
Почему это важно для индустрии
Результаты показывают, что prompt framing (стиль формулировки запроса) является детерминантом первого порядка. Это означает, что разработчики систем, использующих LLM для анализа общественного мнения или локализации контента, не могут просто «включить» культурную чувствительность. Выбор между «ты — житель Франции» и «как, по вашему мнению, ответили бы жители Франции» даст принципиально разные результаты.
Особое внимание стоит уделить тому, что некоторые ценности (религия, гендер) поддаются прогнозированию лучше, чем институциональные (доверие к власти). Это создает риски при использовании ИИ для политических или социальных прогнозов, где требуется высокая точность в сложных, неоднозначных темах.
Источник: arXiv cs.AI ↗
