Суть эксперимента: симуляция общества
Команда исследователей (Farah Atif, Sougata Saha, Monojit Choudhury) разработала фреймворк на основе World Values Survey (WVS) для проверки способности языковых моделей имитировать разнообразные и конфликтующие человеческие ценности. В ходе лонгитюдного исследования модели вели дискуссии на 15 темах, имитируя социальные взаимодействия.
Масштаб тестирования впечатляет: ~4 000 диалогов с участием 1 200 персон (агентов). В сравнении участвовали три передовые модели: GPT-4o, Gemini-2.5-Flash и Gemma-4-E4B.
Ключевые метрики: провал на старте, а не дрейф
Главный вывод авторов — проблема не в том, что агенты «портят» ценности со временем, а в том, что они изначально их не воспроизводят. Более половины агентов не смогли выразить назначенный им профиль WVS с первого шага.
| Метрика / Параметр | Результат / Наблюдение |
|---|---|
| Доля агентов с неверным стартовым профилем | > 50% (от общего числа 1 200 персон) |
| Уровень дрейфа ценностей (value drift) | 2–7% после серии разговоров |
| Влияние удаления демографических данных | Повысило верность для некоторых моделей, но не изменило общую картину системного отклонения |
| Стиль vs. Семантика (сравнение с людьми) | Агенты генерируют семантически разнообразный, но стилистически повторяемый контент |
Почему это важно для AI-сообщества
LLM-агенты всё чаще используются как прокси-участники в социальных науках для моделирования общественного мнения. Результаты показывают, что текущие модели не могут достоверно сохранять и представлять сложные человеческие ценностные профили. Систематическое отклонение от назначенных WVS-профилей означает, что такие симуляции могут давать ложные выводы о социальных процессах, так как «шум» в виде неверных ценностей возникает еще до начала взаимодействия.
Источник: arXiv cs.AI ↗
