Исследования10 сентября 2026 г., 11:18 МСК🤖 Auto

Провал до дрейфа: почему LLM-агенты не имитируют ценности людей

Исследование arXiv:2609.05514 показало, что более 50% LLM-агентов с самого начала не соответствуют заданным культурным профилям, ставя под сомнение их использование в социальных симуляциях.

Баннер новости 7156

Суть эксперимента: симуляция общества

Команда исследователей (Farah Atif, Sougata Saha, Monojit Choudhury) разработала фреймворк на основе World Values Survey (WVS) для проверки способности языковых моделей имитировать разнообразные и конфликтующие человеческие ценности. В ходе лонгитюдного исследования модели вели дискуссии на 15 темах, имитируя социальные взаимодействия.

Масштаб тестирования впечатляет: ~4 000 диалогов с участием 1 200 персон (агентов). В сравнении участвовали три передовые модели: GPT-4o, Gemini-2.5-Flash и Gemma-4-E4B.

Ключевые метрики: провал на старте, а не дрейф

Главный вывод авторов — проблема не в том, что агенты «портят» ценности со временем, а в том, что они изначально их не воспроизводят. Более половины агентов не смогли выразить назначенный им профиль WVS с первого шага.

Метрика / Параметр Результат / Наблюдение
Доля агентов с неверным стартовым профилем > 50% (от общего числа 1 200 персон)
Уровень дрейфа ценностей (value drift) 2–7% после серии разговоров
Влияние удаления демографических данных Повысило верность для некоторых моделей, но не изменило общую картину системного отклонения
Стиль vs. Семантика (сравнение с людьми) Агенты генерируют семантически разнообразный, но стилистически повторяемый контент

Почему это важно для AI-сообщества

LLM-агенты всё чаще используются как прокси-участники в социальных науках для моделирования общественного мнения. Результаты показывают, что текущие модели не могут достоверно сохранять и представлять сложные человеческие ценностные профили. Систематическое отклонение от назначенных WVS-профилей означает, что такие симуляции могут давать ложные выводы о социальных процессах, так как «шум» в виде неверных ценностей возникает еще до начала взаимодействия.

Источник: arXiv cs.AI ↗