Проблема «мыслительных» агентов
Платформы всё чаще тестируют политики на искусственных пользователях (LLM-агентах). Однако существующие методы валидации часто фокусируются лишь на совпадении с усреднённым поведением людей, игнорируя индивидуальную специфику. Более того, использование таких агентов для манипуляции общественным мнением требует высокой достоверности (fidelity) профиля, а не просто статистической правдоподобности.
Методология: 8 человек против 4 моделей
Авторы исследования (Bojic et al., 2026) провели строгий эксперимент с участием 8 реальных пользователей из Сербии. Для каждого участника был собран детальный профиль через опросник, глубинное интервью и письменное самопрезентационное эссе. Затем модели должны были предсказать реакцию этих конкретных людей на 68 постов в соцсетях.
Эксперимент тестировал четыре языковые модели в пяти условиях промптинга. Ключевое различие заключалось в стиле инструкций: требовали ли от модели аналитического рассуждения или интуитивного, мгновенного ответа.
Ключевые результаты: Интуиция побеждает логику
Самым важным открытием стало то, что инструкции, требующие от модели «думать» и анализировать, снижают точность симуляции. Напротив, установка на интуитивный ответ («respond intuitively and immediately») дала наилучшие результаты.
Важнейшая метрика — сжатие индивидуальных различий (compression of individual differences). В человеческой выборке различия между людьми были естественными. В моделях, использующих аналитический подход, эти различия сжимались в 7 раз сильнее, чем у людей (модели становились слишком однородными). При использовании интуитивного промпта этот показатель снизился до 3-кратного сжатия, что значительно ближе к реальности.
| Параметр | Аналитический промпт | Интуитивный промпт | Человеческий базис |
|---|---|---|---|
| Точность симуляции (Fidelity) | Ниже | Максимальная | — |
| Сжатие индивидуальных различий | 7x от уровня человека | 3x от уровня человека | 1x (референс) |
| Работа с неизвестными темами | Снижение точности | Превосходство над толпой | — |
| Влияние типа профиля | Аттитюдный контент (ценности) важнее демографии | — | |
Почему это важно для индустрии
Результаты бьют по тренду на использование сложных цепочек рассуждений (Chain-of-Thought) для всех задач. Для симуляции поведения людей, особенно в социальных сетях, где реакции часто импульсивны, «медленное мышление» моделей вредит. Интуитивный промптинг позволяет агентам быть универсальными симуляторами, способными адекватно реагировать на темы, которые не были затронуты в их первоначальном профайлинге, превосходя даже базовые модели «толпы» (crowd baseline).
Источник: arXiv cs.AI ↗
