Проблема: тупик в аудите алгоритмов
Аудит персонализационных алгоритмов (рекомендательных систем) сталкивается с фундаментальной дилеммой. Использование реальных пользователей дает высокую реалистичность, но требует огромных ресурсов и сложно контролируется. Использование «sock-puppet» (фейковых) аккаунтов с заранее заданным сценарием масштабируется легко, но их поведение часто слишком искусственно, чтобы отразить реальную реакцию алгоритма. Кроме того, оба метода плохо позволяют отделить влияние демографических атрибутов от поведения пользователя, что мешает каузальному анализу.
Решение: GenAI-агенты как «двигатели поведения»
Авторы работы (Alessandro Morosini, Sarah H. Cen, Andrew Ilyas, Hedi Driss, Aleksander Mądry, Chara Podimata) предлагают новый фреймворк. В нем генеративные ИИ-агенты выступают в роли синтетических пользователей. Каждый агент получает фиксированный «персонаж» (persona), основанный на демографических и политических опросах. Агент не просто выполняет скрипт, а рассуждает о контенте и принимает решения о взаимодействии с ним.
Ключевое преимущество: поведение агента детерминировано его «личностью», но внешние сигналы (пол, возраст, геолокация) можно экспериментально менять. Это позволяет проводить контрфактический аудит: видеть, как платформа реагирует на изменение атрибутов при неизменном поведении.
Кейс-стади: 1 120 агентов в X после выборов 2024 года
Для проверки метода команда развернула 1 120 ИИ-агентов в социальной сети X (бывший Twitter) вскоре после президентских выборов в США 2024 года. Эксперимент охватывал 14 различных персонажей и три контрфактических условия. В ходе исследования было собрано более 200 000 воздействий контента (content exposures) на агентов.
Ключевые находки: усиление токсичности и поляризации
Анализ показал, что алгоритмическая лента X (algorithmic feed) значительно усиливает токсичный, поляризационный, политический и право-ориентированный контент по сравнению с хронологической лентой. При этом степень усиления резко варьируется в зависимости от идеологии пользователя.
| Параметр | Результат аудита |
|---|---|
| Масштаб эксперимента | 1 120 агентов, 14 персонажей, 3 условия |
| Объем данных | > 200 000 воздействий контента |
| Сравнение лент | Алгоритмическая лента усиливает токсичный и политический контент сильнее, чем хронологическая |
| Влияние идеологии | Алгоритмическое усиление варьируется в зависимости от политической ориентации «персоны» |
| Демографические сигналы | Суммарный эффект (pooled effects) близок к нулю, но эффекты на подгруппы (subgroup-level) сильно различаются по направлению и величине |
Почему это важно
Работа демонстрирует, что ИИ-агенты могут стать новым стандартом инструментария для независимого аудита алгоритмов. Они позволяют масштабировать исследования, сохраняя при этом уровень реализма, недостижимый для простых скриптов, и дают возможность изолировать влияние конкретных атрибутов пользователя на выдачу контента.
Источник: arXiv cs.CL ↗
