Проблема «плавающей» личности
Внедрение персистентных AI-агентов, которые должны сохранять контекст и личность между сессиями, сталкивается с фундаментальной проблемой: модели часто забывают или искажают свои «базовые» характеристики при обновлении промптов или системы. Авторы исследования Zhenyu Zhao и Roy Zhao (12 сентября 2026 г.) вводят PAI-Bench — провайдер-нейтральный бенчмарк, который разделяет понятия «вспоминание факта» (recall) и «выполнение роли» (enactment). Главная цель — оценить верность «контракту идентичности» (identity contract), который версионируется и обновляется.
Методология: 1536 ответов и 16 профилей
Тестирование проводилось на двух замороженных кампаниях (campaigns), охватывающих 16 синтетических профилей агентов. Для каждого профиля использовалось 32 зонда (probes) и 3 независимые конфигурации целевых моделей, что в сумме дало 1 536 сохраненных ответов. Ключевая особенность PAI-Bench — использование независимых от судей (judge-independent) буквальных аудитов, исключающих субъективность LLM-оценщиков.
Ключевые метрики и провалы
Исследование выявило критический разрыв между явным и неявным выражением идентичности. При прямом запросе идентификаторов (direct-parent identifiers) модели справлялись идеально, но при попытке сформировать самовосприятие (implicit self-portraits) провалились почти полностью. Ниже приведены результаты буквального аудита:
| Тип запроса | Успешных ответов (из 48) | Доля успеха | Интерпретация |
|---|---|---|---|
| Прямые идентификаторы (Direct-parent) | 48 | 100% | Модель легко извлекает сохраненные факты из памяти. |
| Неявные портреты (Implicit self-portraits) | 1 | ~2.1% | Модель не способна «вспомнить» себя как целостную личность без жестких подсказок. |
Влияние стартовых подсказок (Startup Cues)
Эксперименты показали высокую чувствительность моделей к формулировке начального промпта. На 8 профилях явные указания полей увеличили совместное присутствие трех идентификаторов идентичности с 0/8 до 7/8. Замена метки запуска (body-label substitution) также повысила присутствие полной идентификации с 1/8 до 7/8, в то время как родительские идентификаторы оставались отсутствующими. Это доказывает, что выбор компонентов идентичности зависит от промпта, а не от устойчивой памяти агента.
Чувствительность оценщиков и сравнение моделей
Исследование также выявило артефакты самих систем оценки. При повторном запуске идентичных факториальных ответов средняя оценка заголовка от Claude оказалась на 12.5 процентных пунктов ниже, чем у Astra, что демонстрирует нестабильность самих LLM-судей. PAI-Bench предлагает воспроизводимый протокол для разделения фактической доступности данных, выражения идентичности и поведенческого выполнения роли, что критически важно для разработки надежных автономных агентов.
Источник: arXiv cs.AI ↗
