Исследования16 сентября 2026 г., 03:17 МСК🤖 Auto

PAI-Bench: Почему AI-агенты теряют личность после обновления

Исследователи представили PAI-Bench — первый независимый бенчмарк, доказывающий, что способность модели вспоминать факты не равна сохранению идентичности в долгосрочной перспективе.

Баннер новости 7585

Проблема «плавающей» личности

Внедрение персистентных AI-агентов, которые должны сохранять контекст и личность между сессиями, сталкивается с фундаментальной проблемой: модели часто забывают или искажают свои «базовые» характеристики при обновлении промптов или системы. Авторы исследования Zhenyu Zhao и Roy Zhao (12 сентября 2026 г.) вводят PAI-Bench — провайдер-нейтральный бенчмарк, который разделяет понятия «вспоминание факта» (recall) и «выполнение роли» (enactment). Главная цель — оценить верность «контракту идентичности» (identity contract), который версионируется и обновляется.

Методология: 1536 ответов и 16 профилей

Тестирование проводилось на двух замороженных кампаниях (campaigns), охватывающих 16 синтетических профилей агентов. Для каждого профиля использовалось 32 зонда (probes) и 3 независимые конфигурации целевых моделей, что в сумме дало 1 536 сохраненных ответов. Ключевая особенность PAI-Bench — использование независимых от судей (judge-independent) буквальных аудитов, исключающих субъективность LLM-оценщиков.

Ключевые метрики и провалы

Исследование выявило критический разрыв между явным и неявным выражением идентичности. При прямом запросе идентификаторов (direct-parent identifiers) модели справлялись идеально, но при попытке сформировать самовосприятие (implicit self-portraits) провалились почти полностью. Ниже приведены результаты буквального аудита:

Тип запроса Успешных ответов (из 48) Доля успеха Интерпретация
Прямые идентификаторы (Direct-parent) 48 100% Модель легко извлекает сохраненные факты из памяти.
Неявные портреты (Implicit self-portraits) 1 ~2.1% Модель не способна «вспомнить» себя как целостную личность без жестких подсказок.

Влияние стартовых подсказок (Startup Cues)

Эксперименты показали высокую чувствительность моделей к формулировке начального промпта. На 8 профилях явные указания полей увеличили совместное присутствие трех идентификаторов идентичности с 0/8 до 7/8. Замена метки запуска (body-label substitution) также повысила присутствие полной идентификации с 1/8 до 7/8, в то время как родительские идентификаторы оставались отсутствующими. Это доказывает, что выбор компонентов идентичности зависит от промпта, а не от устойчивой памяти агента.

Чувствительность оценщиков и сравнение моделей

Исследование также выявило артефакты самих систем оценки. При повторном запуске идентичных факториальных ответов средняя оценка заголовка от Claude оказалась на 12.5 процентных пунктов ниже, чем у Astra, что демонстрирует нестабильность самих LLM-судей. PAI-Bench предлагает воспроизводимый протокол для разделения фактической доступности данных, выражения идентичности и поведенческого выполнения роли, что критически важно для разработки надежных автономных агентов.

Источник: arXiv cs.AI ↗