Проблема «схлопывания» личности
Исследователи из команды Pranav Narayanan Venkit провели масштабный аудит AI-компаньонов, выявив два критических дефекта долгосрочного взаимодействия: persona collapse (потеря роли, ценностей или стиля) и behavioral drift (постепенное или циклическое изменение поведения). Проблема в том, что локально корректные ответы не гарантируют сохранения контекста в долгосрочной перспективе.
Методология ANCHOR: 2008 диалогов
Для проверки использовался контролируемый синтетический аудит ANCHOR. Тестирование охватило 2 008 бесед, в которых участвовали 27 различных персон, 9 графиков взаимодействия, 3 настройки памяти и 4 оцениваемые модели. Оценка проводилась по двум направлениям:
- Identity Probe: закрытый опросник из 102 вопросов с оценкой по ходам диалога.
- Trajectory Probe: 110 калиброванных контрфактуальных вопросов из 35 банков диалогов для проверки памяти на события.
Ключевые метрики провала
Результаты оказались однозначными: ни одна из протестированных моделей и конфигураций не смогла надежно сохранить ни личность, ни траекторию диалога. Ниже приведены основные показатели эффективности:
| Метрика | Результат | Интерпретация |
|---|---|---|
| Точность траектории (Trajectory Accuracy) | 44,4% | Модель помнит менее половины ключевых событий истории. |
| Воспоминание состояния пользователя | ~25% | Соответствует случайному угадыванию из 4 вариантов (chance level). |
| Стабильность опросника | Нестабильно | Результаты сильно зависят от модели, аспекта персоны и выбора оценщика. |
Почему это важно
Исследование доказывает, что текущие системы не поддерживают надежную непрерывность в роли компаньона. Авторы подчеркивают, что традиционные метрики «доверия» или «стабильности» не работают, так как они смешивают разные типы ошибок. Для создания по-настоящему надежных AI-компаньонов необходимо разделять оценку enactment (исполнения роли), recall (воспоминаний) и контекста развертывания.
Вывод
Пока что AI-компаньоны не могут быть «лучшими друзьями навсегда» в техническом смысле. Без существенных улучшений в механизмах долговременной памяти и контроля за дрейфом поведения, системы будут продолжать терять нить диалога и менять характер в ходе длительного взаимодействия.
Источник: arXiv cs.AI ↗
