Проблема «слепоты» к изменениям
Современные бенчмарки для долговременной памяти (Long-term Memory) фокусируются на способности моделей запоминать факты. Однако они игнорируют критический аспект: качество вмешательства (intervention quality). Это способность системы распознать момент, когда старые убеждения пользователя устарели, и корректно обновить контекст, не блокируя полезные обновления и не создавая ложных конфликтов.
Новый набор тестов TWIST (Theorem for Intervention Quality in Conversational Memory) заполняет этот пробел, оценивая работу систем памяти через четыре специфических трека, включая обнаружение напряженности без подсказок и проверку черновиков ответов.
Методология: Hard Negatives и контроль
Ключевая инновация TWIST — использование surface-matched hard negatives (поверхностно-совпадающих сложных негативов). Это позволяет измерить цену ложного вмешательства. Бенчмарк построен на расширении корпуса LoCoMo и включает строгий контроль: за каждый метрик обнаружения противоречий отвечает пара метрик, предотвращающих «пере-детекцию» (когда система помечает всё как ошибку).
Результаты: Тупик между Recall и Specificity
На валидированной человеком выборке Track B v1.0 (161 элемент, коэффициент Каппа 0.85) исследователи выявили фундаментальный компромисс, который не виден в обычных тестах. Ни одна конфигурация не смогла одновременно достичь высокой полноты (recall) и высокой специфичности (specificity) на сложных негативах.
| Тип системы | Contradiction Recall | Hard-Negative Specificity | Проблема |
|---|---|---|---|
| Flat-RAG (базовые модели) | 0.76 – 0.97 | 0.57 – 0.84 (16-43% ложных срабатываний) | Слишком много ложных тревог, блокируя нормальные диалоги. |
| Coherence-oriented (системы согласованности) | ~0.42 (42%) | 0.98 – 1.00 | Идеальная точность, но пропуск половины реальных противоречий. |
Диагностика причин ошибок
Исследование с участием 13 конфигураций показало, что сами противоречия легко обнаруживаются (recall 1.000 при наличии полных данных), а калиброванные модели почти решают задачу при доступе ко всему транскрипту. Это указывает на то, что главная проблема — пробелы в охвате ретривала (retrieval-coverage gaps), а не в логике самой модели. Кроме того, выявлены модельно-зависимые стилистические приоритеты, влияющие на «пол» (floor) производительности.
Значение для индустрии
TWIST вводит понятие «профиля вмешательства». Теперь разработчики могут оценивать не только то, что помнит ИИ, но и то, когда он должен промолчать. Это критически важно для создания безопасных агентов, которые не будут агрессивно «исправлять» пользователей или блокировать легитимные изменения во мнениях.
Источник: arXiv cs.AI ↗
