Проблема «тихого искажения» памяти
Постоянная память (persistent memory) позволяет персонализировать LLM-агентов, но некорректное обновление данных может незаметно исказить будущее поведение модели. Авторы исследования из arXiv (2026) изучают границу «уточнения памяти»: когда полученная в ходе взаимодействия информация должна быть сохранена, использована только в текущем контексте, перепроверена или уточнена у пользователя.
Ключевая проблема, которую решают авторы, — это риск того, что модель запомнит ложную или устаревшую информацию и будет действовать на её основе, не подозревая об ошибке.
Датасет MCB: 140 сценариев и высокая надежность
Для оценки предложен датасет Memory Commitment Boundary (MCB). Он включает:
- 140 основных сценариев (70 для разработки, 70 — скрытых для тестирования).
- 70 элементов контрастного набора для проверки устойчивости оценок.
- Оценка как меток действий (action labels), так и выбора структурированных вызовов инструментов (tool-call selection).
Надежность разметки подтверждена высоким согласием: два независимых аннотатора достигли согласия в 97.1% случаев (коэффициент Каппы Коэна = 0.962). Третий слепой эксперт разрешил 4 разногласия, заменив 8 меток авторов.
Результаты: Qwen против Claude
Исследование показало существенные различия в поведении семейств моделей Qwen и Claude при работе с фактами. Qwen демонстрирует высокую надежность при проверке изменяющихся фактов, но критически низкую способность запрашивать уточнения у пользователя.
| Метрика / Модель | Результат | Комментарий |
|---|---|---|
| Qwen (базовый) — Запросы на уточнение | 0 / 12 | Модель вообще не запрашивает уточнений в тестовых сценариях. |
| Qwen (базовый) — Проверка свежести | 12 / 18 | Относительно хорошо проверяет устаревшие факты. |
| Qwen (Few-shot) — Точность | 0.557 → 0.771 | Рост на +0.214 (p_H = 0.002) после применения few-shot промптинга. |
| Qwen (Few-shot) — Recall уточнений | 0.333 | Даже с улучшением точности, способность находить неоднозначности остается низкой. |
| Qwen (Policy Prompt) — Ошибочное сохранение | 0.243 → 0.100 | Снижение числа ложных запоминаний (p_H = 0.038), но без значимого роста общей точности. |
| Согласие меток и инструментов (Claude) | 57% | Модели Claude лучше согласуют заявленные решения с выбором инструментов. |
| Согласие меток и инструментов (Qwen) | 23% | Низкое согласование. Точность Qwen падает с 0.557 до 0.343 при оценке tool-call (p_H = 0.047). |
Почему это важно для разработчиков
Результаты показывают, что оценка памяти LLM-агентов не может ограничиваться только проверкой заявленных решений (labels). Необходимо тестировать и выбор инструментов (tool-call choices), так как именно они реализуют действие. Для Qwen разрыв между заявленным намерением и реальным действием (вызовом инструмента) составляет критические 34 процентных пункта.
Применение policy prompt (политики промптинга) эффективно снижает количество ошибочных сохранений данных, но не решает проблему фундаментальной неспособности модели «признать незнание» и спросить пользователя. Это указывает на необходимость доработки архитектурных решений для агентов, работающих с динамическими данными.
Источник: arXiv cs.CL ↗
