Суть проблемы: «Разрыв доверия к памяти»
Исследователи Jundong Hu и Shekar Ramachandran из arXiv (preprint от 1 сентября 2026 года) провели анализ агентов с персистентной (долговременной) памятью. Главный вывод: старые, устаревшие факты, сохраненные в памяти агента, могут перебивать текущие авторитетные данные без предупреждения. Это явление авторы назвали Memory Trust Gap (Разрыв доверия к памяти). Важно отметить, что проблема заключается не в непонимании модели, а в избыточном доверии (over-trust) к сохраненной информации.
Методология и бенчмарки
Для тестирования использовалась серия моделей Qwen3 (0.6B, 1.7B, 4B, 8B) и независимая серия Llama-Instruct. Эксперимент строился на замкнутом наборе данных с двумя ключевыми сценариями:
- Benefit Suite (Выгода): Задачи, которые невозможно решить без использования сохраненного факта. Здесь модель должна полагаться на память.
- Safety Suite (Безопасность): Задачи, где всегда есть авторитетный инструмент (tool), дающий верный ответ. Здесь память может содержать ловушку (устаревшие данные, выданные за актуальные).
Ключевые метрики и результаты
Исследование показало четкую зависимость ошибок от размера модели. В сценариях «Безопасности» крупные модели (8B) демонстрируют коллапс точности при наличии устаревших данных, если они маскируются под актуальные. Ниже приведена сводка поведения моделей Qwen3 в зависимости от масштаба:
| Модель (Qwen3) | Benefit Suite (Доверие к памяти) | Safety Suite (Риск устаревших данных) | Реакция на метаданные |
|---|---|---|---|
| 0.6B / 1.7B / 4B | Используют устаревшее значение в 92-100% случаев | Относительно устойчивы, если конфликт разрешен заранее | Показывают лучшую точность, если конфликт устранен до запроса |
| 8B | Используют устаревшее значение в 92-100% случаев | Критический сбой: доверяют устаревшим данным, выданным за новые | Демонстрация метаданных улучшает точность |
Дополнительные факторы, влияющие на ошибки:
- Актуальность даты: Если устаревшая запись помечена как «новая», крупные модели обманываются чаще.
- Источник: Авторитетность источника слабо влияет на решение (scale-flat feature).
- Позиция: Влияние позиции информации меняется от положительного к отрицательному по мере роста модели.
Почему это важно для индустрии
Результаты подтверждают, что добавление долговременной памяти в LLM-агентов создает новые векторы уязвимости. Простое масштабирование модели (увеличение параметров) не устраняет проблему доверия к памяти, а в некоторых сценариях (Safety Suite) делает агента более уязвимым к манипуляциям через устаревшие данные.
Единственный эффективный метод mitigations для малых моделей — предварительное разрешение конфликтов памяти. Для больших моделей помогает экспозиция метаданных. Исследование также подтвердило эти паттерны на внешних датасетах RGB и MisBench, что указывает на системный характер проблемы, а не артефакт конкретной архитектуры.
Источник: arXiv cs.AI ↗
