Исследования3 сентября 2026 г., 08:18 МСК🤖 Auto

Memory Trust Gap: Почему большие модели Qwen3 доверяют устаревшим данным

Исследование arXiv выявило критический дефект в агентах с долговременной памятью: чем мощнее модель, тем выше риск слепого доверия устаревшим фактам. На примере Qwen3 показано, что масштабирование не решает проблему, а усугубляет её в сценариях безоп

Баннер новости 6656

Суть проблемы: «Разрыв доверия к памяти»

Исследователи Jundong Hu и Shekar Ramachandran из arXiv (preprint от 1 сентября 2026 года) провели анализ агентов с персистентной (долговременной) памятью. Главный вывод: старые, устаревшие факты, сохраненные в памяти агента, могут перебивать текущие авторитетные данные без предупреждения. Это явление авторы назвали Memory Trust Gap (Разрыв доверия к памяти). Важно отметить, что проблема заключается не в непонимании модели, а в избыточном доверии (over-trust) к сохраненной информации.

Методология и бенчмарки

Для тестирования использовалась серия моделей Qwen3 (0.6B, 1.7B, 4B, 8B) и независимая серия Llama-Instruct. Эксперимент строился на замкнутом наборе данных с двумя ключевыми сценариями:

  • Benefit Suite (Выгода): Задачи, которые невозможно решить без использования сохраненного факта. Здесь модель должна полагаться на память.
  • Safety Suite (Безопасность): Задачи, где всегда есть авторитетный инструмент (tool), дающий верный ответ. Здесь память может содержать ловушку (устаревшие данные, выданные за актуальные).

Ключевые метрики и результаты

Исследование показало четкую зависимость ошибок от размера модели. В сценариях «Безопасности» крупные модели (8B) демонстрируют коллапс точности при наличии устаревших данных, если они маскируются под актуальные. Ниже приведена сводка поведения моделей Qwen3 в зависимости от масштаба:

Модель (Qwen3) Benefit Suite (Доверие к памяти) Safety Suite (Риск устаревших данных) Реакция на метаданные
0.6B / 1.7B / 4B Используют устаревшее значение в 92-100% случаев Относительно устойчивы, если конфликт разрешен заранее Показывают лучшую точность, если конфликт устранен до запроса
8B Используют устаревшее значение в 92-100% случаев Критический сбой: доверяют устаревшим данным, выданным за новые Демонстрация метаданных улучшает точность

Дополнительные факторы, влияющие на ошибки:

  • Актуальность даты: Если устаревшая запись помечена как «новая», крупные модели обманываются чаще.
  • Источник: Авторитетность источника слабо влияет на решение (scale-flat feature).
  • Позиция: Влияние позиции информации меняется от положительного к отрицательному по мере роста модели.

Почему это важно для индустрии

Результаты подтверждают, что добавление долговременной памяти в LLM-агентов создает новые векторы уязвимости. Простое масштабирование модели (увеличение параметров) не устраняет проблему доверия к памяти, а в некоторых сценариях (Safety Suite) делает агента более уязвимым к манипуляциям через устаревшие данные.

Единственный эффективный метод mitigations для малых моделей — предварительное разрешение конфликтов памяти. Для больших моделей помогает экспозиция метаданных. Исследование также подтвердило эти паттерны на внешних датасетах RGB и MisBench, что указывает на системный характер проблемы, а не артефакт конкретной архитектуры.

Источник: arXiv cs.AI ↗