Исследования22 августа 2026 г., 05:18 МСК🤖 Auto

Память LLM: Qwen и Claude тестируют границы доверия к данным

Исследователи представили MCB — датасет из 140 сценариев для оценки того, как LLM-агенты решают: запомнить факт, проверить его или спросить пользователя. Qwen оказался склонен к слепому запоминанию, а Claude — к излишней осторожности.

Баннер новости 6288

Проблема «тихого искажения» памяти

Постоянная память (persistent memory) позволяет персонализировать LLM-агентов, но некорректное обновление данных может незаметно исказить будущее поведение модели. Авторы исследования из arXiv (2026) изучают границу «уточнения памяти»: когда полученная в ходе взаимодействия информация должна быть сохранена, использована только в текущем контексте, перепроверена или уточнена у пользователя.

Ключевая проблема, которую решают авторы, — это риск того, что модель запомнит ложную или устаревшую информацию и будет действовать на её основе, не подозревая об ошибке.

Датасет MCB: 140 сценариев и высокая надежность

Для оценки предложен датасет Memory Commitment Boundary (MCB). Он включает:

  • 140 основных сценариев (70 для разработки, 70 — скрытых для тестирования).
  • 70 элементов контрастного набора для проверки устойчивости оценок.
  • Оценка как меток действий (action labels), так и выбора структурированных вызовов инструментов (tool-call selection).

Надежность разметки подтверждена высоким согласием: два независимых аннотатора достигли согласия в 97.1% случаев (коэффициент Каппы Коэна = 0.962). Третий слепой эксперт разрешил 4 разногласия, заменив 8 меток авторов.

Результаты: Qwen против Claude

Исследование показало существенные различия в поведении семейств моделей Qwen и Claude при работе с фактами. Qwen демонстрирует высокую надежность при проверке изменяющихся фактов, но критически низкую способность запрашивать уточнения у пользователя.

Метрика / Модель Результат Комментарий
Qwen (базовый) — Запросы на уточнение 0 / 12 Модель вообще не запрашивает уточнений в тестовых сценариях.
Qwen (базовый) — Проверка свежести 12 / 18 Относительно хорошо проверяет устаревшие факты.
Qwen (Few-shot) — Точность 0.557 → 0.771 Рост на +0.214 (p_H = 0.002) после применения few-shot промптинга.
Qwen (Few-shot) — Recall уточнений 0.333 Даже с улучшением точности, способность находить неоднозначности остается низкой.
Qwen (Policy Prompt) — Ошибочное сохранение 0.243 → 0.100 Снижение числа ложных запоминаний (p_H = 0.038), но без значимого роста общей точности.
Согласие меток и инструментов (Claude) 57% Модели Claude лучше согласуют заявленные решения с выбором инструментов.
Согласие меток и инструментов (Qwen) 23% Низкое согласование. Точность Qwen падает с 0.557 до 0.343 при оценке tool-call (p_H = 0.047).

Почему это важно для разработчиков

Результаты показывают, что оценка памяти LLM-агентов не может ограничиваться только проверкой заявленных решений (labels). Необходимо тестировать и выбор инструментов (tool-call choices), так как именно они реализуют действие. Для Qwen разрыв между заявленным намерением и реальным действием (вызовом инструмента) составляет критические 34 процентных пункта.

Применение policy prompt (политики промптинга) эффективно снижает количество ошибочных сохранений данных, но не решает проблему фундаментальной неспособности модели «признать незнание» и спросить пользователя. Это указывает на необходимость доработки архитектурных решений для агентов, работающих с динамическими данными.

Источник: arXiv cs.CL ↗