Исследования2 июля 2026 г., 14:17 МСК🤖 Auto

Память LLM — иллюзия: Qwen3 обновляется, но не запоминает

Исследование arXiv:2607.00368 вскрывает разрыв между метриками обучения на лету (TTT) и реальной способностью моделей сохранять информацию. Qwen3 снижает perplexity, но выдает нулевое воспроизведение фактов.

Баннер новости 2803

Проблема «ложной памяти» в LLM

Тестовое обучение (Test-Time Training, TTT) часто хвастается улучшением метрик, но эти показатели не гарантируют, что модель действительно запомнила информацию. Авторы работы из arXiv:2607.00368 вводят поведенческую оценку, которая отделяет адаптацию к потоку данных от реальной способности к запоминанию (memory) и персонализации.

Эксперимент с Qwen3: метрики vs поведение

Исследователи провели контролируемый диагностический тест на моделях Qwen3. Они использовали одношаговые обновления LoRA на спорадических фактах (nonce-facts). Результаты показали критический разрыв:

Метрика Результат Интерпретация
Support Loss Снижение Модель лучше предсказывает контекст
Answer Loss Снижение Меньше ошибок при генерации ответа
Free-form Recall 0 (Ноль) Модель не может воспроизвести факт позже

Новая система оценки

Авторы предлагают «лестницу доказательств» (evidence ladder), которая разделяет три уровня:

  • Stream/Domain adaptation: Быстрая подстройка под контекст.
  • Bridge internalization: Внутреннее усвоение связей.
  • Deployment-time behavioral learning: Настоящее поведение памяти, проверяемое через ретроспективный recall, устойчивость к парафразам и способность использовать знания в downstream-задачах после удаления исходного контекста.

Почему это важно

Без такого фреймворка заявления о «обучении на лету» и «персонализации» остаются маркетинговыми обещаниями. Исследование дает стандарт для проверки: если perplexity падает, но recall равен нулю, модель не запоминает, а просто лучше угадывает следующую токен в текущем контексте.

Источник: arXiv cs.CL ↗