Проблема «ложной памяти» в LLM
Тестовое обучение (Test-Time Training, TTT) часто хвастается улучшением метрик, но эти показатели не гарантируют, что модель действительно запомнила информацию. Авторы работы из arXiv:2607.00368 вводят поведенческую оценку, которая отделяет адаптацию к потоку данных от реальной способности к запоминанию (memory) и персонализации.
Эксперимент с Qwen3: метрики vs поведение
Исследователи провели контролируемый диагностический тест на моделях Qwen3. Они использовали одношаговые обновления LoRA на спорадических фактах (nonce-facts). Результаты показали критический разрыв:
| Метрика | Результат | Интерпретация |
|---|---|---|
| Support Loss | Снижение | Модель лучше предсказывает контекст |
| Answer Loss | Снижение | Меньше ошибок при генерации ответа |
| Free-form Recall | 0 (Ноль) | Модель не может воспроизвести факт позже |
Новая система оценки
Авторы предлагают «лестницу доказательств» (evidence ladder), которая разделяет три уровня:
- Stream/Domain adaptation: Быстрая подстройка под контекст.
- Bridge internalization: Внутреннее усвоение связей.
- Deployment-time behavioral learning: Настоящее поведение памяти, проверяемое через ретроспективный recall, устойчивость к парафразам и способность использовать знания в downstream-задачах после удаления исходного контекста.
Почему это важно
Без такого фреймворка заявления о «обучении на лету» и «персонализации» остаются маркетинговыми обещаниями. Исследование дает стандарт для проверки: если perplexity падает, но recall равен нулю, модель не запоминает, а просто лучше угадывает следующую токен в текущем контексте.
Источник: arXiv cs.CL ↗
