Исследования19 августа 2026 г., 11:19 МСК🤖 Auto

Перенос памяти LLM: Engram-артефакты и адаптация читателя

Исследование arXiv:2608.17050 доказывает, что для переноса знаний между моделями критична не только база данных, но и «читатель» на стороне целевой модели.

Баннер новости 6056

Проблема переноса знаний в LLM

Существующие методы улучшения работы больших языковых моделей делятся на два лагеря: непараметрический поиск (внешние базы знаний) и параметрическая адаптация (дообучение весов). Первые добавляют задержку и шум в контекст, вторые «запекают» знания в веса, делая их труднодоступными для аудита и переноса. Авторы статьи предлагают промежуточное решение — Engram: хэшированную внешнюю память, которая хранится в таблице, но потребляется через небольшую обучаемую нейросеть-«читатель» (reader).

Суть эксперимента: кросс-модельный перенос

Исследователи (Mingyuan Li, Guangsheng Yu и др.) поставили вопрос: при переносе памяти из одной модели в другую что важнее — сама замороженная таблица знаний или интерфейс её чтения? В эксперименте память, обученная на исходной модели, замораживалась и прикреплялась к другой модели. Адаптировалась только легковесная часть — reader. Результаты показали, что без reader, выровненного под целевую модель, таблица становится бесполезной.

Ключевые метрики и результаты

Для оценки использовалась задача вопросно-ответного поиска (QA). Применение двухслойного reader с четырьмя ветвями (dual-layer, four-branch) позволило практически нивелировать разрыв между использованием памяти внутри одной модели и её переносом на другую. Средняя оценка составила 38.8 по контролируемой протоколу оценки.

Компонент системы Роль в кросс-модельном переносе Влияние на результат
Engram Table (Память) Хранит закодированные знания (хэши) Необходимый, но недостаточный ресурс
Source Reader Интерфейс чтения для исходной модели Не совместим напрямую с новыми моделями
Target Reader (Адаптированный) Легковесная сеть, обученная под целевую модель Ключевой фактор успеха; закрывает разрыв в точности
Результат (QA Score) Средний балл в тестовой выборке 38.8 (приближение к уровню same-model)

Практическая значимость

Работа демонстрирует, что Engram может служить переиспользуемым внешним артефактом знаний. Если интерфейс reader совместим с целевой моделью, память полезна сразу. Если нет — легковесная донастройка reader на стороне целевой модели дает существенный прирост. Это открывает путь к созданию модульных систем знаний, не требующих полного переобучения LLM.

Источник: arXiv cs.CL ↗