Проблема переноса знаний в LLM
Существующие методы улучшения работы больших языковых моделей делятся на два лагеря: непараметрический поиск (внешние базы знаний) и параметрическая адаптация (дообучение весов). Первые добавляют задержку и шум в контекст, вторые «запекают» знания в веса, делая их труднодоступными для аудита и переноса. Авторы статьи предлагают промежуточное решение — Engram: хэшированную внешнюю память, которая хранится в таблице, но потребляется через небольшую обучаемую нейросеть-«читатель» (reader).
Суть эксперимента: кросс-модельный перенос
Исследователи (Mingyuan Li, Guangsheng Yu и др.) поставили вопрос: при переносе памяти из одной модели в другую что важнее — сама замороженная таблица знаний или интерфейс её чтения? В эксперименте память, обученная на исходной модели, замораживалась и прикреплялась к другой модели. Адаптировалась только легковесная часть — reader. Результаты показали, что без reader, выровненного под целевую модель, таблица становится бесполезной.
Ключевые метрики и результаты
Для оценки использовалась задача вопросно-ответного поиска (QA). Применение двухслойного reader с четырьмя ветвями (dual-layer, four-branch) позволило практически нивелировать разрыв между использованием памяти внутри одной модели и её переносом на другую. Средняя оценка составила 38.8 по контролируемой протоколу оценки.
| Компонент системы | Роль в кросс-модельном переносе | Влияние на результат |
|---|---|---|
| Engram Table (Память) | Хранит закодированные знания (хэши) | Необходимый, но недостаточный ресурс |
| Source Reader | Интерфейс чтения для исходной модели | Не совместим напрямую с новыми моделями |
| Target Reader (Адаптированный) | Легковесная сеть, обученная под целевую модель | Ключевой фактор успеха; закрывает разрыв в точности |
| Результат (QA Score) | Средний балл в тестовой выборке | 38.8 (приближение к уровню same-model) |
Практическая значимость
Работа демонстрирует, что Engram может служить переиспользуемым внешним артефактом знаний. Если интерфейс reader совместим с целевой моделью, память полезна сразу. Если нет — легковесная донастройка reader на стороне целевой модели дает существенный прирост. Это открывает путь к созданию модульных систем знаний, не требующих полного переобучения LLM.
Источник: arXiv cs.CL ↗
