Разделение труда в гибридных архитектурах
Гибридные языковые модели (LLM), сочетающие механизм внимания (Attention) с фиксированным рекуррентным состоянием (Recurrence), долгое время оставались «черным ящиком» в плане распределения функций. Исследование, принятое к публикации в Findings of EMNLP 2026, вводит два метода кэширования (cache-level interventions), позволяющих изолировать каналы: Split-prefill (сохранение только KV-кэша или только рекуррентного состояния) и State-swap (обмен состояниями между контекстами в одном проходе).
Экспериментальные метрики: точность против стиля
На моделях Qwen3.5 и Falcon-H1 авторы выявили резкое разделение ролей. Точное извлечение фактов (exact retrieval) возможно исключительно через механизм внимания. При отключении внимания точность падает до нуля, тогда как при использовании только внимания сохраняется 64–98% от полной точности модели.
Парадоксально, но рекуррентное состояние отвечает за лингвистическую форму. Если оставить только KV-кэш, точность языка падает до ~1%. Однако рекуррентное состояние сохраняет 70–80% точности языка и позволяет модели генерировать ответы с персонификацией (усиление в 3–5 раз). Эксперимент State-swap подтвердил причинно-следственную связь: ответ берет фактическое значение из KV-кэша, а язык — из рекуррентного состояния.
| Метрика / Характеристика | Роль Attention (KV-кэш) | Роль Recurrence (Состояние) |
|---|---|---|
| Точное извлечение фактов | 64–98% от полной точности | 0% (полный коллапс) |
| Точность языка (Output language) | ~1% | 70–80% |
| Персонализация ответа | Низкая | Усиление в 3–5 раз |
| Генерация новых слов | Только из контекста | Семантически связанные слова |
Почему это важно для индустрии
Результаты меняют понимание оптимизации гибридных моделей. Attention работает как система поиска по записанному контексту, а Recurrence формирует то, как модель «говорит» дальше. Это открывает пути для тонкой настройки: можно оптимизировать память для фактологической точности, не жертвуя стилистикой, и наоборот. Исследование также показывает, что рекуррентное состояние способно генерировать слова, отсутствующие в контексте, но семантически связанные с ними, что расширяет возможности креативной генерации в гибридных архитектурах.
Источник: arXiv cs.CL ↗
