Исследования8 сентября 2026 г., 00:16 МСК🤖 Auto

Анатомию гибридных LLM: Attention помнит факты, Recurrence — стиль

Исследование Qwen3.5 и Falcon-H1 показало, что гибридные модели строго разделяют функции: внимание отвечает за точное извлечение данных, а рекуррентное состояние — за язык и персону.

Баннер новости 6970

Разделение труда в гибридных архитектурах

Гибридные языковые модели (LLM), сочетающие механизм внимания (Attention) с фиксированным рекуррентным состоянием (Recurrence), долгое время оставались «черным ящиком» в плане распределения функций. Исследование, принятое к публикации в Findings of EMNLP 2026, вводит два метода кэширования (cache-level interventions), позволяющих изолировать каналы: Split-prefill (сохранение только KV-кэша или только рекуррентного состояния) и State-swap (обмен состояниями между контекстами в одном проходе).

Экспериментальные метрики: точность против стиля

На моделях Qwen3.5 и Falcon-H1 авторы выявили резкое разделение ролей. Точное извлечение фактов (exact retrieval) возможно исключительно через механизм внимания. При отключении внимания точность падает до нуля, тогда как при использовании только внимания сохраняется 64–98% от полной точности модели.

Парадоксально, но рекуррентное состояние отвечает за лингвистическую форму. Если оставить только KV-кэш, точность языка падает до ~1%. Однако рекуррентное состояние сохраняет 70–80% точности языка и позволяет модели генерировать ответы с персонификацией (усиление в 3–5 раз). Эксперимент State-swap подтвердил причинно-следственную связь: ответ берет фактическое значение из KV-кэша, а язык — из рекуррентного состояния.

Метрика / Характеристика Роль Attention (KV-кэш) Роль Recurrence (Состояние)
Точное извлечение фактов 64–98% от полной точности 0% (полный коллапс)
Точность языка (Output language) ~1% 70–80%
Персонализация ответа Низкая Усиление в 3–5 раз
Генерация новых слов Только из контекста Семантически связанные слова

Почему это важно для индустрии

Результаты меняют понимание оптимизации гибридных моделей. Attention работает как система поиска по записанному контексту, а Recurrence формирует то, как модель «говорит» дальше. Это открывает пути для тонкой настройки: можно оптимизировать память для фактологической точности, не жертвуя стилистикой, и наоборот. Исследование также показывает, что рекуррентное состояние способно генерировать слова, отсутствующие в контексте, но семантически связанные с ними, что расширяет возможности креативной генерации в гибридных архитектурах.

Источник: arXiv cs.CL ↗