Исследования21 сентября 2026 г., 09:19 МСК🤖 Auto

TinyCeNN-LM: Как заменить Attention без потери качества

Исследователи представили TinyCeNN-LM — метод постобученной конверсии LLM, заменяющий механизм внимания на клеточно-рекуррентные слои (CeNN) с жестким контролем качества.

Баннер новости 7922

Проблема совместимости архитектур

Замена механизма внимания (Attention) в предварительно обученных языковых моделях — это не просто задача оптимизации, а проблема совместимости. Простая замена слоя может нарушить представления (representations), ожидаемые последующими слоями сети, что приведет к деградации модели. Авторы работы TinyCeNN-LM предлагают решение: качественно-ограниченную постобученную конверсию (quality-gated post-training conversion).

Механизм «Прими или откатай»

Ключевая инновация — использование строгих пороговых значений для валидации каждого конвертированного слоя. Система оценивает два критерия: верность представлений (representation fidelity) и перплексность (NLL). Если слой не проходит проверку, он отклоняется, а не адаптируется насильно. Это позволяет сохранить целостность модели, заменяя только те слои, где новая архитектура (CeNN) работает без потерь.

Результаты на SmolLM2 и Qwen3.5

Эксперименты проводились на моделях SmolLM2-135M и Qwen3.5-0.8B. Результаты показывают, что конверсия возможна, но требует консервативного подхода. Например, в SmolLM2-135M слои 0-2 были приняты с кумулятивным изменением NLL (+0.01209), однако слой 3 был отклонен, несмотря на приемлемую перплексность, из-за провала по верности представлений.

Модель Конвертированные слои ΔNLL (изменение) Изменение Perplexity Снижение кэша
SmolLM2-135M Слои 0-2 (из 4) +0.01209
Qwen3.5-0.8B Слои 3, 7, 11 +0.02073 -0.07% ... +0.93% до 6.01%

Практическая польза и точность

Метод Integrated Memory позволяет удерживать перплексность в пределах от -0.07% до +0.93% от оригинала, одновременно снижая объем требуемого кэша до 6.01%. Это делает архитектуру более эффективной для развертывания. При проверке на выборке из 200 задач (downstream sanity check) конвертированные версии Qwen показали общую точность в диапазоне 28.5%–32.0%.

Вывод: эволюция, а не революция

Работа TinyCeNN-LM доказывает, что универсальная замена Attention на клеточно-рекуррентные слои (CeNN) с локальной обработкой и маршрутизацией возможна, но только при условии строгого контроля качества. Это открывает путь к созданию более легких и быстрых LLM без необходимости полного переобучения с нуля.

Источник: arXiv cs.AI ↗