Проблема совместимости архитектур
Замена механизма внимания (Attention) в предварительно обученных языковых моделях — это не просто задача оптимизации, а проблема совместимости. Простая замена слоя может нарушить представления (representations), ожидаемые последующими слоями сети, что приведет к деградации модели. Авторы работы TinyCeNN-LM предлагают решение: качественно-ограниченную постобученную конверсию (quality-gated post-training conversion).
Механизм «Прими или откатай»
Ключевая инновация — использование строгих пороговых значений для валидации каждого конвертированного слоя. Система оценивает два критерия: верность представлений (representation fidelity) и перплексность (NLL). Если слой не проходит проверку, он отклоняется, а не адаптируется насильно. Это позволяет сохранить целостность модели, заменяя только те слои, где новая архитектура (CeNN) работает без потерь.
Результаты на SmolLM2 и Qwen3.5
Эксперименты проводились на моделях SmolLM2-135M и Qwen3.5-0.8B. Результаты показывают, что конверсия возможна, но требует консервативного подхода. Например, в SmolLM2-135M слои 0-2 были приняты с кумулятивным изменением NLL (+0.01209), однако слой 3 был отклонен, несмотря на приемлемую перплексность, из-за провала по верности представлений.
| Модель | Конвертированные слои | ΔNLL (изменение) | Изменение Perplexity | Снижение кэша |
|---|---|---|---|---|
| SmolLM2-135M | Слои 0-2 (из 4) | +0.01209 | — | — |
| Qwen3.5-0.8B | Слои 3, 7, 11 | +0.02073 | -0.07% ... +0.93% | до 6.01% |
Практическая польза и точность
Метод Integrated Memory позволяет удерживать перплексность в пределах от -0.07% до +0.93% от оригинала, одновременно снижая объем требуемого кэша до 6.01%. Это делает архитектуру более эффективной для развертывания. При проверке на выборке из 200 задач (downstream sanity check) конвертированные версии Qwen показали общую точность в диапазоне 28.5%–32.0%.
Вывод: эволюция, а не революция
Работа TinyCeNN-LM доказывает, что универсальная замена Attention на клеточно-рекуррентные слои (CeNN) с локальной обработкой и маршрутизацией возможна, но только при условии строгого контроля качества. Это открывает путь к созданию более легких и быстрых LLM без необходимости полного переобучения с нуля.
Источник: arXiv cs.AI ↗
