Релиз модели18 августа 2026 г., 11:17 МСК🤖 Auto

Wiola 13M: Архитектура для сверхмалых LLM с 3 инновациями

Исследователи представили Wiola 13M — декодерную модель с 13 млн параметров, использующую Gated Spiral Attention для эффективного обучения на устройствах без потери точности.

Баннер новости 5979

Проблема масштабирования малых моделей

Языковые модели с количеством параметров от 10 до 100 миллионов привлекательны для локального инференса и быстрых экспериментов, однако большинство из них просто копируют стандартный блок Transformer, не адаптируя его под малый масштаб. Это приводит к неэффективному использованию ресурсов и ухудшению качества на коротких контекстах. Авторы работы предлагают решение — архитектуру Wiola, которая меняет три ключевых компонента каждого слоя.

Три инновационных компонента Wiola

Новизна модели сосредоточена в трех модулях, заменяющих стандартные элементы:

  • Spiral Rotary Positional Encoding (Spiral RoPE): Модификация стандартных частот Rotary, где добавляется медленно растущий пер-дименсиональный фактор. Это заставляет фазовые траектории расходиться, улучшая распознавание дальних зависимостей (long-range discrimination) без добавления новых параметров.
  • Gated Spiral Attention: Вводит скалярный гейт на голову (per head), зависящий от контента. Гейт вычисляется на основе каузальной кумулятивной статистики потока запросов (query stream). Это обеспечивает мягкий выбор голов (soft head selection) с минимальными вычислительными затратами.
  • Butterfly Feed-Forward Block: Заменяет стандартный слой расширения на мультипликативное взаимодействие и внутриблочный bypass-путь. Это улучшает поток градиентов в неглубоких стеках, сохраняя количество параметров на уровне блока с четырехкратным Gated Linear Unit (GLU).

Математическая строгость и эффективность

Авторы не только описывают архитектуру, но и формализуют бюджеты параметров и вычислений. Ключевое преимущество Wiola — доказанное точное и численно верифицированное эквивалентность между полным обучением последовательности (full sequence training) и кэшированным авторегрессионным декодированием. Это означает, что при инференсе не используется никаких аппроксимаций, что критично для стабильности работы на edge-устройствах.

Результаты и доступность

Модель обучена и протестирована на стандартном корпусе Tiny Story. Исследователи опубликовали полностью воспроизводимый протокол обучения и оценки. Референсная реализация доступна как open-source пакет, готовый к публикации весов.

Компонент Стандартный Transformer Wiola 13M Преимущество
Позиционное кодирование RoPE (стандартное) Spiral RoPE Улучшение дальних зависимостей без доп. параметров
Attention Standard Multi-Head Gated Spiral Attention Контент-адаптивный выбор голов, низкая стоимость
Feed-Forward MLP / GLU Butterfly Block Лучший градиентный поток, компактность

Источник: arXiv cs.CL ↗