Релиз модели3 июля 2026 г., 11:16 МСК🤖 Auto

Wiola: Новая архитектура SLM без наследия GPT/LLaMA

Исследователи представили Wiola — архитектуру малых языковых моделей (SLM), созданную с нуля. Она использует 5 инновационных компонентов для повышения эффективности и совместима с HuggingFace.

Баннер новости 2833

Полный отказ от устоявшихся паттернов

Команда исследователей во главе с Aryuemaan Kumar Chowdhury представила Wiola — архитектуру Small Language Model (SLM), которая не имеет структурного родства с популярными семействами GPT, LLaMA, Mistral или Falcon. Модель разработана «с чистого листа» (from first principles) и включает пять независимых нововведений, направленных на оптимизацию вычислений и сохранение контекста.

Пять ключевых инноваций Wiola

Архитектура выделяется следующими компонентами:

  • Spiral Rotary Positional Encoding (SRPE): Встраивает позиции токенов на трехмерной спиральной многообразной структуре, объединяя абсолютные, относительные и иерархические сигналы.
  • Gated Cross-Layer Attention (GCLA): Позволяет каждому декодерному слою получать мягкий кросс-аттеншн к сжатым сводкам двух предыдущих слоев, улучшая согласованность между слоями.
  • Adaptive Token Merging (ATM): Динамически объединяет семантически избыточные соседние токены в средних слоях сети, снижая сложность внимания без потери информации.
  • Dual Stream Feed-Forward (DSFF): Заменяет стандартный MLP двумя параллельными потоками, которые объединяются с помощью обучаемого померного гейта.
  • WiolaRMSNorm: Модифицированная нормализация с добавленным померным смещением (offset vector), предотвращающим коллапс представлений.

Масштабы и совместимость

Wiola выпускается в четырех размерах, что делает её подходящей для различных сценариев развертывания, включая edge-устройства. Все модели полностью совместимы с экосистемой HuggingFace Transformers, и 22 архитектурных юнит-теста прошли успешно.

Модель Wiola Количество параметров Ключевая особенность
Wiola-small 120M Максимальная эффективность для мобильных устройств
Wiola-medium 360M Баланс скорости и качества
Wiola-large 700M Улучшенное понимание контекста
Wiola-xl 1.5B Максимальная точность в классе SLM

Сравнение с базовыми моделями

В работе представлены систематические сравнения Wiola с базовыми версиями GPT-2, LLaMA-2 и Mistral. Исследователи предоставили полные математические выводы, диаграммы архитектурных блоков и анализ вычислительной сложности, демонстрируя, что новый подход позволяет достичь конкурентоспособных результатов при меньших вычислительных затратах за счет механизмов ATM и GCLA.

Источник: arXiv cs.AI ↗