Полный отказ от устоявшихся паттернов
Команда исследователей во главе с Aryuemaan Kumar Chowdhury представила Wiola — архитектуру Small Language Model (SLM), которая не имеет структурного родства с популярными семействами GPT, LLaMA, Mistral или Falcon. Модель разработана «с чистого листа» (from first principles) и включает пять независимых нововведений, направленных на оптимизацию вычислений и сохранение контекста.
Пять ключевых инноваций Wiola
Архитектура выделяется следующими компонентами:
- Spiral Rotary Positional Encoding (SRPE): Встраивает позиции токенов на трехмерной спиральной многообразной структуре, объединяя абсолютные, относительные и иерархические сигналы.
- Gated Cross-Layer Attention (GCLA): Позволяет каждому декодерному слою получать мягкий кросс-аттеншн к сжатым сводкам двух предыдущих слоев, улучшая согласованность между слоями.
- Adaptive Token Merging (ATM): Динамически объединяет семантически избыточные соседние токены в средних слоях сети, снижая сложность внимания без потери информации.
- Dual Stream Feed-Forward (DSFF): Заменяет стандартный MLP двумя параллельными потоками, которые объединяются с помощью обучаемого померного гейта.
- WiolaRMSNorm: Модифицированная нормализация с добавленным померным смещением (offset vector), предотвращающим коллапс представлений.
Масштабы и совместимость
Wiola выпускается в четырех размерах, что делает её подходящей для различных сценариев развертывания, включая edge-устройства. Все модели полностью совместимы с экосистемой HuggingFace Transformers, и 22 архитектурных юнит-теста прошли успешно.
| Модель Wiola | Количество параметров | Ключевая особенность |
|---|---|---|
| Wiola-small | 120M | Максимальная эффективность для мобильных устройств |
| Wiola-medium | 360M | Баланс скорости и качества |
| Wiola-large | 700M | Улучшенное понимание контекста |
| Wiola-xl | 1.5B | Максимальная точность в классе SLM |
Сравнение с базовыми моделями
В работе представлены систематические сравнения Wiola с базовыми версиями GPT-2, LLaMA-2 и Mistral. Исследователи предоставили полные математические выводы, диаграммы архитектурных блоков и анализ вычислительной сложности, демонстрируя, что новый подход позволяет достичь конкурентоспособных результатов при меньших вычислительных затратах за счет механизмов ATM и GCLA.
Источник: arXiv cs.AI ↗
