Проблема линейного роста затрат
Масштабирование больших языковых моделей (LLM) уперлось в фундаментальное ограничение: плотные трансформеры (Dense Transformers) активируют каждый параметр для каждого токена. Это заставляет затраты на обучение и инференс расти линейно с увеличением размера модели, что критично для систем с триллионами параметров. Существующие подходы к масштабированию через Mixture-of-Experts (MoE), такие как ParaScale и AltUp, имеют серьезные недостатки. ParaScale вводит виртуальные токены и параллельные потоки, но страдает от гомогенизации маршрутизации и коллапса градиентов. AltUp использует вспомогательные ветви предсказания, но демонстрирует медленную сходимость и ограниченную адаптивность.
Решение: cMoLLM и динамические свертки
Авторы работы (Xin Yang, Yemin Wang и соавторы) предложили новый взгляд на MoE-слои, переформулировав их как динамические свертки с переменным ядром (variable-kernel dynamic convolutions). В этой архитектуре каждый «эксперт» соответствует сверточному ядру размером $1\times1$, а маршрутизация реализуется через агрегацию ядер, зависящую от входных данных. Полученная архитектура cMoLLM (convolutionally gated Mixture-of-LLMs) обеспечивает полностью дифференцируемую маршрутизацию по потокам, устраняя узкие места традиционных MoE-подходов.
Результаты бенчмарков
Модели стиля GPT-2, обученные на датасете FineWeb, показали превосходство cMoLLM над базовыми линиями (ParaScale и AltUp) при сопоставимых вычислительных затратах. Ключевые метрики улучшений приведены ниже:
| Метрика / Характеристика | cMoLLM | ParaScale | AltUp |
|---|---|---|---|
| Perplexity (языковое моделирование) | Лучший результат | Выше (хуже) | Выше (хуже) |
| Точность GLUE | Выше | Ниже | Ниже |
| Точность SQuAD | Выше | Ниже | Ниже |
| Стабильность оптимизации | Высокая | Коллапс градиентов | Медленная сходимость |
| Использование потоков | Эффективное | Субоптимальное | Ограниченная адаптивность |
Значение для индустрии
Работа демонстрирует, что горизонтальное масштабирование через смешивание LLM на уровне всего конвейера (pipeline-level), а не только в слоях FFN, возможно без катастрофического роста накладных расходов. Переход к динамическим сверткам позволяет сохранять вычислительную эффективность при увеличении емкости модели, что открывает путь к созданию более мощных и экономичных LLM следующего поколения.
Источник: arXiv cs.AI ↗
