Исследования29 июля 2026 г., 04:18 МСК🤖 Auto

cMoLLM: Горизонтальное масштабирование MoE через динамические свертки

Исследователи представили cMoLLM — архитектуру, заменяющую стандартные FFN-эксперты на динамические свертки, что устраняет проблемы гомогенизации маршрутизации и коллапса градиентов в больших языковых моделях.

Баннер новости 4594

Проблема линейного роста затрат

Масштабирование больших языковых моделей (LLM) уперлось в фундаментальное ограничение: плотные трансформеры (Dense Transformers) активируют каждый параметр для каждого токена. Это заставляет затраты на обучение и инференс расти линейно с увеличением размера модели, что критично для систем с триллионами параметров. Существующие подходы к масштабированию через Mixture-of-Experts (MoE), такие как ParaScale и AltUp, имеют серьезные недостатки. ParaScale вводит виртуальные токены и параллельные потоки, но страдает от гомогенизации маршрутизации и коллапса градиентов. AltUp использует вспомогательные ветви предсказания, но демонстрирует медленную сходимость и ограниченную адаптивность.

Решение: cMoLLM и динамические свертки

Авторы работы (Xin Yang, Yemin Wang и соавторы) предложили новый взгляд на MoE-слои, переформулировав их как динамические свертки с переменным ядром (variable-kernel dynamic convolutions). В этой архитектуре каждый «эксперт» соответствует сверточному ядру размером $1\times1$, а маршрутизация реализуется через агрегацию ядер, зависящую от входных данных. Полученная архитектура cMoLLM (convolutionally gated Mixture-of-LLMs) обеспечивает полностью дифференцируемую маршрутизацию по потокам, устраняя узкие места традиционных MoE-подходов.

Результаты бенчмарков

Модели стиля GPT-2, обученные на датасете FineWeb, показали превосходство cMoLLM над базовыми линиями (ParaScale и AltUp) при сопоставимых вычислительных затратах. Ключевые метрики улучшений приведены ниже:

Метрика / Характеристика cMoLLM ParaScale AltUp
Perplexity (языковое моделирование) Лучший результат Выше (хуже) Выше (хуже)
Точность GLUE Выше Ниже Ниже
Точность SQuAD Выше Ниже Ниже
Стабильность оптимизации Высокая Коллапс градиентов Медленная сходимость
Использование потоков Эффективное Субоптимальное Ограниченная адаптивность

Значение для индустрии

Работа демонстрирует, что горизонтальное масштабирование через смешивание LLM на уровне всего конвейера (pipeline-level), а не только в слоях FFN, возможно без катастрофического роста накладных расходов. Переход к динамическим сверткам позволяет сохранять вычислительную эффективность при увеличении емкости модели, что открывает путь к созданию более мощных и экономичных LLM следующего поколения.

Источник: arXiv cs.AI ↗