Проблема масштабируемости и решение через спарсность
Традиционные плотные (dense) модели сталкиваются с экспоненциальным ростом вычислительных затрат при увеличении числа параметров. Архитектура Mixture of Experts (MoE) решает эту проблему, заменяя единый плотный слой feed-forward network (FFN) на набор из N параллельных «экспертных» сетей. Ключевой механизм — спарсный гейтинг (sparse gating): для каждого входного токена маршрутизатор (router) выбирает только топ-k экспертов, которые будут активны. Остальные параметры остаются неактивными, что радикально снижает стоимость инференса.
Математика эффективности: от 8x параметров к 2x вычислений
Суть оптимизации кроется в соотношении общего числа параметров и фактических вычислений (FLOPs). При использовании 8 экспертов (N=8) и выборе топ-2 (k=2) для обработки токена, модель использует лишь 25% своих параметров. Это позволяет увеличить емкость модели в 8 раз, увеличив затраты на вычисления всего в 2 раза. Именно такой подход лежит в основе современных гигантов, таких как Mixtral 8x7B, GPT-4 (согласно слухам) и Google Gemini.
Сравнение архитектур: Dense vs MoE
Для наглядности разницы в эффективности ниже приведена таблица сравнения базовых характеристик плотной модели и модели с архитектурой MoE:
| Характеристика | Dense FFN (Традиционная) | MoE (Mixture of Experts) |
|---|---|---|
| Активные параметры на токен | 100% (все параметры слоя) | ~12.5% - 25% (зависит от k и N) |
| Вычислительная сложность (FLOPs) | Пропорциональна общему числу параметров | Пропорциональна активным экспертам (k) |
| Пример модели | Стандартный Transformer | Mixtral 8x7B, GPT-4 (предположительно) |
Кейс: Mixtral 8x7B и реальная эффективность
Ярким примером практического применения MoE является модель Mixtral 8x7B. Несмотря на название, указывающее на 8 экспертов по 7 миллиардов параметров, общая архитектура имеет следующие характеристики:
- Общее число параметров: ~47 миллиардов.
- Активные параметры на токен: ~13 миллиардов.
- Коэффициент активации: ~3.6x (отношение общего числа к активному).
Важно отметить, что коэффициент 3.6x, а не идеальные 4x (при N=8, k=2), обусловлен тем, что слои внимания (attention layers) являются общими для всех экспертов и не умножаются на количество экспертов. Это демонстрирует, как MoE позволяет достичь огромной эффективной емкости модели при инференсе, сопоставимом с гораздо более маленькими плотными моделями.
Почему это важно для индустрии
MoE-архитектура становится стандартом де-факто для создания LLM следующего поколения. Она позволяет исследователям и компаниям масштабировать модели до триллионов параметров, не требуя непропорционально огромных вычислительных ресурсов для каждого шага генерации. Это открывает путь к созданию более умных и контекстно-осведомленных моделей, которые остаются экономически и технически жизнеспособными для развертывания.
Источник: Towards AI pub ↗
