Два лица MoE: активные vs общие параметры
Модели с архитектурой Mixture of Experts (MoE) часто вводят в заблуждение своим заявленным количеством параметров. В индустрии принято указывать общее число параметров (Total Parameters), которое включает все «эксперты» в сети. Однако во время инференса (вывода) активными являются лишь подмножество параметров (Active Parameters), соответствующих выбранным экспертам для конкретного токена.
Эта разница создает иллюзию доступности. Провайдеры облачных API часто продают доступ к MoE-моделям, ориентируясь на стоимость обслуживания «малого» активного набора, скрывая истинную вычислительную нагрузку.
Экономика самохостинга
Статья в Towards AI подчеркивает ключевой экономический инсайт: самохостинг (self-hosting) платит за «большой» счетчик. Когда вы разворачиваете модель на своих серверах, вы должны оплачивать инфраструктуру, способную вместить всю модель целиком, а не только её активную часть. Это делает первоначальные капитальные затраты (CapEx) высокими, но долгосрочная стоимость владения (TCO) может быть ниже, чем при использовании API для высоконагруженных задач.
Сравнение подходов
| Критерий | Использование через API | Самохостинг (Self-hosting) |
|---|---|---|
| Базовая метрика цены | Часто привязана к активным параметрам или токенам | Привязана к полному размеру модели (GPU VRAM) |
| Прозрачность затрат | Скрытая вычислительная сложность | Прямая оплата за оборудование |
| Экономический порог | Выгоден для редких запросов | Окупается при высокой нагрузке, покрывая «большой» размер |
Почему это важно
Для инженеров и CTO это означает необходимость пересмотра стратегий развертывания. Если вы планируете масштабное использование MoE-моделей, покупка или аренда мощных GPU для полного размещения модели может оказаться дешевле, чем оплата API-запросов, где провайдер закладывает маржу на скрытую сложность инференса. Понимание разницы между «малым» и «большим» счетчиком параметров — ключ к оптимизации бюджета в эпоху больших языковых моделей.
Источник: Towards AI pub ↗
