Экономика моделей 2028–2031: от 10T до 1.4 квадриллиона параметров
Владимир Несов (Vladimir_Nesov) представил расчеты, основанные на законах масштабирования (scaling laws), пропускной способности HBM и стоимости вычислений. Прогнозируется, что модели 2028 года будут иметь 240 триллионов параметров, а к 2031 году этот показатель достигнет 1.4 квадриллиона. Несмотря на колоссальный рост размера, экономика обслуживания остается выгодной при правильном ценообразании.
Ключевой вывод: стоимость генерации выходных токенов (decode) почти не растет из-за того, как размер KV-кэша на один токен масштабируется с количеством активных параметров. Это позволяет обслуживать запросы с контекстом до 3 миллионов токенов при сохранении валовой маржи в 70%.
Закон масштабирования KV-кэша
Традиционные архитектуры, такие как Llama 3 405B с grouped-query attention, требуют около 260 КБ KV-кэша на токен (в FP8). Для контекста в 1 млн токенов это означает 260 ГБ памяти — почти половина HBM сервера H100. Современные подходы, такие как в DeepSeek V4 Pro, снижают этот показатель до 5 КБ на токен за счет сжатия и оптимизации внимания.
Автор предлагает эмпирический закон масштабирования для фронтенд-моделей:
- Формула: Размер KV-кэша на токен ≈ 0.2 байта × √(количество активных параметров).
- Следствие: При увеличении активных параметров в 37 раз (с 2026 по 2031 год), размер KV-кэша на токен растет всего в 6 раз.
Сравнение стоимости токенов и маржинальности
Ниже приведены расчетные данные для гипотетических моделей будущего и текущих аналогов. Стоимость рассчитана из первых принципов с учетом долгосрочной аренды вычислений.
| Модель / Год | Активные параметры | Стоимость ввода (1M токенов) | Стоимость вывода (1M токенов) | Валовая маржа (при целевой цене) |
|---|---|---|---|---|
| Mythos 5 (2026, оценка) | 1.3T | $14 | $70 | 83–89% |
| Opus 4.8 (оценка) | 650B | — | — | 83–89% |
| Модель 2028 года | 7.9T | $2.5 | $46 | 70% (при цене $14/$70) |
| Модель 2031 года | 48T | — | $67 | 70% (при цене $30/$150) |
Почему это важно для индустрии
Результаты показывают, что нет технических или экономических причин избегать обслуживания самых больших моделей, даже если они содержат квадриллионы параметров. Однако такие модели невозможно запустить на текущем оборудовании (например, кластерах H100), так как им требуется экстремально высокая пропускная способность HBM в рамках одной системы масштабирования (scale-up system). Ограничение в виде недостаточной емкости HBM становится главным барьером для создания и обслуживания моделей следующего поколения.
Источник: LessWrong ↗
