Запуск Prime Inference: закрытие цикла обучения
Компания Prime Intellect официально представила Prime Inference — платформу для обслуживания (serving) передовых открытых моделей. Это важный шаг в экосистеме компании: если ранее они поставляли инструменты для пост-обучения (prime-rl, верификаторы), то теперь сервис позволяет развернутым моделям генерировать продакшн-трейсы, которые напрямую возвращаются в цикл обучения. До публичного запуска платформа уже обрабатывала почти триллион токенов в день для RL-роллов, генерации синтетических данных и работы кодовых агентов.
Технический стек и производительность GLM-5.3
В основе сервиса лежит гибридный стек, разработанный совместно с Inferact и NVIDIA: NVIDIA Dynamo, vLLM, Mooncake и FlashInfer. Ключевая особенность — диссоциация префилла и декодирования (prefill/decode disaggregation). Префилл и декодирование выполняются на разных группах GPU, а вычисленные KV-кэши передаются через NIXL. Это позволило снизить p90 задержку между токенами почти на 40%.
Для модели GLM-5.3 на чипах GB200 NVL72 достигнуты следующие результаты:
- Скорость: 101 токен/с на пользователя при 66 сессиях на группу префилла.
- Кэширование: Использование NVFP4 сжало строку кэша MLA с 576 до 352 байт, увеличив количество кэшируемых токенов с 1.09M до 1.63M на декодер.
- Задержки: Уменьшение бюджета префилла с 8K до 4K токенов снизило медианное время ожидания очереди с 550 мс до 110 мс.
Сравнение с конкурентами
Prime Inference позиционируется как прямая альтернатива Together AI, Fireworks AI и Baseten. Все они предлагают OpenAI-совместимые API и серверные эндпоинты. Однако Prime делает ставку на прозрачность стека (open source компоненты) и специфические оптимизации для агентов, такие как исправление багов парсинга (например, декодирование < в inside code) и использование xgrammar для валидации схем инструментов.
| Функция | Prime Inference | Together AI | Fireworks AI | Baseten |
|---|---|---|---|---|
| Серверный GLM-5.3 | Да | Да | Да | Да |
| Цена GLM-5.3 (вход/выход за 1M токенов) | Не опубликовано | $1.40 / $4.40 | $1.40 / $4.40 | $1.40 / $4.40 |
| Выделенная мощность (Reserved/Dedicated) | Reserved; выделенные деплои в roadmap | Dedicated Model endpoints | On-demand dedicated GPU | Dedicated GPU deployments |
| OpenAI-compatible API | Да | Да | Да | Да |
| Пакетный вывод (Batch inference) | В roadmap | Да | Не указано | Не указано |
| Открытый стек | Dynamo, vLLM, Mooncake, FlashInfer | Together inference stack | Fireworks serving stack | Baseten Inference Stack |
Почему это важно для разработчиков
Prime Inference предлагает два режима работы: serverless для переменной нагрузки и reserved capacity для стабильных рабочих нагрузок. Платформа гарантирует 100% аптайм с момента запуска благодаря автоматическому переключению между дата-центрами. Поддержка NVIDIA Blackwell уже доступна, а чипы Vera Rubin анонсированы как ближайшие. Для разработчиков агентов критически важна функция cache-aware routing от Dynamo, которая удерживает сессии на одном декодере, минимизируя задержки при многошаговых взаимодействиях.
Доступность и цены
API совместим с OpenAI SDK. Точные цены на модели пока не опубликованы в документации, в то время как у конкурентов (Together, Fireworks, Baseten) тарифы на GLM-5.3 составляют $1.40 за входные и $4.40 за выходные токены на миллион токенов. В ближайшем roadmap запланированы функции пакетного вывода (batch inference) и развертывания выделенных инстанций в один клик.
Источник: MarkTechPost ↗
