Релиз модели3 октября 2026 г., 18:18 МСК🤖 Auto

Prime Intellect запустила Prime Inference: обгоняет конкурентов по скорости GLM-5.3

Prime Intellect представила платформу Prime Inference для запуска frontier-моделей. Сервис работает на NVIDIA Blackwell, обеспечивает 100% аптайм и превосходит аналоги по задержкам благодаря уникальному стеку Dynamo и vLLM.

Баннер новости 8863

Запуск Prime Inference: закрытие цикла обучения

Компания Prime Intellect официально представила Prime Inference — платформу для обслуживания (serving) передовых открытых моделей. Это важный шаг в экосистеме компании: если ранее они поставляли инструменты для пост-обучения (prime-rl, верификаторы), то теперь сервис позволяет развернутым моделям генерировать продакшн-трейсы, которые напрямую возвращаются в цикл обучения. До публичного запуска платформа уже обрабатывала почти триллион токенов в день для RL-роллов, генерации синтетических данных и работы кодовых агентов.

Технический стек и производительность GLM-5.3

В основе сервиса лежит гибридный стек, разработанный совместно с Inferact и NVIDIA: NVIDIA Dynamo, vLLM, Mooncake и FlashInfer. Ключевая особенность — диссоциация префилла и декодирования (prefill/decode disaggregation). Префилл и декодирование выполняются на разных группах GPU, а вычисленные KV-кэши передаются через NIXL. Это позволило снизить p90 задержку между токенами почти на 40%.

Для модели GLM-5.3 на чипах GB200 NVL72 достигнуты следующие результаты:

  • Скорость: 101 токен/с на пользователя при 66 сессиях на группу префилла.
  • Кэширование: Использование NVFP4 сжало строку кэша MLA с 576 до 352 байт, увеличив количество кэшируемых токенов с 1.09M до 1.63M на декодер.
  • Задержки: Уменьшение бюджета префилла с 8K до 4K токенов снизило медианное время ожидания очереди с 550 мс до 110 мс.

Сравнение с конкурентами

Prime Inference позиционируется как прямая альтернатива Together AI, Fireworks AI и Baseten. Все они предлагают OpenAI-совместимые API и серверные эндпоинты. Однако Prime делает ставку на прозрачность стека (open source компоненты) и специфические оптимизации для агентов, такие как исправление багов парсинга (например, декодирование < в inside code) и использование xgrammar для валидации схем инструментов.

Функция Prime Inference Together AI Fireworks AI Baseten
Серверный GLM-5.3 Да Да Да Да
Цена GLM-5.3 (вход/выход за 1M токенов) Не опубликовано $1.40 / $4.40 $1.40 / $4.40 $1.40 / $4.40
Выделенная мощность (Reserved/Dedicated) Reserved; выделенные деплои в roadmap Dedicated Model endpoints On-demand dedicated GPU Dedicated GPU deployments
OpenAI-compatible API Да Да Да Да
Пакетный вывод (Batch inference) В roadmap Да Не указано Не указано
Открытый стек Dynamo, vLLM, Mooncake, FlashInfer Together inference stack Fireworks serving stack Baseten Inference Stack

Почему это важно для разработчиков

Prime Inference предлагает два режима работы: serverless для переменной нагрузки и reserved capacity для стабильных рабочих нагрузок. Платформа гарантирует 100% аптайм с момента запуска благодаря автоматическому переключению между дата-центрами. Поддержка NVIDIA Blackwell уже доступна, а чипы Vera Rubin анонсированы как ближайшие. Для разработчиков агентов критически важна функция cache-aware routing от Dynamo, которая удерживает сессии на одном декодере, минимизируя задержки при многошаговых взаимодействиях.

Доступность и цены

API совместим с OpenAI SDK. Точные цены на модели пока не опубликованы в документации, в то время как у конкурентов (Together, Fireworks, Baseten) тарифы на GLM-5.3 составляют $1.40 за входные и $4.40 за выходные токены на миллион токенов. В ближайшем roadmap запланированы функции пакетного вывода (batch inference) и развертывания выделенных инстанций в один клик.

Источник: MarkTechPost ↗