Релиз модели8 июля 2026 г., 10:30 МСК🤖 Auto

Together AI: Пропускная способность с гарантиями для Open-моделей

Together AI представила Provisioned Throughput — зарезервированную инференс-мощность для топовых open-моделей с SLA 99% и ценой до 90% ниже, чем у Claude Opus 4.8.

Баннер новости 3094

Новый формат: от best-effort к гарантиям

Together AI запустила Provisioned Throughput — новый способ использования open-weight моделей, который закрывает разрыв между нестабильным serverless-инференсом и сложным выделенным оборудованием. Теперь компании могут получать гарантированную пропускную способность для таких моделей, как MiniMax M3 и GLM-5.2, с SLA на уровне 99% доступности. Это решение позволяет бизнесу планировать бюджеты на AI-агентов без риска простоев, характерных для бесплатных тарифов.

Экономика и цены: PTU и сравнение с лидерами

Основой тарификации стали Provisioned Throughput Units (PTU). Один PTU стоит $0.05 в минуту и предоставляет эксклюзивный срез мощности. Стоимость зависит от типа токенов: входные, кэшированные входные и выходные токены расходуют PTU с разной скоростью. Для MiniMax M3 один PTU обеспечивает 138 840 входных токенов в минуту или 23 140 выходных токенов в минуту. При полной загрузке стоимость 1 млн выходных токенов составляет около $0.36, что делает решение в 90% дешевле аналогичного запроса к Claude Opus 4.8 ($2.50).

Параметр Together AI (MiniMax M3) Claude Opus 4.8 (List Price)
Стоимость 1 млн выходных токенов ~$0.36 $2.50
Цена 1 PTU (минута) $0.05
SLA (Доступность) 99%
Минимальный срок 1 месяц

Масштаб перехода на Open-модели

Компания отмечает взрывной рост интереса к open-решениям: за 9 месяцев объем токенов через API Together AI вырос с 30 миллиардов до более чем 400 триллионов токенов в месяц. Многие компании уже сообщают об экономии в 6–20 раз на инференсе по сравнению с проприетарными аналогами. Provisioned Throughput позиционируется как финальный шаг миграции для production-нагрузок, где важна не только цена, но и надежность, сравнимая с закрытыми API.

Доступность и поддержка

Сейчас сервис доступен для моделей MiniMax M3 и GLM-5.2 в регионах North America и EMEA. API для управления Provisioned Throughput, Dedicated Inference и Serverless Inference унифицировано, что упрощает интеграцию. Минимальный срок аренды — один месяц, при увеличении объема commitments предусмотрены скидки. В будущем список поддерживаемых моделей будет расширен.

Источник: Together AI ↗