Инструменты16 июля 2026 г., 21:31 МСК🤖 Auto

Together AI: Как устроена инфраструктура для 99.9% аптайма

Together AI раскрывает архитектурные различия между уровнями надежности 99%, 99.9% и 99.99% для GPU-инференса, объясняя, почему холодный резерв не работает и как обеспечивается отказоустойчивость.

Баннер новости 3750

Проблема с метриками надежности

В индустрии GPU-инференса цифры аптайма часто вводят в заблуждение. Вместе AI (Together AI) объясняет, что каждый уровень надежности ("девять") требует совершенно разной архитектуры для защиты от специфических доменов сбоев. В отличие от CPU-инфраструктуры, GPU-кластеры работают на пределе: 1 млн токенов в минуту на GPU или задержка TTFT менее 50 мс оставляют минимум запаса прочности. Добавление надежности к такой системе усложняется экспоненциально с каждым новым знаком «9».

Три уровня защиты: от узла до региона

Надежность делится на три четких уровня, каждый из которых решает свою инженерную задачу:

  • 99% (Уровень узла): Архитектура должна выдерживать сбои отдельных GPU, драйверов или тепловые события. Решение: автоматическая проверка здоровья, draining (сброс нагрузки) и быстрая замена реплик в пределах одного дата-центра (DC).
  • 99.9% (Уровень дата-центра): Система должна пережить полный выход из строя всего DC. Ключевое отличие: веса моделей развернуты в двух объектах, и трафик маршрутизируется на оба одновременно. Это не «холодный резерв» (cold standby), а активная работа двух площадок.
  • 99.99% (Уровень региона): Защита от региональных отключений. Требует мультирегионального развертывания с резервированием зон доступности (AZ) и, что критично, зарезервированной емкостью в регионе-отказоустойчивом узле, которая простаивает, чтобы мгновенно принять нагрузку.

Власть над инфраструктурой

Together AI подчеркивает важность владения инфраструктурой. Провайдеры, арендующие мощности у гиперскейлеров или neocloud, не контролируют физические слои (питание, охлаждение). При сбое они вынуждены ждать тикетов от владельца ЦОД, что увеличивает время восстановления (RTO). Together AI заявляет о полном контроле «от чипа до токена» (chip-to-token visibility), что позволяет устранять проблемы на всех уровнях без посредников.

Сравнение уровней надежности

Ниже приведена сводная таблица требований к архитектуре для каждого уровня SLA, согласно методологии Together AI:

Уровень SLA Домен отказа Требования к архитектуре Ключевая особенность
99% Уровень узла (Node) Автоматический health-check, draining, замена реплик Защита от сбоев GPU, драйверов, NIC в одном DC
99.9% Уровень дата-центра (DC) Веса в двух DC, полная емкость для приема трафика Активная маршрутизация трафика, отсутствие cold standby
99.99% Уровень региона (Region) Мультирегион, AZ redundancy, зарезервированная емкость Готовая к приему нагрузка в регионе-бэкапе «здесь и сейчас»

Как Together AI измеряет аптайм

Компания публикует свои метрики, чтобы избежать размытых формулировок. Вот их определения:

  • Delivered uptime (99.9%): Процент времени, когда endpoint успешно обслуживает запросы. Измеряется на этапе завершения инференса, а не на уровне load balancer.
  • Guaranteed SLA: Single DC (99%): Контрактное обязательство для развертывания в одном дата-центре.
  • Guaranteed SLA: Multi DC (99.9%): Контрактное обязательство для развертывания в нескольких дата-центрах.

Together AI рекомендует клиентам задавать провайдерам вопросы о том, где именно измеряется SLA, кто владеет инфраструктурой и как тестируется failover, чтобы избежать сюрпризов при инцидентах.

Источник: Together AI ↗