Проблема с метриками надежности
В индустрии GPU-инференса цифры аптайма часто вводят в заблуждение. Вместе AI (Together AI) объясняет, что каждый уровень надежности ("девять") требует совершенно разной архитектуры для защиты от специфических доменов сбоев. В отличие от CPU-инфраструктуры, GPU-кластеры работают на пределе: 1 млн токенов в минуту на GPU или задержка TTFT менее 50 мс оставляют минимум запаса прочности. Добавление надежности к такой системе усложняется экспоненциально с каждым новым знаком «9».
Три уровня защиты: от узла до региона
Надежность делится на три четких уровня, каждый из которых решает свою инженерную задачу:
- 99% (Уровень узла): Архитектура должна выдерживать сбои отдельных GPU, драйверов или тепловые события. Решение: автоматическая проверка здоровья, draining (сброс нагрузки) и быстрая замена реплик в пределах одного дата-центра (DC).
- 99.9% (Уровень дата-центра): Система должна пережить полный выход из строя всего DC. Ключевое отличие: веса моделей развернуты в двух объектах, и трафик маршрутизируется на оба одновременно. Это не «холодный резерв» (cold standby), а активная работа двух площадок.
- 99.99% (Уровень региона): Защита от региональных отключений. Требует мультирегионального развертывания с резервированием зон доступности (AZ) и, что критично, зарезервированной емкостью в регионе-отказоустойчивом узле, которая простаивает, чтобы мгновенно принять нагрузку.
Власть над инфраструктурой
Together AI подчеркивает важность владения инфраструктурой. Провайдеры, арендующие мощности у гиперскейлеров или neocloud, не контролируют физические слои (питание, охлаждение). При сбое они вынуждены ждать тикетов от владельца ЦОД, что увеличивает время восстановления (RTO). Together AI заявляет о полном контроле «от чипа до токена» (chip-to-token visibility), что позволяет устранять проблемы на всех уровнях без посредников.
Сравнение уровней надежности
Ниже приведена сводная таблица требований к архитектуре для каждого уровня SLA, согласно методологии Together AI:
| Уровень SLA | Домен отказа | Требования к архитектуре | Ключевая особенность |
|---|---|---|---|
| 99% | Уровень узла (Node) | Автоматический health-check, draining, замена реплик | Защита от сбоев GPU, драйверов, NIC в одном DC |
| 99.9% | Уровень дата-центра (DC) | Веса в двух DC, полная емкость для приема трафика | Активная маршрутизация трафика, отсутствие cold standby |
| 99.99% | Уровень региона (Region) | Мультирегион, AZ redundancy, зарезервированная емкость | Готовая к приему нагрузка в регионе-бэкапе «здесь и сейчас» |
Как Together AI измеряет аптайм
Компания публикует свои метрики, чтобы избежать размытых формулировок. Вот их определения:
- Delivered uptime (99.9%): Процент времени, когда endpoint успешно обслуживает запросы. Измеряется на этапе завершения инференса, а не на уровне load balancer.
- Guaranteed SLA: Single DC (99%): Контрактное обязательство для развертывания в одном дата-центре.
- Guaranteed SLA: Multi DC (99.9%): Контрактное обязательство для развертывания в нескольких дата-центрах.
Together AI рекомендует клиентам задавать провайдерам вопросы о том, где именно измеряется SLA, кто владеет инфраструктурой и как тестируется failover, чтобы избежать сюрпризов при инцидентах.
Источник: Together AI ↗
