Конфиденциальные вычисления становятся стандартом для AI
Защита проприетарных моделей и чувствительных данных пользователей переходит из разряда опций в обязательные требования. Однако внедрение Confidential Computing (CC) для GPU-ускоренного инференса больших языковых моделей (LLM) несет значительные накладные расходы. Исследование Wei Wang, Abdul Hyee Waqas и Burns Smith, опубликованное в arXiv (20.05.2026), дает первую детальную оценку этих потерь на базе NVIDIA H100 80GB в среде Intel TDX (Trust Domain Extensions).
Методология и тестовые модели
Авторы сравнили стандартный режим выполнения с режимом конфиденциальных вычислений, используя две репрезентативные модели: Mistral-7B v0.1 и Qwen3-30B-A3B. Оценка проводилась по ключевым метрикам: время до первого токена (TTFT), сквозная задержка запроса, пропускная способность генерации токенов на запрос и глобальная пропускная способность при увеличении конкурентности.
Ценовая метрика: задержка и пропускная способность
В экспериментах с фиксированной скоростью запросов (fixed request-rate) конфиденциальный режим показал предсказуемый, но ощутимый удар по производительности. Для модели Mistral-7B средняя задержка первого токена (TTFT) выросла на 21.8%, а для более тяжелой Qwen3-30B-A3B — на 27.8%. Глобальная пропускная способность (global token throughput) снизилась на 17.7% и 21.1% соответственно.
| Метрика | Mistral-7B (Mistral-7B) | Qwen3-30B-A3B |
|---|---|---|
| Рост TTFT (Confidential vs Standard) | +21.8% | +27.8% |
| -17.7% | -21.1% | |
| Диапазон потерь в closed-loop тестах | 11.5% – 20.2% | |
Критический нюанс: ранняя насыщаемость
В тестах с закрытым циклом (closed-loop concurrency), где нагрузка генерируется самими клиентами, разрыв в пропускной способности сохраняется в диапазоне 11.5–20.2%. Однако самое важное открытие касается поведения больших моделей: Qwen3-30B-A3B достигает «колена» насыщения (saturation knee) раньше в режиме TDX. Это означает, что при высокой нагрузке система быстрее достигает предела своей эффективности, чем в обычном режиме.
Вывод для архитекторов систем
Результаты подтверждают, что инференс в защищенном GPU-окружении остается работоспособным, но требует пересмотра capacity planning. Инженерам необходимо закладывать не только снижение базовой пропускной способности (~20%), но и учитывать более раннее достижение лимитов производительности для крупных моделей, чтобы избежать деградации сервиса в пиковые часы.
Источник: arXiv cs.AI ↗
