Исследования23 июля 2026 г., 08:17 МСК🤖 Auto

Intel TDX на NVIDIA H100: цена конфиденциального AI-инференса

Исследование arXiv показало, что запуск LLM в защищенном окружении Intel TDX на GPU H100 снижает пропускную способность на 17–21% и увеличивает задержку первого токена. Это критично для планирования мощностей в enterprise-секторе.

Баннер новости 4179

Конфиденциальные вычисления становятся стандартом для AI

Защита проприетарных моделей и чувствительных данных пользователей переходит из разряда опций в обязательные требования. Однако внедрение Confidential Computing (CC) для GPU-ускоренного инференса больших языковых моделей (LLM) несет значительные накладные расходы. Исследование Wei Wang, Abdul Hyee Waqas и Burns Smith, опубликованное в arXiv (20.05.2026), дает первую детальную оценку этих потерь на базе NVIDIA H100 80GB в среде Intel TDX (Trust Domain Extensions).

Методология и тестовые модели

Авторы сравнили стандартный режим выполнения с режимом конфиденциальных вычислений, используя две репрезентативные модели: Mistral-7B v0.1 и Qwen3-30B-A3B. Оценка проводилась по ключевым метрикам: время до первого токена (TTFT), сквозная задержка запроса, пропускная способность генерации токенов на запрос и глобальная пропускная способность при увеличении конкурентности.

Ценовая метрика: задержка и пропускная способность

В экспериментах с фиксированной скоростью запросов (fixed request-rate) конфиденциальный режим показал предсказуемый, но ощутимый удар по производительности. Для модели Mistral-7B средняя задержка первого токена (TTFT) выросла на 21.8%, а для более тяжелой Qwen3-30B-A3B — на 27.8%. Глобальная пропускная способность (global token throughput) снизилась на 17.7% и 21.1% соответственно.

d>Снижение глобальной пропускной способности
Метрика Mistral-7B (Mistral-7B) Qwen3-30B-A3B
Рост TTFT (Confidential vs Standard) +21.8% +27.8%
-17.7% -21.1%
Диапазон потерь в closed-loop тестах 11.5% – 20.2%

Критический нюанс: ранняя насыщаемость

В тестах с закрытым циклом (closed-loop concurrency), где нагрузка генерируется самими клиентами, разрыв в пропускной способности сохраняется в диапазоне 11.5–20.2%. Однако самое важное открытие касается поведения больших моделей: Qwen3-30B-A3B достигает «колена» насыщения (saturation knee) раньше в режиме TDX. Это означает, что при высокой нагрузке система быстрее достигает предела своей эффективности, чем в обычном режиме.

Вывод для архитекторов систем

Результаты подтверждают, что инференс в защищенном GPU-окружении остается работоспособным, но требует пересмотра capacity planning. Инженерам необходимо закладывать не только снижение базовой пропускной способности (~20%), но и учитывать более раннее достижение лимитов производительности для крупных моделей, чтобы избежать деградации сервиса в пиковые часы.

Источник: arXiv cs.AI ↗