В эпоху, когда большие языковые модели (LLM) проникают в самые закрытые уголки корпоративной инфраструктуры — от обработки персональных данных до анализа интеллектуальной собственности — вопрос безопасности перестал быть просто «дополнительной опцией». Он стал фундаментальным требованием. Когда вы запускаете инференс модели, которая работает с конфиденциальным контекстом, вы не можете позволить себе доверять операционной системе хоста или гипервизору. Данные должны обрабатываться в среде, которая гарантирует их целостность и конфиденциальность на аппаратном уровне, еще до того, как они коснутся памяти.
Здесь на сцену выходит NVIDIA Confidential Computing (CC). Это не просто набор шифровальных алгоритмов, а целая экосистема, включающая защищенные виртуальные машины (CVM), зашифрованные GPU и зашифрованные соединения NVLink. Однако у любой системы безопасности есть цена. В случае с AI-инференсом этой ценой может стать производительность. Если фреймворк инференса, такой как TensorRT-LLM, не адаптирован под особенности защищенной среды, накладные расходы на шифрование и проверку целостности могут «убить» скорость генерации токенов.
В этой статье мы глубоко разберем, как NVIDIA решает эту дилемму. Мы посмотрим на реальные бенчмарки на архитектуре Blackwell, разберем технические нюансы работы с памятью, таймингами и многопроцессорной коммуникацией, а также предоставим пошаговое руководство для инженеров, планирующих внедрение приватного AI в продакшен. Это не просто теория — это практический опыт команды производительности NVIDIA, который можно применить к вашим рабочим нагрузкам.
01Почему стандартные оптимизации ломаются в Confidential Computing?
Чтобы понять масштаб проблемы, нужно осознать, как меняется поведение системы, когда мы включаем Confidential Computing. В обычном режиме работы GPU может напрямую обращаться к памяти хоста, использовать асинхронные копирования и полагаться на предсказуемые тайминги. В среде CC (Confidential Computing) эти допущения становятся недействительными.
Главное отличие CC-окружения заключается в том, что память виртуальной машины шифруется аппаратно. GPU больше не может просто так «прочитать» данные из памяти хоста. Все передачи данных между хостом и устройством (host-to-device) и обратно (device-to-host) проходят через специальные защищенные пути. Это вносит три критических изменения в работу фреймворков инференса:

- Движение данных: Асинхронные копии, которые раньше были мгновенными, теперь могут блокировать поток выполнения из-за необходимости шифрования/дешифрования.
- Тайминги: Стандартные механизмы измерения времени (например, CUDA events) могут давать нестабильные результаты из-за задержек, связанных с безопасностью.
- Многопроцессорная коммуникация: Протоколы межпроцессорного обмена, такие как NVLink SHARP (NVLS), могут быть недоступны или работать иначе в защищенном режиме.
Если фреймворк не учитывает эти изменения, он продолжает использовать оптимизации, рассчитанные на «открытую» память, что приводит к деградации производительности. Задача инженеров — адаптировать runtime так, чтобы он эффективно обходил эти ограничения, не жертвуя ни безопасностью, ни скоростью.
02Выбор рабочей нагрузки: как правильно измерить оверхед
Один из самых сложных вопросов при тестировании безопасности — как изолировать влияние шифрования от других факторов? Если вы запустите высококонкурентную нагрузку с короткими запросами, накладные расходы на шифрование могут быть «размазаны» по множеству параллельных операций и станут незаметными. Чтобы увидеть реальное влияние CC, нужно выбрать нагрузку, которая максимально нагружает защищенные каналы передачи данных.
Команда NVIDIA выбрала сценарий, который является «идеальным штормом» для выявления оверхеда:

- Длинный контекст входа: Это создает огромное давление на канал передачи данных от хоста к GPU на этапе префилла (prefill). Каждое байт данных должен быть зашифрован перед отправкой.
- Длинная генерация выхода: На этапе декодирования (decode) каждый сгенерированный токен должен быть возвращен на хост для проверки или сохранения. При низкой конкурентности эти мелкие операции копирования становятся узким горлышком.
- Низкая конкурентность: Это ограничивает возможность «скрыть» задержки шифрования за счет параллелизма. Когда запросов мало, каждая задержка на копирование данных напрямую влияет на общее время ответа.
Такой подход позволяет точно измерить, сколько производительности теряется именно из-за механизмов безопасности, а не из-за неэффективности самой модели.
03Методология тестирования: CC On vs CC Off
Для получения достоверных результатов необходимо провести контролируемое сравнение. Суть метода проста, но требует строгой дисциплины: мы запускаем одну и ту же рабочую нагрузку дважды. В первом случае Confidential Computing отключен (CC Off), во втором — включен (CC On). Все остальные параметры — модель, версия фреймворка, параллелизм, длина последовательности — остаются неизменными. Единственная переменная — состояние безопасности.
Для оценки используются две ключевые метрики:
- Сохранение пропускной способности (Throughput Retention): Показывает, какой процент токенов в секунду мы генерируем в защищенном режиме по сравнению с обычным. Формула:
100 * (CC_on tokens/s / CC_off tokens/s).Источник: NVIDIA Developer ↗
