Инструменты3 июля 2026 г., 00:30 МСК🤖 Auto

NVIDIA Confidential Computing: безопасность Blackwell с потерей всего 8% производительности

NVIDIA представила аппаратно-ориентированное решение Confidential Computing для GPU Blackwell, обеспечивающее защиту данных при инференсе с минимальным оверхедом — до 98% от производительности незащищенного режима.

Баннер новости 2821

Аппаратная защита без компромиссов

NVIDIA анонсировала интеграцию Confidential Computing (CC) прямо в архитектуру GPU Blackwell, включая модели HGX B200, HGX B300 и RTX PRO 6000. Ключевая инновация заключается в использовании «корня доверия» на уровне кремния: приватные ключи подписи встраиваются в чип во время производства и недоступны ни для программного обеспечения, ни для хост-системы. Это позволяет шифровать данные и веса моделей непосредственно во время инференса, защищая их от утечек даже со стороны администраторов хоста.

Процесс включает удаленную аттестацию через NVIDIA Remote Attestation Service (NRAS), которая проверяет целостность конфигурации Trusted Execution Environment (TEE) на базе Intel TDX или AMD SEV-SNP. Важно отметить, что эта процедура выполняется однократно при запуске, поэтому она не добавляет задержек к отдельным запросам инференса в рабочем режиме.

Результаты бенчмарков: Qwen 3.5 на HGX B300

Для оценки влияния безопасности на производительность NVIDIA провела тесты на кластере HGX B300 с использованием модели Qwen 3.5-397B-A17B-FP8 и фреймворка SGLang. Результаты показали, что включение CC снижает пропускную способность и увеличивает задержку (TPOT) не более чем на 8% в большинстве сценариев. В пиковых нагрузках оверхед остается в пределах 2-3%, что делает решение пригодным для продакшена.

Параметр Конфигурация Влияние CC на пропускную способность (Δ%) Влияние CC на TPOT (Δ%)
Низкая нагрузка Concurrency: 4, ISL/OSL: 1024/1024 -2.0% -1.6%
Средняя нагрузка Concurrency: 32, ISL/OSL: 8192/1024 -2.8% -3.0%
Высокая нагрузка Concurrency: 128, ISL/OSL: 1024/1024 -7.5% -8.1%
Пиковая нагрузка Concurrency: 256, ISL/OSL: 8192/1024 -3.6% -3.7%

Технические оптимизации

Чтобы минимизировать задержки, связанные с шифрованием и запуском ядер, NVIDIA внедрила несколько критических улучшений в стек программного обеспечения:

  • CC-safe autotuning в FlashInfer: Замена таймеров событий на глобальный таймер GPU позволяет точно измерять время выполнения ядер даже в защищенном режиме, выбирая оптимальные реализации.
  • Асинхронное копирование D2H в SGLang: Вынос чтения токенов с устройства на хост из критического пути планировщика восстанавливает перекрытие вычислений и передачи данных, которое иначе нарушалось бы синхронностью копий в CC-режиме.
  • Piecewise CUDA Graphs: Поддержка воспроизведения графов CUDA для этапов prefill и смешанных батчей снижает накладные расходы на запуск ядер, которые усиливаются при использовании шифрования.

Значение для индустрии

Решение NVIDIA закрывает главный барьер для внедрения AI в регулируемых отраслях (финтех, здравоохранение, госсектор): возможность использовать мощные модели, не раскрывая проприетарные веса и пользовательские данные. При сохранении до 98% производительности, Confidential Computing становится стандартом для безопасного агентного AI, позволяя компаниям соблюдать требования суверенитета данных без ущерба для скорости инференса.

Источник: NVIDIA dev blog ↗