Главная/Блог/Аналитика/NVIDIA Vera Storage: Революция в…
Аналитика12 мин чтения · 4 августа 2026 г.

NVIDIA Vera Storage: Революция в шифровании и сжатии для AI

Разбираем бенчмарки NVIDIA Vera BlueField-4 STX: как новая архитектура CPU ускоряет шифрование, сжатие и проверку целостности данных для AI-инфраструктуры.

NVIDIA Vera Storage: Революция в шифровании и сжатии для AI

В эпоху агентного искусственного интеллекта (Agentic AI) хранилище перестало быть пассивным складом данных. Теперь это активный участник каждого шага рассуждения агента. Когда ИИ-агенты извлекают корпоративные знания, обращаются к персистентной памяти, переиспользуют данные KV-кэша, выполняют инструменты и генерируют новые результаты, системы хранения должны непрерывно поставлять и сохранять данные, которые питают этот цикл принятия решений. Каждый шаг агента может запускать множественные операции с хранилищем, и эти операции повторяются для тысяч одновременных агентов с увеличивающимися контекстными окнами.

Обеспечение и сохранение таких объемов данных требует гораздо больше, чем базовые операции чтения и записи. Инференс ИИ выполняется на GPU, но процессы агентов, вызовы инструментов, задачи управления данными и сервисы хранения, которые их поддерживают, все еще опираются на CPU. Во время записи хранилище может сжимать и шифровать данные, вычислять контрольные суммы и избыточность. Во время чтения оно должно валидировать, расшифровывать, распаковывать или восстанавливать данные перед возвратом приложению. Эти функции критически важны для безопасности и устойчивости ИИ-систем, но каждая из них требует дополнительной процессорной мощности.

По мере роста параллелизма агентов (когда несколько пользователей, ИИ-агентов или задач работают одновременно) и увеличения объемов контекста, хранилище должно выполнять больше работы, не ограничивая отзывчивость приложения или скорость генерации токенов. Оно должно поставлять данные с той скоростью, которую требует ускоренные вычисления. Многие из этих функций находятся непосредственно в пути данных; одна задержанная операция может замедлить весь поток данных. Масштабирование их с помощью традиционных x86-процессоров может потребовать больше ядер, энергии и охлаждения, увеличивая стоимость инфраструктуры, при этом производительность все еще зависит от самого медленного этапа. Более быстрые SSD и сети не могут реализовать свой полный потенциал, если процессор, обеспечивающий безопасность, защиту и подготовку данных, не успевает за ними.

01Закрывая разрыв в обработке данных хранилища

Решением становится NVIDIA Vera BlueField-4 STX Storage Processor, ключевой компонент фундамента NVIDIA STX для платформ данных, нативных для ИИ. Он интегрирует производительность процессора NVIDIA Vera CPU непосредственно в путь данных хранилища. Та же архитектура CPU Vera, которая разработана для обеспечения питания GPU NVIDIA Rubin, теперь ускоряет обработку данных на стороне CPU в хранилищах. Результаты бенчмарков показывают превосходство Vera над x86-процессорами в шифровании и расшифровке, восстановлении, проверке целостности, сжатии и распаковке, а также в многоэтапных конвейерах хранилища. Эти преимущества позволяют платформам хранения обрабатывать больше данных и применять необходимые корпоративные сервисы с меньшими накладными расходами на CPU и энергию.

Эта статья подробно объясняет, как процессор Vera в BlueField-4 STX ускоряет обработку, необходимую для агентного ИИ, помогая платформам хранения данных, нативных для ИИ, защищать, защищать, проверять и сжимать больше данных, увеличивая пропускную способность и эффективность обработки данных в хранилище.

02Архитектура Vera CPU: Создана для двойных требований хранилища

Процессор Vera включает 88 ядер Olympus CPU, разработанных NVIDIA, которые полностью совместимы с набором инструкций Armv9.2. CPU поддерживает 176 потоков NVIDIA Spatial Multithreading. Эти ядра сочетаются с NVIDIA Scalable Coherency Fabric (SCF) и модулями памяти SOCAMM2 LPDDR5X для обеспечения высокой производительности на одном потоке и высокой пропускной способности выполнения CPU в масштабе ИИ-фабрики.

SCF обеспечивает согласованный путь данных на кристалле между ядрами, общим кэшем, контроллерами памяти и интерфейсами ввода-вывода, с пропускной способностью до 3,4 ТБ/с и единым кэшем L3 объемом 164 МБ. Это дает активным ядрам доступ к общим данным с высокой пропускной способностью и предсказуемой задержкой по мере масштабирования рабочих нагрузок на процессор. Подсистема памяти SOCAMM2 LPDDR5X дополняет эту ткань, обеспечивая до 1,2 ТБ/с совокупной пропускной способности памяти, или до 14 ГБ/с на ядро, помогая поддерживать ядра NVIDIA Olympus в условиях широкополосных и высококонкурентных рабочих нагрузок. Модульная, заменяемая в полевых условиях память сочетает энергоэффективность LPDDR5X с обслуживаемостью и надежностью, необходимыми для инфраструктуры дата-центров.

Сравнение производительности Vera и x86 в различных задачах
Сравнение производительности Vera и x86 в различных задачах

Примитивы хранилища предъявляют два различных требования к CPU. Во-первых, в рамках каждого потока данных шифрование, проверка целостности, восстановление, сжатие и распаковка должны завершаться быстро, прежде чем сможет продолжаться последующая обработка в хранилище, что делает устойчивую производительность на ядро важной. Во-вторых, в масштабах системы эти операции выполняются над множеством одновременных потоков и многократно перемещают данные через кэши и память, что делает пропускную способность и предсказуемую задержку equally важными.

Vera решает обе эти задачи. Ядро Olympus сочетает широкую пропускную способность инструкций, продвинутое предсказание переходов, глубокое выполнение вне порядка (out-of-order execution) и векторные и криптографические ресурсы, чтобы помочь каждому ядру поддерживать пропускную способность инструкций в коде, требующем управления и обработки данных. NVIDIA Spatial Multithreading, монолитный вычислительный кристалл, SCF, единый кэш L3 и память SOCAMM2 с высокой пропускной способностью помогают обеспечивать активные ядра данными, уменьшая интерференцию между потоками и поддерживая более предсказуемый доступ к данным под нагрузкой. Вместе эти возможности объясняют измеренные преимущества в шифровании, проверке целостности, вычислении четности, сжатии и многоэтапном конвейере хранилища.

💡
Ключевая особенность. Архитектура Vera не просто добавляет больше ядер. Она использует Scalable Coherency Fabric для обеспечения согласованности данных на кристалле, что критически важно для задач хранилища, где задержка доступа к памяти может стать узким местом.

03Измерение фундаментальной производительности хранилища

Задачи хранилища выполняются повторно в путях чтения, записи и восстановления. Их пропускная способность и эффективность определяют, успевает ли обработка на стороне CPU за SSD и сетями или становится ограничивающим этапом в пути данных. Микробенчмарки примитивов хранилища в этом обзоре изолируют эти функции, чтобы измерить вклад процессора. Они показывают производительность CPU и запас прочности, доступный в Vera для построения сервисов хранения с более высокой пропускной способностью и эффективностью.

Каждый тест запускается в рамках одного процесса с данными, уже находящимися в памяти. Тесты исключают файловый ввод-вывод, производительность дисков, сеть, запуск команд и внешние узкие места, если не указано иное. Набор бенчмарков использует распространенные библиотеки, включая OpenSSL, Zstandard и LZ4, а также сопоставимые реализации, оптимизированные для использования нативных инструкций, доступных на процессорах Arm и x86.

Специально разработанная тестовая среда запускает каждую рабочую нагрузку последовательно и контролирует размеры буферов, количество потоков, размещение CPU, тайминги, проверку правильности и сбор результатов. Алгоритмы и многие программные реализации широко приняты. Тестовая среда применяет одни и те же определения рабочих нагрузок и контроль как для Vera, так и для x86, обеспечивая последовательное сравнение процессоров. Результаты могут быть воспроизведены с использованием исходного кода, скриптов, фиксированных версий программного обеспечения, конфигураций и файлов результатов, хотя полный набор бенчмарков не является общедоступным готовым бенчмарком.

Методология тестирования примитивов хранилища
Методология тестирования примитивов хранилища

Эти измерения устанавливают производительность Vera на строительных блоках хранения, которые влияют на безопасное перемещение данных, устойчивость, эффективность емкости и плотность сервисов. В производственных путях хранения часто применяются несколько из этих операций к одним и тем же данным, что приводит к накоплению требований к обработке CPU. При объединении в программном обеспечении хранения производительность этих отдельных операций способствует совокупной пропускной способности и эффективности CPU. Более высокая пропускная способность по отдельным примитивам и многоэтапному конвейеру дает программному обеспечению хранения больше запаса CPU, чтобы успевать за SSD и сетями, поддерживать одновременные потоки данных и эффективно применять необходимые сервисы данных. Полное тестирование end-to-end все еще требуется для количественной оценки результатов полной системы хранения или производительности GPU.

04Безопасность данных ИИ с более быстрым шифрованием

ИИ-фабрики обрабатывают конфиденциальную информацию, включая активы моделей, корпоративные знания, контекст агентов, промпты, выходные данные и данные клиентов. AES-128 широко используется для шифрования данных в состоянии покоя (at-rest) и в движении (in-flight). Шифрование находится непосредственно в пути записи, где его пропускная способность может определить, сколько безопасных данных платформа может обрабатывать каждую секунду до того, как шифрование станет узким местом. Vera обеспечивает до 1,43x более высокую пропускную способность шифрования AES-128, чем x86-процессор, используемый для сравнения.

Результаты шифрования AES-128: Vera против x86
Результаты шифрования AES-128: Vera против x86

Дешифрование выполняет соответствующую операцию в пути чтения, и Vera обеспечивает до 1,29x более высокую пропускную способность дешифрования AES-128, чем x86-процессор, используемый для сравнения. Более высокая пропускная способность шифрования позволяет системам хранения защищать больше данных, не ограничивая записи, в то время как более быстрое дешифрование сокращает время, необходимое для возврата защищенных данных агентам, приложениям или ускорителям. Это помогает системам хранения защищать и возвращать растущие объемы данных ИИ, не потребляя все большую долю бюджета производительности хранения.

05Защита и восстановление данных ИИ быстрее

Платформы хранения используют коды исправления ошибок (erasure coding) для защиты данных, когда диски, узлы или фрагменты данных становятся недоступными. Кодирование Рида-Соломона создает избыточность, а восстановление использует эту избыточность для реконструкции отсутствующих или поврежденных данных. Кодирование обычно происходит в пути записи. Восстановление происходит во время перестроения, ремонта или деградированного чтения. Их результаты производительности могут отличаться, поскольку эти операции используют различные вычислительные и паттерны доступа к памяти.

Пропускная способность восстановления Рида-Соломона
Пропускная способность восстановления Рида-Соломона

Vera обеспечивает до 3,26x более высокую пропускную способность Рида-Соломона, чем x86-процессор в рабочей нагрузке восстановления. Более высокая пропускная способность Рида-Соломона позволяет системам хранения записывать защищенные данные и реконструировать отсутствующие данные быстрее. В некоторых измерениях эффективности Vera также завершает больше работы по защите в доступном энергетическом окне CPU, помогая сократить время перестроения и уменьшить конкуренцию с обычными сервисами данных.

06Проверка целостности данных с более высокой пропускной способностью

Данные должны оставаться правильными по мере их перемещения, хранения и извлечения. Циклические избыточные проверки (CRC) создают контрольные суммы, которые системы хранения используют для обнаружения случайных повреждений. CRC и Рида-Соломон выполняют комплементарные роли. CRC обнаруживает, что данные больше не соответствуют ожидаемому результату. Рида-Соломон предоставляет избыточность, используемую для реконструкции отсутствующей или поврежденной информации.

Система хранения может вычислять CRC как в пути записи, так и в пути чтения, включая при копировании данных между буферами. По мере роста объемов данных эти проверки могут занимать значительную долю ресурсов CPU. Vera обеспечивает до 3,67x более высокую пропускную способность CRC32C, чем x86-процессор. Более высокая пропускная способность CRC32C позволяет системам хранения проверять больше данных, не ограничивая чтения или записи проверкой целостности. Для агентных рабочих нагрузок это помогает возвращать надежный контекст, персистентную память и корпоративные данные с меньшей задержкой обработки на стороне CPU.

Преимущества Vera в сжатии и распаковке данных
Преимущества Vera в сжатии и распаковке данных

07Снижение объема данных с помощью более быстрого сжатия и распаковки

Агентный ИИ создает растущие объемы контекста, журналов, контрольных точек, данных извлечения, промежуточных выходных данных и персистентной памяти. Сжатие снижает объем хранилища, необходимый для этих данных, и полосу пропускания, необходимую для их перемещения. Распаковка восстанавливает данные при чтении. Сжатие может выполняться в реальном времени или после записи данных, в зависимости от архитектуры хранения, в то время как распаковка обычно требуется при чтении сжатых данных. Пропускная способность сжатия влияет на то, как быстро данные могут быть уменьшены, а пропускная способность распаковки может влиять на то, как быстро системы хранения возвращают данные приложениям агентного ИИ. Следующие бенчмарки измеряют эти операции независимо.

Vera обеспечивает до 3,29x более высокую пропускную способность сжатия, чем x86-процессор, сохраняя свое преимущество в измеренных количествах потоков. Производительность сжатия варьируется в зависимости от алгоритма, характеристик данных, уровня сжатия, размера буфера и количества потоков, поэтому эти результаты применимы конкретно к измеренным рабочим нагрузкам. Более высокая пропускная способность сжатия позволяет системам хранения уменьшать количество записываемых, хранимых и передаваемых данных, сохраняя производительность обработки на стороне CPU.

Бенчмарк распаковки измеряет соответствующую операцию при чтении сжатых данных. Vera обеспечивает до 1,72x более высокую пропускную способность распаковки, чем x86-процессор при конкурентности, причем ее преимущество увеличивается по мере запуска большего количества рабочих потоков параллельно. Более высокая пропускная способность распаковки помогает системам хранения быстрее возвращать распакованные данные агентам и приложениям. Вместе эти возможности снижают давление на емкость хранилища и полосу пропускания, позволяя каждому процессору сжимать и распаковывать больше данных по мере роста рабочих нагрузок агентного ИИ.

08Ускорение многоэтапного пути записи хранилища

Системы хранения редко выполняют сервисы данных независимо. Безопасный путь записи может сжимать данные для уменьшения их объема, а затем шифровать их перед записью. Набор бенчмарков включает конвейер, residing в памяти, который применяет сжатие, за которым следует шифрование для каждого буфера данных. В отличие от предыдущих бенчмарков, которые измеряли отдельные операции, этот тест измеряет общую пропускную способность конвейера, когда две интенсивные по CPU функции хранилища выполняются последовательно.

Vera обеспечивает до 3,21x более высокую пропускную способность конвейера, чем x86-процессор, используемый в бенчмарке, для двухэтапного конвейера сжатия и шифрования. Этот результат показывает, что преимущество производительности Vera распространяется за пределы отдельных операций, измеренных ранее, на многоэтапную последовательность, характерную для пути записи хранилища, который уменьшает и защищает данные. Более высокая производительность многоэтапного конвейера позволяет системе хранения обрабатывать больше данных на процессор, помогая поддерживать запись с высокой пропускной способностью.

09Что это значит на практике

Для инженеров и архитекторов, работающих с ИИ-инфраструктурой, результаты бенчмарков NVIDIA Vera означают сдвиг парадигмы в проектировании систем хранения. Раньше, чтобы обеспечить достаточную скорость обработки метаданных, шифрования и сжатия для современных GPU, приходилось либо покупать больше серверов с x86-процессорами, либо мириться с тем, что хранилище становится узким местом для GPU. Теперь, благодаря интеграции процессора Vera в BlueField-4 STX, можно достичь той же или большей пропускной способности при меньшем потреблении энергии и занимаемой площади.

Это особенно критично для локальных развертываний в России и других регионах, где доступ к облачным сервисам может быть ограничен, а стоимость электроэнергии и охлаждения является важным фактором. Возможность обрабатывать 3,67x больше проверок целостности и 3,29x больше сжатия на тот же объем вычислительных ресурсов позволяет создавать более плотные и эффективные кластеры хранения. Это напрямую влияет на стоимость владения (TCO) ИИ-фабрик, позволяя масштабировать агентные рабочие нагрузки без линейного роста затрат на инфраструктуру. Вертикальная интеграция архитектуры CPU и GPU от NVIDIA создает единую экосистему, где данные движутся быстрее, безопаснее и с меньшими задержками, что является ключевым требованием для сложных ИИ-приложений следующего поколения.

Источник: NVIDIA Developer ↗