Экосистема NVIDIA продолжает стремительно эволюционировать, и выход CUDA Toolkit 13.4 становится очередным поворотным моментом в истории разработки высокопроизводительных вычислений. Это не просто очередное обновление с исправлением ошибок или незначительным приростом скорости; это стратегический шаг, расширяющий границы применимости CUDA за пределы традиционных Linux-серверов и x86-архитектур. Для разработчиков, исследователей и инженеров, работающих с искусственным интеллектом, научными симуляциями и графическими вычислениями, эта версия предлагает инструменты, которые ранее были доступны только в узкоспециализированных средах. Мы видим здесь четкий курс NVIDIA на демократизацию доступа к мощностям GPU, упрощение процессов развертывания и предоставление более тонкого контроля над аппаратными ресурсами.
В этой статье мы подробно разберем ключевые нововведения CUDA Toolkit 13.4. От долгожданной поддержки Windows on ARM, которая открывает двери для разработчиков на базе соответствующих платформ, до предварительной поддержки будущей архитектуры Rubin. Мы также углубимся в технические детали нового сервиса Multi-Process Service (MPS) версии 3, который меняет правила игры в контейнеризированных средах, и рассмотрим масштабные обновления в библиотеках CUDA Python и CCCL. Если вы планируете мигрировать свои проекты или оптимизировать текущие решения, этот материал станет вашим путеводителем по новым возможностям.
01Windows on ARM: Расширение экосистемы за пределы Linux
Долгое время CUDA-приложения были привязаны к платформе Linux на базе процессоров ARM. Это создавало определенные ограничения для разработчиков, использующих устройства на базе ARM, которые работают под управлением Windows. Выход CUDA Toolkit 13.4 стирает эту границу, добавляя официальную поддержку Windows on ARM. Это означает, что разработчики теперь могут создавать, компилировать и запускать CUDA-приложения непосредственно в среде Windows, используя аппаратные возможности ARM-процессоров NVIDIA.
Почему это важно? Во-первых, это упрощает рабочий процесс для тех, кто предпочитает экосистему Windows для разработки, тестирования или даже продакшена. Во-вторых, это открывает новые возможности для edge-вычислений и мобильных решений, где энергоэффективность ARM-архитектуры сочетается с мощью GPU. Поддержка Windows on ARM не является «превью» или экспериментальной функцией; это полноценная возможность, интегрированная в основной релиз. Это сигнал о том, что NVIDIA видит огромный потенциал в гибридных вычислительных средах и готова предоставлять инструменты для их эффективного использования.
02Предварительная поддержка архитектуры NVIDIA Rubin (Compute Capability 107)
Одним из самых значимых технических нововведений в CUDA Toolkit 13.4 является добавление функциональной поддержки архитектуры NVIDIA Rubin. На момент выхода релиза эта поддержка предоставляется в формате «preview» (предварительная версия), что позволяет разработчикам начать портирование и оптимизацию своих приложений задолго до официального выхода самого оборудования. Rubin — это следующая поколение GPU-архитектуры NVIDIA, которое позиционируется как основа для эры агентного искусственного интеллекта (Agentic AI).
Для разработчиков это означает возможность заранее адаптировать код под новые архитектурные особенности, такие как улучшенная работа с тензорными ядрами, новые механизмы памяти и повышенная пропускная способность. Compute Capability 107 становится новым целевым значением для компиляции. Важно отметить, что хотя поддержка архитектуры добавлена, она не заменяет текущие флагманские решения, но предоставляет критически важную инфраструктуру для будущего. Это позволяет компаниям и исследователям готовиться к переходу на новые платформы без простоев в разработке.

03MPS V3: Революция в управлении общими GPU
Многопроцессный сервис (Multi-Process Service, MPS) всегда был важным инструментом для повышения утилизации GPU в серверных средах, позволяя нескольким процессам разделять один GPU. Однако старая версия MPS требовала сложной настройки и не всегда легко интегрировалась в современные контейнеризованные среды, такие как Docker или Kubernetes. CUDA Toolkit 13.4 представляет MPS версии 3 (MPS V3), которая полностью переосмысливает подход к управлению ресурсами GPU.
MPS V3 вводит современный слой управления с несколькими ключевыми улучшениями:
- Скриптуемый CLI: Теперь управление серверами MPS можно автоматизировать через командную строку, что критически важно для оркестраторов контейнеров.
- Именованные экземпляры серверов: Разработчики могут создавать именованные инстансы MPS, что упрощает организацию и изоляцию рабочих нагрузок.
- Конфигурация TOML: Поддержка файлов конфигурации в формате TOML делает настройки более читаемыми и удобными для версионного контроля.
- Интеграция с cgroup: Это, пожалуй, самое важное изменение для контейнеризации. MPS V3 интегрируется с cgroup (control groups) Linux, позволяя задавать строгие лимиты памяти GPU для каждого процесса. Это обеспечивает точное разделение GPU, где производительность вычислений, границы памяти и приоритеты выполнения определяются программно.
Такой подход гарантирует, что MPS может быть seamlessly интегрирован в контейнеризованные среды, максимизируя использование аппаратного обеспечения при сохранении строгой изоляции ресурсов для каждого процесса. Это решает одну из самых болезненных проблем в облачных вычислениях — «шумных соседей», когда один процесс может исчерпать все ресурсы GPU, оставив другие без работы.

Источник: NVIDIA Developer ↗
