Главная/Блог/Обзор/NVIDIA DGX Spark 64GB: Локальный…
Обзор4 мин чтения · 3 октября 2026 г.

NVIDIA DGX Spark 64GB: Локальный AI-агент на Grace Blackwell

Обзор нового десктопного решения NVIDIA DGX Spark 64GB на базе GB10. Разбор производительности, поддержки моделей и сценариев использования для локального AI.

NVIDIA DGX Spark 64GB: Локальный AI-агент на Grace Blackwell

NVIDIA представила новую конфигурацию системы DGX Spark с 64 ГБ унифицированной памяти. Это компактное решение на базе суперчипа GB10 (Grace + Blackwell) позиционируется как идеальная платформа для запуска локальных AI-агентов, дообучения моделей (fine-tuning) и инференса без зависимости от облачных API. Устройство от Acer, ASUS, Dell, Gigabyte, HP и MSI позволяет разработчикам начать с одной станции и масштабироваться, объединяя несколько узлов в кластер.

01Железо и архитектура GB10

Сердце DGX Spark — чип GB10, объединяющий 20-ядерный ARM-процессор Grace (10x Cortex-X925 + 10x Cortex-A725) и GPU Blackwell с тензорными ядрами 5-го поколения. Ключевая особенность — унифицированная память LPDDR5x объемом 64 ГБ, доступная одновременно для CPU и GPU через шину NVLink-C2C. Это исключает копирование весов между системной и видеопамятью, что критично для агентов, работающих с длинными контекстами.

Производительность AI-вычислений достигает 1 petaFLOP в формате FP4 (со спарсностью). Пропускная способность памяти заметно выше, чем у стандартных решений, обеспечивая эффективную передачу данных. Система работает от стандартной розетки, не требует серверного охлаждения и имеет компактные размеры.

💡
Важно для практиков. Унифицированная память позволяет держать в адресном пространстве несколько моделей, их KV-кэши и процессы инструментов одновременно, без накладных расходов на передачу данных по шине PCIe.

02Спецификации и комплектация

Система поставляется с предустановленной NVIDIA DGX OS (на базе Ubuntu) и полным стеком AI-инструментов. Ниже приведены ключевые технические характеристики актуальной версии 64GB.

Параметр Значение
Суперчип NVIDIA GB10 Grace Blackwell
AI-вычисления До 1 petaFLOP (FP4, со спарсностью)
Память 64 ГБ LPDDR5x (coherent unified)
Пропускная способность Высокая пропускная способность памяти
Хранилище Различные варианты NVMe M.2 (self-encrypting)
Сеть ConnectX-7 NIC (200GbE), Wi-Fi 7, BT 5.3
ОС NVIDIA DGX OS (Ubuntu-based)

03Какие модели запустятся на 64 ГБ

64 ГБ памяти достаточно для моделей класса 30–35B параметров. Для агентов, требующих длинного контекста и инструментов, оптимальны следующие модели:

  • Muse Glimmer (Meta): 29.6B dense. В квантованном виде занимает ~17 ГБ. Отлично подходит для основных задач агента, поддерживает контекст до 131K токенов. Полная версия BF16 требует 55+ ГБ, что оставляет мало места для кэша.
  • Nemotron 3.5 Lightning (NVIDIA): 30B MoE (30B-A3B). Оптимизирована под GB10, использует формат NVFP4. Идеальна как быстрый исполнитель для долгих сессий агентов.
  • Qwen3.8-27B (Alibaba): 27B dense. Веса 4-bit занимают ~13.5 ГБ. Универсальная модель для кодирования и общих задач.

Для моделей крупнее 100B параметров (например, DeepSeek V4 Flash) потребуется кластеризация нескольких устройств или использование версии DGX Spark на 128 ГБ.

⚠️
Предупреждение по VRAM. Оценки занимаемого места приведены только для весов моделей. KV-кэш и накладные расходы рантайма (vLLM, Ollama) требуют дополнительного места в памяти. При длинных контекстах свободных 64 ГБ может не хватить для больших моделей.

04Сценарии использования: 5 идей

  1. Всегда онлайн персональный агент: Установите Hermes и подключите Muse Glimmer. Дайте доступ к GitHub, RSS и локальным заметкам. Агент может работать ночью, обрабатывая задачи без отправки данных в облако.
  2. Дообучение (Fine-tuning) кодовых моделей: QLoRA на модели 70B помещается в 64 ГБ. NVIDIA замерила скорость при распределенном дообучении nanochat. Вы можете обучить ассистента на внутренней документации.
  3. Оценка моделей (Model Eval): Запускайте новые open-weight модели через Ollama или vLLM в день выхода. Сравнивайте TTFT (Time To First Token) и точность без затрат на API-запросы.
  4. Мультиагентная команда: Используйте унифицированную память для запуска нескольких моделей одновременно. Например, Bonsai 2 как роутер (~6 ГБ) и Glimmer как основной агент (~17 ГБ). Оставшаяся память идет под кэш и ОС.
  5. Прототипирование для Edge: Обучите vision transformer локально на CUDA, затем разверните на NVIDIA Jetson для промышленного использования.

05Кластеризация: от 1 к 4 узлам

Каждый DGX Spark оснащен сетевым адаптером ConnectX-7 (200GbE). Это позволяет объединять устройства в кластер для увеличения памяти и вычислительной мощности. Управление осуществляется через NVIDIA Sync (доступно для Windows/macOS).

Схема масштабирования:

Конфигурация Общая память AI Compute (FP4) Подключение
1 Spark (64GB) 64 ГБ 1 PFLOP —
2 Sparks (64GB) 128 ГБ 2 PFLOP Прямой QSFP кабель
2 Sparks (128GB) 256 ГБ 2 PFLOP Прямой QSFP кабель
4 Sparks (128GB) 512 ГБ 4 PFLOP 200GbE Switch (QSFP56-DD)

Два объединенных узла 64GB дают заметный прирост производительности.

Источник: MarkTechPost ↗