Релиз модели4 сентября 2026 г., 19:31 МСК🤖 Auto

NVIDIA Jetson: Запуск Frontier-моделей с ускорением до 6.28x

NVIDIA демонстрирует, как компактные модели с рассуждениями (Nemotron 3.5 Lightning и Qwen3.8-27B) работают на edge-устройствах Jetson с помощью NVFP4 и speculative decoding.

Баннер новости 6790

Революция на границе: от облака к Edge

До недавнего времени запуск моделей, способных к многошаговому логическому выводу (reasoning) и работе в режиме агентов, требовал мощных дата-центров. Это создавало задержки, увеличивало стоимость и создавало риски для конфиденциальности данных. Ситуация изменилась: новые компактные open-source модели 2026 года теперь способны выполнять сложные задачи локально на устройствах NVIDIA Jetson, обеспечивая работу автономных роботов, систем обнаружения аномалий и ин-каб ассистентов без подключения к интернету.

Архитектурные различия: MoE против Dense

Ключевым фактором выбора модели для Jetson становится архитектура. NVIDIA сравнивает два флагмана:

  • Nemotron 3.5 Lightning: Микс экспертов (MoE). 30 млрд параметров, но активируется только 3 млрд на токен. Идеален для сценариев, требующих быстрой генерации ответов (response-heavy workflows).
  • Qwen3.8-27B: Плотная модель (Dense). Активирует все 27 млрд параметров. Лучше подходит для задач, требующих глубокого анализа и сложных решений, где время на генерацию одного ответа не критично.

Оптимизация: NVFP4 и Speculative Decoding

Для достижения высокой производительности на edge-железе NVIDIA рекомендует комбинацию двух техник:

  1. NVFP4 квантование: Снижает требования к памяти и вычислительным ресурсам, сохраняя качество, близкое к BF16.
  2. Speculative Decoding: Позволяет генерировать несколько токенов за один шаг верификации с помощью черновой модели (draft model). Для Nemotron 3.5 Lightning лучшим оказался метод DSpark, а для Qwen3.8-27B — DFlash2.

Результаты бенчмарков

Сочетание NVFP4 и оптимизированного speculative decoding дает кратный прирост скорости декодирования по сравнению с базовым BF16. Ниже представлены сравнительные данные эффективности:

Конфигурация Модель Метод ускорения Результат (относительно BF16)
Базовая Nemotron 3.5 Lightning BF16 1x (Baseline)
Оптимизированная Nemotron 3.5 Lightning NVFP4 + DSpark До 6.28x ускорение
Базовая Qwen3.8-27B BF16 1x (Baseline)
Оптимизированная Qwen3.8-27B NVFP4 + DFlash2 Значительный прирост (модель специфична)

Рекомендации по внедрению

Разработчикам не стоит полагаться только на общие бенчмарки. NVIDIA подчеркивает важность валидации на репрезентативных промптах, так как пропускная способность может варьироваться в зависимости от категории рабочей нагрузки. Для Jetson Orin Nano рекомендуется начинать с Gemma 4 E4B, тогда как для AGX Orin и AGX Thor оптимальны Nemotron 3.5 Lightning и Qwen3.8-27B. Развертывание осуществляется через популярные фреймворки, такие как vLLM и llama.cpp.

Источник: NVIDIA dev blog ↗