Запуск моделей уровня Frontier (SOTA) на edge-устройствах долгое время было невозможным из-за ограничений по памяти и вычислительной мощности. Однако, с выходом компактных открытых моделей в 2026 году, ситуация изменилась. NVIDIA Jetson теперь способен локально обрабатывать сложные задачи рассуждения (reasoning) и агентных систем без зависимости от облака. В этой статье разберем, как развернуть Nemotron 3.5 Lightning и Qwen3.8-27B, используя оптимизации NVFP4 и speculative decoding для достижения максимальной пропускной способности.
01Выбор архитектуры: MoE против Dense
Ключевое различие между моделями для edge-деплоя заключается в архитектуре. Выбор зависит от типа рабочей нагрузки вашего агента:
- Nemotron 3.5 Lightning (MoE): Микс экспертов (Mixture-of-Experts). Всего 30 млрд параметров, но на каждый токен активируется только 3 млрд. Идеально для сценариев, требующих быстрой генерации большого количества токенов (response-heavy workflows). Меньшая нагрузка на память при инференсе.
- Qwen3.8-27B (Dense): Плотная модель. Активируются все 27 млрд параметров на каждый токен. Лучше подходит для задач, требующих глубоких, сложных решений, где агент может позволить себе больше времени на генерацию каждого ответа.
02Оптимизация: NVFP4 и Speculative Decoding
Для достижения высокой производительности на Jetson необходимо комбинировать две техники:
- NVFP4 Quantization: Снижает точность вычислений до 4 бит. Это уменьшает объем перемещаемых данных и потребление памяти, сохраняя качество, близкое к BF16.
- Speculative Decoding: Метод, при котором маленькая "draft"-модель предлагает несколько токенов, а основная модель проверяет их за один шаг. Если проверка успешна, генерация продвигается сразу на несколько токенов.
Совместное использование этих методов дает заметное ускорение декодирования по сравнению с базовым BF16.
03Практический деплой на Jetson
Для развертывания требуется Jetson AGX Thor или AGX Orin с установленным JetPack, Docker и NVIDIA Container Runtime. Ниже приведены примеры команд для запуска через vLLM.
1. Запуск Nemotron 3.5 Lightning (NVFP4 + DSpark)
Эта конфигурация оптимизирована для максимальной скорости генерации токенов.
# Запуск Nemotron 3.5 Lightning с NVFP4 квантованием и DSpark
vllm serve \
--model nemotron-3.5-lightning \
--quantization nvfp4 \
--speculative-model draft-checkpoint-dspark \
--max-model-len 40962. Запуск Qwen3.8-27B (NVFP4 + DFlash2)
Для плотной модели Qwen оптимальным является метод DFlash2.
# Запуск Qwen3.8-27B с NVFP4 квантованием и DFlash2
vllm serve \
--model Qwen3.8-27B \
--quantization nvfp4 \
--speculative-model draft-checkpoint-dflash2 \
--max-model-len 40963. Валидация производительности
Не полагайтесь только на бенчмарки. Проведите валидацию на репрезентативных промптах вашей предметной области, чтобы убедиться, что квантование и speculative decoding не ухудшили качество ответов для критичных сценариев.
04Кому подойдёт / что запустится
| Платформа | Рекомендуемая модель | Оптимизация | Сценарий использования |
|---|---|---|---|
| Jetson Orin Nano | Компактные модели | INT4 / FP8 | Легкие агенты, классификация, простые чат-боты |
| Jetson AGX Orin | Nemotron 3.5 Lightning | NVFP4 + DSpark | Агенты с высокой частотой ответов, мониторинг в реальном времени |
| Jetson AGX Thor | Qwen3.8-27B | NVFP4 + DFlash2 | Сложные рассуждения, анализ логов, принятие решений |
Данные решения позволяют развертывать локальные AI-ассистенты для бортовых систем, роботов в удаленных локациях и систем обнаружения аномалий без задержек, связанных с сетью.
Источник: NVIDIA Developer ↗
