В мире искусственного интеллекта, где гонка за параметрами часто затмевает практическую применимость, NVIDIA делает шаг, который может изменить правила игры для разработчиков автономных агентов. Представление NVIDIA Nemotron 3.5 Lightning — это не просто очередное обновление линейки моделей, а стратегический ответ на растущую потребность в эффективных, быстрых и специализированных решениях для долгосрочных агентов. В то время как многие фокусируются на создании гигантских языковых моделей для сложных рассуждений, NVIDIA осознает, что подавляющее большинство работы агентов — это рутинные, высоконагруженные задачи: вызовы инструментов, валидация результатов и делегирование подзадач. Для этих целей использовать «тяжелую артиллерию» в виде фронтальных моделей рассуждений экономически и технически нецелесообразно.
В этой статье мы подробно разберем архитектуру Nemotron 3.5 Lightning, ее уникальные преимущества в виде смеси экспертов (Mixture-of-Experts, MoE), технологии специкулятивного декодирования и квантования, а также то, как эта модель вписывается в экосистему NVIDIA NeMo. Мы рассмотрим, почему эта модель стала идеальным кандидатом для локального запуска на таких устройствах, как DGX Spark, и как она взаимодействует с другими моделями через систему маршрутизации NeMo Switchyard. Это руководство поможет вам понять, как внедрить более эффективные агенты в свои проекты, снизив задержки и затраты без потери качества.

01Почему Nemotron 3.5 Lightning идеален для долгосрочных агентов?
Автоматизированные агенты (Agentic AI) — это программы, которые могут самостоятельно планировать и выполнять сложные задачи, используя внешние инструменты. Однако долгосрочные агенты тратят большую часть своего времени и вычислительных ресурсов на выполнение высоконагруженных, но относительно простых операций. Если каждый шаг такого агента заставить использовать для каждого вызова инструмента или проверки данных передовую модель рассуждений (например, Nemotron 3 Ultra), это приведет к колоссальным задержкам и росту стоимости инференса.
Здесь на сцену выходит Nemotron 3.5 Lightning. Это открытая модель с архитектурой Mixture-of-Experts (MoE), содержащая 30 миллиардов параметров, но при этом активными в каждый момент времени являются лишь 3 миллиарда. Такая архитектура обеспечивает ключевое преимущество: модель обладает емкостью большой плотной модели, но вычислительная стоимость на токен сопоставима с малой моделью. Роутер внутри модели направляет каждый токен только к нескольким «экспертам», что позволяет достигать высокой скорости обработки без ущерба для точности.
Модель разработана специально для работы в составе таких фреймворков, как OpenClaw и Hermes Agent, которые поддерживаются стеком безопасности и управления NVIDIA NemoClaw. Это делает Nemotron 3.5 Lightning не просто набором весов, а готовым компонентом для построения надежных, всегда активных (always-on) агентов. Линейка Nemotron позиционируется как библиотека программного обеспечения, где каждая новая версия улучшает точность и скорость, а развитие систем маршрутизации позволяет эффективно комбинировать модели разного размера и сложности.

Система моделей: разделение труда
Важно понимать контекст, в котором работает Lightning. Современные приложения с ИИ все чаще строятся на основе «системы моделей» (system of models). В этой иерархии фронтальные модели рассуждений, такие как Nemotron 3 Ultra, берут на себя сложные задачи: стратегическое планирование, анализ неопределенности и принятие решений. В то же время, более мелкие и эффективные модели, такие как Nemotron 3.5 Lightning, обрабатывают слой выполнения (execution layer). Они выполняют высоконагруженные задачи с низкой задержкой, такие как форматирование данных, вызов API и валидация ответов. Это разделение труда позволяет оптимизировать использование токенов и повысить общую эффективность системы.
02Технологические инновации: скорость без компромиссов
Производительность Nemotron 3.5 Lightning обеспечивается не только архитектурой MoE, но и рядом специализированных технологий, внедренных на этапе обучения и инференса. Эти инновации позволяют модели достигать скорости вывода, превышающей скорость аналогичных по размеру моделей в 4 раза.
Специкулятивное декодирование (Speculative Decoding)
Одной из главных технологий ускорения является специкулятивное декодирование. В процессе обучения Nemotron 3.5 Lightning была внедрена функция много-токенного прогнозирования (Multi-Token Prediction, MTP). Это означает, что модель не просто предсказывает следующий токен, но и может генерировать несколько токенов одновременно. После основного этапа обучения был проведен дополнительный этап, направленный на улучшение точности MTP.
Для реализации этого механизма NVIDIA предоставляет два специализированные модели-черновика (draft models):
- DSpark: Рекомендуется для рабочих нагрузок на DGX Spark и для сред с низкой конкурентностью в дата-центрах. Оптимальная длина черновика уменьшается по мере роста конкурентности.
- DFlash: Альтернативная модель-черновик, которая может показывать лучшие результаты в зависимости от конкретных сценариев использования.
Квантование NVFP4 и BF16
Для обеспечения совместимости с различным оборудованием, от мощных серверов до настольных ПК, Nemotron 3.5 Lightning поставляется с чекпоинтами в форматах NVFP4 и BF16. Использование специализированных ядер NVFP4, которые также применяются в Nemotron 3 Ultra на GPU NVIDIA Blackwell, Hopper и Ampere, позволяет эффективно сжимать модель без значительной потери точности. Это особенно важно для локального запуска, где ресурсы ограничены.

03Локальный ИИ: запуск на DGX Spark и других устройствах
Одним из самых значимых преимуществ Nemotron 3.5 Lightning является ее доступность для локального развертывания. Модель оптимизирована для работы на широком спектре устройств, включая NVIDIA Jetson, GeForce RTX 5090 и, что особенно важно, NVIDIA DGX Spark.
Компания NVIDIA совместно с командой EXO Labs провела тестирование модели на DGX Spark. Результаты показали, что Nemotron 3.5 Lightning занимает лидирующие позиции на парето-фронте эффективности для малых открытых моделей на локальном лидерборде local.ai. Это означает, что разработчики могут получить высокую точность и скорость выполнения задач прямо на своем рабочем столе, не завися от облачных API.
Кроме того, модель поддерживается индустриальными стандартами инструментов, такими как LM Studio, llama.cpp, Ollama и Unsloth. Это упрощает интеграцию модели в существующие рабочие процессы и позволяет использовать ее даже тем разработчикам, которые не имеют доступа к мощным серверным кластерам.
04NeMo Switchyard: Интеллектуальная маршрутизация задач
Сама по себе мощная модель — это лишь часть головоломки. Чтобы максимизировать эффективность системы, необходимо правильно распределять задачи между моделями. Для этого NVIDIA представила NeMo Switchyard — библиотеку для интеллектуальной маршрутизации запросов.
NeMo Switchyard позволяет развернуть Nemotron 3.5 Lightning вместе с другими открытыми и закрытыми моделями. Система анализирует каждый входящий запрос и направляет его на наиболее подходящую модель. Сложные задачи, требующие глубокого анализа, маршрутизируются к фронтальным моделям (например, Nemotron 3 Ultra), в то время как рутинные задачи, такие как вызовы git pull, валидация выходов инструментов или форматирование результатов, отправляются в Nemotron 3.5 Lightning.
Такой подход обеспечивает оптимальное распределение токенов: вы не тратите дорогие вычисления фронтальной модели на простые операции, но и не рискуете качеством, используя слишком простую модель для сложных задач. NeMo Switchyard делает это разделение труда доступным и автоматизированным, что критически важно для масштабируемых агентов.
05Производительность: Парето-фронт точности и скорости
Эффективность агента определяется не только скоростью генерации токенов, но и тем, насколько быстро модель выполняет полезную работу. Для оценки производительности Nemotron 3.5 Lightning использовались различные бенчмарки, включая Artificial Analysis Intelligence Index и PinchBench.
На индексе Artificial Analysis, который объединяет девять оценок для измерения производительности в задачах агентов, программировании, научных рассуждениях и общей интеллектуальной деятельности, Nemotron 3.5 Lightning демонстрирует ведущую точность при максимальной скорости вывода в своем классе. Модель занимает позицию на парето-фронте точности и скорости, что означает невозможность улучшить один показатель без ухудшения другого в данной категории.
На бенчмарке PinchBench, который измеряет способность моделей выполнять агентные задачи, Nemotron 3.5 Lightning достигла точности 86%, выполнив 10 000 задач на 30% быстрее, чем Qwen3.6 35B при сопоставимой точности. Это подтверждает, что модель не только быстрая, но и эффективная в реальных сценариях использования.

06Кастомизация и экосистема
Одним из главных преимуществ открытых моделей является возможность их тонкой настройки (fine-tuning). Nemotron 3.5 Lightning, благодаря своему относительно небольшому размеру, может быть адаптирована под специфические задачи быстрее, дешевле и на более скромном оборудовании, чем крупные модели.
В рамках лицензии OpenMDW-1.1 NVIDIA предоставляет не только веса модели, но и данные для обучения, а также рецепты (recipes) для настройки. Разработчики могут использовать:
- NeMo Automodel и NeMo Megatron Bridge для тонкой настройки с помощью LoRA или полного обучения (SFT).
- NeMo RL и NeMo Gym для обучения с подкреплением и оценки в средах.
В релиз также включен открытый датасет Nemotron-RL Agentic Terminal Pivot, который использовался для обучения некоторых возможностей кодовых агентов. Это дает разработчикам готовую базу для улучшения способностей модели в программировании и работе с терминалом.
Экосистема вокруг Nemotron 3.5 Lightning быстро растет. В нее входят партнеры в области пост-обработки (AgileRL, Applied Compute, Deep Cogito и др.), программного обеспечения для инференса (Ollama, Exo, Canonical, LM Studio, Unsloth), фреймворков для агентов (Aible, Cline, Factory AI, Hermes Agent, LangChain, OpenClaw и др.), а также облачные провайдеры (AWS SageMaker, Google Cloud, Microsoft Azure) и системные интеграторы (Accenture, TCS, Wipro).

07Что это значит на практике
Для разработчиков и компаний, внедряющих ИИ-агентов, появление Nemotron 3.5 Lightning означает возможность создания более дешевых, быстрых и надежных систем. Вместо того чтобы платить за каждый вызов дорогой фронтальной модели для простых задач, вы можете использовать Lightning для обработки 80-90% рутинных операций. Это снижает затраты на инференс и уменьшает задержки, делая взаимодействие с агентом более отзывчивым.
Локальный запуск на DGX Spark или даже на мощных игровых видеокартах открывает возможности для работы с конфиденциальными данными без отправки их в облако. Интеграция с NeMo Switchyard позволяет строить гибридные системы, где каждая модель делает то, что умеет лучше всего. Если вы только начинаете работу с агентами, Nemotron 3.5 Lightning — отличный выбор для старта благодаря своей открытости, поддержке популярных инструментов и высокой эффективности.
Чтобы начать работу, вы можете попробовать модель на build.nvidia.com или через OpenRouter. Весы доступны на Hugging Face и ModelScope. Для углубленного изучения рекомендуется ознакомиться с cookbook, руководствами по развертыванию с использованием vLLM, SGLang и TensorRT-LLM, а также документацией по NeMo Switchyard. Подписка на новости NVIDIA AI и участие в сообществах на LinkedIn, Discord и YouTube помогут оставаться в курсе последних обновлений и лучших практик.
Источник: NVIDIA Developer ↗
