Релиз модели11 августа 2026 г., 16:17 МСК🤖 Auto

NVIDIA Nemotron 3.5 Lightning: 30B MoE-модель для агентов с ускорением x4

NVIDIA представила Nemotron 3.5 Lightning — открытую MoE-модель на 30B параметров (3B активных), оптимизированную для высокочастотных задач AI-агентов. Модель обеспечивает до 4x прирост скорости вывода и 30% ускорение выполнения задач по сравнению с

Баннер новости 5527

Архитектура и специфика для Agentic AI

11 августа 2026 года NVIDIA выпустила Nemotron 3.5 Lightning, модель семейства Nemotron 3, спроектированную специально для слоя выполнения (execution layer) в долгосрочных AI-агентах. В отличие от тяжелых моделей-рассуждений (frontier reasoning models), которые берут на себя планирование, Lightning обрабатывает рутинные, но объемные задачи: вызовы инструментов, валидацию результатов и делегирование подзадачам.

Модель использует архитектуру Mixture-of-Experts (MoE) с общим объемом в 30 миллиардов параметров, но активирует лишь 3 миллиарда на каждый токен. Это позволяет достигать вычислительной эффективности компактных моделей при сохранении интеллектуальной емкости больших сетей. Модель поддерживает развертывание на любых устройствах — от локальных NVIDIA DGX Spark до крупных дата-центров.

Производительность и бенчмарки

Nemotron 3.5 Lightning позиционируется как лидер на «Парето-фронте» точности и скорости. Согласно данным Artificial Analysis Intelligence Index и PinchBench, модель демонстрирует выдающиеся результаты в сравнении с аналогами. Ключевые метрики эффективности:

Метрика / Бенчмарк Результат Nemotron 3.5 Lightning Сравнение / Контекст
Скорость вывода (Output Speed) До 4x быстрее По сравнению с моделями схожего размера
PinchBench (10 000 задач) 86% точности На 30% быстрее завершает задачи, чем Qwen3.6 35B при сопоставимой точности
Архитектура 30B MoE (3B active) Оптимизировано для high-volume, low-latency выполнения

Технологические инновации: Speculative Decoding и Quantization

Высокая скорость достигается за счет внедрения speculative decoding (спекулятивного декодирования) и много-токенного предсказания (Multi-Token Prediction, MTP), которые были заложены еще на этапе pretraining. NVIDIA также предоставляет два специализированных draft-модели для ускорения инференса:

  • DSpark: Оптимизирована для инференса на DGX Spark и сценариев с низкой конкурентностью в ЦОД.
  • DFlash: Предназначена для сред с высокой конкурентностью, где оптимальная длина черновика снижается по мере роста нагрузки.

Модель поддерживает квантование в форматах NVFP4 и BF16, что критически важно для снижения требований к памяти и пропускной способности шины при работе в режиме 24/7.

Экосистема: NeMo Switchyard и OpenMDW-1.1

Для управления потоками задач NVIDIA представила библиотеку NeMo Switchyard. Этот инструмент обеспечивает интеллектуальное маршрутизацию запросов: сложные задачи отправляются на фронтальные модели (например, Nemotron 3 Ultra), а рутинные — на Nemotron 3.5 Lightning. Это позволяет оптимизировать расход токенов и снижать задержки.

Веса, данные для обучения и рецепты (recipes) опубликованы под лицензией OpenMDW-1.1. Разработчики могут дообучать модель с помощью LoRA или полного SFT через NeMo Automodel, а также использовать датасет Nemotron-RL Agentic Terminal Pivot для улучшения навыков кодинга и агентных действий.

Бенчмарки

БенчмаркNVIDIA Nemotron 3.5 LightningQwen3.6 35B
PinchBench86%86%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: NVIDIA dev blog ↗