Релиз модели11 августа 2026 г., 16:18 МСК🤖 Auto

NVIDIA Nemotron 3.5 Lightning: 30B-модель для агентов с ускорением x4

NVIDIA представила Nemotron 3.5 Lightning — 30-миллиардную MoE-модель для агентов, ускоряющую задачи на 30% и снижающую затраты через библиотеку маршрутизации NeMo Switchyard.

Баннер новости 5529

Архитектура для Always-On агентов

NVIDIA расширяет семейство Nemotron 3 выпуском Nemotron 3.5 Lightning. Это открытая модель с 30 миллиардами параметров, использующая архитектуру Mixture-of-Experts (MoE). Она создана для работы в составе систем из нескольких моделей (model ensembles), где крупные модели (например, Nemotron 3 Ultra) планируют задачи, а Lightning выполняет специализированные операции: код-ревью, мониторинг безопасности или ответы на вопросы.

Модель разработана при участии Nemotron Coalition и доступна для пост-обучения (post-training) через NeMo на корпоративных данных, что позволяет повысить точность в узких доменах без потери скорости.

Производительность и бенчмарки

Ключевое преимущество Lightning — скорость. Модель обеспечивает вывод результатов до 4 раз быстрее аналогов в своем классе, что сокращает время завершения агентных задач на 30%. Тестирование по методологии PinchBench подтверждает уровень точности, сопоставимый с frontier-моделями, при значительно меньших вычислительных затратах.

NeMo Switchyard: Интеллектуальная маршрутизация

Параллельно выпущена библиотека NeMo Switchyard для умной маршрутизации запросов. Она автоматически направляет промпты к наиболее подходящей модели (по скорости, стоимости или качеству) без переписывания кода приложения. Внутренние тесты NVIDIA показывают, что использование Switchyard снижает стоимость завершения задачи почти до 1/3 от стоимости использования Opus 4.8 при сохранении frontier-точности.

Результаты интеграции с партнерами

Различные компании уже внедрили решения NVIDIA, получив значительное снижение затрат:

Партнер Результат внедрения
LangChain Снижение стоимости на 74% в 145 многошаговых задачах (маршрутизация только 7% запросов к frontier-моделям)
Ramp Снижение затрат на 58% и времени выполнения на 33% в бенчмарке Ramp SWE-Bench
Cognition Снижение средних затрат на 28% при сохранении производительности на уровне FrontierCode Main
Classmethod Снижение затрат на 27% при сохранении качества работы с opencode и Fireworks
Boomi 100% точность маршрутизации по доменам, 59% трафика перенаправлено на модель в 5 раз быстрее

Доступность и развертывание

Nemotron 3.5 Lightning можно развернуть локально на NVIDIA RTX, DGX Spark, DGX Station и Jetson, а также в облаке. Модель доступна на Hugging Face, ModelScope, OpenRouter и как NIM-микросервис. Библиотека NeMo Switchyard открыта на GitHub. Также выпущен датасет Nemotron-RL-Agentic-Terminal-Pivot для дообучения моделей под задачи кодинга.

Источник: NVIDIA Blog ↗