Релиз модели11 августа 2026 г., 16:17 МСК🤖 Auto

NVIDIA Nemotron 3.5 Lightning: 30B MoE-модель для локальных агентов

NVIDIA представила Nemotron 3.5 Lightning — открытую 30B MoE-модель для локальных AI-агентов, обеспечивающую ускорение генерации токенов в 4 раза. Параллельно выпущен NeMo Switchyard для оптимизации затрат.

Баннер новости 5528

Новый стандарт скорости для локальных агентов

11 августа NVIDIA расширила семейство Nemotron 3.5, представив модель Nemotron 3.5 Lightning. Это открытая модель архитектуры Mixture-of-Experts (MoE) с 30 миллиардами параметров, разработанная специально для работы в режиме «всегда включен» (always-on) в локальных AI-агентах. Ключевое преимущество — скорость: модель генерирует токены в 4 раза быстрее и завершает задачи на 30% быстрее, чем аналоги открытого рынка того же класса.

Гибкость через Fine-tuning

Благодаря открытым весам (open weights), разработчики могут дообучать модель под специфические задачи. Это позволяет создавать персонализированных агентов, которые:

  • Пишут в нужном стиле: сохраняют тон, формат и терминологию для отчетов или писем.
  • Изучают ниши: понимают язык и задачи в фото, гейминге или 3D-дизайне.
  • Следуют стандартам кода: придерживаются конкретных фреймворков и подходов к рефакторингу.

Совместимость и развертывание

NVIDIA обеспечила поддержку модели через ключевые инструменты локального развертывания: vLLM, Ollama, llama.cpp, LM Studio и Unsloth. Доступны форматы NVFP4 и GGUF. Модель работает на широком спектре устройств — от NVIDIA RTX PC и Jetson до DGX Spark, GB10 и серверных решений Blackwell от Acer, Dell, Lenovo и других.

NeMo Switchyard: оптимизация затрат

Параллельно представлен NeMo Switchyard — библиотека маршрутизации, которая автоматически направляет каждый шаг агента к наиболее подходящей модели по балансу точности, скорости и цены. Внутренние бенчмарки показывают, что использование системы моделей снижает стоимость выполнения задач до одной трети от стоимости использования только модели Opus 4.8, сохраняя при этом уровень frontier-интеллекта.

Характеристика Nemotron 3.5 Lightning NeMo Switchyard
Тип модели 30B MoE (открытые веса) Библиотека маршрутизации
Ключевая метрика Ускорение генерации в 4x Снижение стоимости до 1/3
Целевое применение Локальные агенты, fine-tuning Оптимизация затрат на токены
Доступность vLLM, Ollama, GGUF, NVFP4 GitHub (open source)

Оба решения доступны для интеграции через NVIDIA NIM микросервисы, OpenRouter и облачных партнеров, что делает их доступными как для энтузиастов, так и для корпоративных пользователей, стремящихся контролировать расходы на AI.

Источник: NVIDIA Blog ↗