Новый стандарт скорости для локальных агентов
11 августа NVIDIA расширила семейство Nemotron 3.5, представив модель Nemotron 3.5 Lightning. Это открытая модель архитектуры Mixture-of-Experts (MoE) с 30 миллиардами параметров, разработанная специально для работы в режиме «всегда включен» (always-on) в локальных AI-агентах. Ключевое преимущество — скорость: модель генерирует токены в 4 раза быстрее и завершает задачи на 30% быстрее, чем аналоги открытого рынка того же класса.
Гибкость через Fine-tuning
Благодаря открытым весам (open weights), разработчики могут дообучать модель под специфические задачи. Это позволяет создавать персонализированных агентов, которые:
- Пишут в нужном стиле: сохраняют тон, формат и терминологию для отчетов или писем.
- Изучают ниши: понимают язык и задачи в фото, гейминге или 3D-дизайне.
- Следуют стандартам кода: придерживаются конкретных фреймворков и подходов к рефакторингу.
Совместимость и развертывание
NVIDIA обеспечила поддержку модели через ключевые инструменты локального развертывания: vLLM, Ollama, llama.cpp, LM Studio и Unsloth. Доступны форматы NVFP4 и GGUF. Модель работает на широком спектре устройств — от NVIDIA RTX PC и Jetson до DGX Spark, GB10 и серверных решений Blackwell от Acer, Dell, Lenovo и других.
NeMo Switchyard: оптимизация затрат
Параллельно представлен NeMo Switchyard — библиотека маршрутизации, которая автоматически направляет каждый шаг агента к наиболее подходящей модели по балансу точности, скорости и цены. Внутренние бенчмарки показывают, что использование системы моделей снижает стоимость выполнения задач до одной трети от стоимости использования только модели Opus 4.8, сохраняя при этом уровень frontier-интеллекта.
| Характеристика | Nemotron 3.5 Lightning | NeMo Switchyard |
|---|---|---|
| Тип модели | 30B MoE (открытые веса) | Библиотека маршрутизации |
| Ключевая метрика | Ускорение генерации в 4x | Снижение стоимости до 1/3 |
| Целевое применение | Локальные агенты, fine-tuning | Оптимизация затрат на токены |
| Доступность | vLLM, Ollama, GGUF, NVFP4 | GitHub (open source) |
Оба решения доступны для интеграции через NVIDIA NIM микросервисы, OpenRouter и облачных партнеров, что делает их доступными как для энтузиастов, так и для корпоративных пользователей, стремящихся контролировать расходы на AI.
Источник: NVIDIA Blog ↗
