В мире искусственного интеллекта, где каждый день появляются новые модели, важно не просто знать о существовании архитектуры, но и понимать, где она приносит реальную экономическую и техническую пользу. NVIDIA представила Nemotron 3.5 Lightning, модель, которая позиционируется не как универсальный «мозг» для сложных рассуждений, а как специализированный исполнитель для высокочастотных задач. Это ключевое различие, которое часто упускают из виду, пытаясь использовать одну модель для всего конвейера обработки данных. В этой статье мы подробно разберем, что скрывается за цифрами 30B и 3B, как правильно интегрировать эту модель в свои проекты и почему она может стать идеальным решением для ваших AI-агентов.
Многие разработчики сталкиваются с проблемой: запуск больших языковых моделей (LLM) для простых, рутинных действий обходится слишком дорого и занимает много времени. Nemotron 3.5 Lightning от NVIDIA создана именно для решения этой проблемы. Она использует гибридную архитектуру, сочетающую элементы Mamba-2, внимания и смеси экспертов (Mixture-of-Experts, MoE), что позволяет ей обрабатывать огромные объемы запросов с минимальными задержками. Если вы строите агентов, которые должны выполнять десятки или сотни шагов — от чтения файлов до выбора инструментов — эта модель может стать тем самым «двигателем», который сделает ваш проект масштабируемым.
01Что означает 30B MoE с 3B активными параметрами?
Чтобы понять мощь Nemotron 3.5 Lightning, нужно разобраться в терминологии. Аббревиатура 30B-A3B означает, что модель имеет 30 миллиардов параметров в общей сложности, но для обработки каждого токена активируется только около 3 миллиардов. Это достигается за счет архитектуры Sparse Mixture-of-Experts (MoE). В такой архитектуре «маршрутизатор» выбирает подмножество экспертов для каждого токена, что значительно снижает вычислительные затраты по сравнению с плотными моделями (Dense models), где используются все параметры.
Этот дизайн дает модели большую общую емкость, чем модель с 3B плотных параметров, без необходимости запускать все 30 миллиардов параметров для каждого токена. Именно так Lightning сочетает относительно большой чекпоинт с пропускной способностью, необходимой для частых вызовов агентов. Однако важно понимать, что количество активных параметров — это не полная спецификация вычислений или памяти. Полная модель все еще должна храниться, и общие слои также запускаются во время вывода. Требования к оборудованию зависят от точности, длины контекста, движка вывода, стратегии батчинга и конфигурации кэша.
02Для чего создана Nemotron 3.5 Lightning?
Долгоживущие агенты делают множество вызовов модели. Некоторые вызовы требуют сложного планирования, но большая часть работы является более узкой: выбор инструмента, генерация аргументов, проверка результата, редактирование файла или решение о том, что делать дальше. NVIDIA позиционирует Lightning именно для этого уровня выполнения.
Модель является хорошим кандидатом, если ваша рабочая нагрузка обладает следующими характеристиками:
- Агент делает много вызовов, и задержка или стоимость накапливаются в течение всего выполнения.
- Каждый вызов имеет четкую цель и достаточно контекста для его завершения.
- Модель должна использовать инструменты, следовать инструкциям или возвращать структурированные данные.
- Вам нужны открытые веса, которые можно настроить для конкретной доменной области или целевой среды развертывания.
Например, кодовый агент может использовать более крупную модель для рассуждений, чтобы изучить репозиторий и решить план реализации. Затем Lightning может обрабатывать отдельные шаги, такие как поиск символа, редактирование одного файла, запуск инструмента и интерпретация результата. Это позволяет разделить нагрузку: «мозг» принимает решения, а «руки» выполняют рутину.


03Сравнение с Nemotron 3 Ultra
Важно не путать Nemotron 3.5 Lightning с Nemotron 3 Ultra. NVIDIA дистиллировала Lightning из Ultra, но эти модели не взаимозаменяемы. Lightning — это меньшая модель для высокочастотного выполнения агентов, а Ultra — более крупная модель для сложных рассуждений и оркестрации.
Различие заключается в сложности и последствиях вызова. Ultra является лучшим выбором, когда шаг требует глубоких рассуждений над неоднозначной проблемой, создает план для длительного рабочего процесса или принимает решение, которое дорого отменить. Lightning является лучшим выбором, когда задача четко ограничена и повторяется достаточно часто, чтобы задержка и стоимость имели значение.
Вам не нужно назначать одну модель для всего агента. Вы можете маршрутизировать сложные вызовы в Ultra, а частые вызовы выполнения — в Lightning. Затем измерьте, улучшает ли эта смесь стоимость за завершенную задачу без снижения надежности. NVIDIA сообщает, что Lightning достигает пропускной способности до четырех раз выше, чем у аналогичных открытых моделей. В тестировании PinchBench от NVIDIA она выполнила 10 000 задач агентов на 30% быстрее при сопоставимой точности.
04Длина окна контекста
Nemotron 3.5 Lightning поддерживает до 1 миллиона токенов на уровне модели. Однако контекст, доступный вашему приложению, зависит от конечной точки, которая его обслуживает. На момент написания статьи каждый провайдер за стандартным идентификатором модели (standard model ID) предоставляет окно контекста в 262 144 токена. Лимиты завершения (completion limits) различаются в зависимости от провайдера, от 32 768 до 235 929 токенов.
Модель :free (бесплатная версия) предоставляет полный 1-миллионное окно контекста, но ограничивает завершения 65 536 токенами. Если запрос требует более 262 144 токенов, только бесплатный эндпоинт в настоящее время раскрывает полную 1-миллионную контекстную способность модели на OpenRouter. Однако NVIDIA предупреждает, что использование бесплатного эндпоинта регистрируется в целях безопасности и для улучшения продуктов NVIDIA, и просит не загружать конфиденциальную информацию или персональные данные.
05Открытые веса и локальное развертывание
NVIDIA публикует контрольную точку BF16 под лицензией OpenMDW-1.1. Модельная карточка описывает выпуск BF16 как отправную точку для постобучения, адаптации к домену, исследований и создания оптимизированных вариантов. NVIDIA также публикует данные обучения и рецепты для настройки и оценки, и в карточке модели указано, что выпуск готов к коммерческому использованию.
Для прямого вывода NVIDIA рекомендует свой выпуск NVFP4. Также предоставляется контрольная точка GGUF для поддерживаемых локальных систем. Для развертывания на одном GPU NVIDIA рекомендует H100 80GB или A100 80GB. Оптимизированные выпуски нацелены на такое оборудование, как RTX 5090, RTX PRO 6000 и DGX Spark.
Запуск модели локально не означает, что каждая машина может обслуживать полное 1-миллионное окно контекста. В текущих рекомендациях NVIDIA для Ollama контекст по умолчанию масштабируется в зависимости от доступной VRAM. Он составляет 4K при объеме менее 24 ГБ, 32K от 24 ГБ до менее 48 ГБ и 256K при 48 ГБ и более. Пример llama.cpp использует около 40K. Вы можете повысить эти пределы, и для этого может потребоваться больше памяти или выгрузка на CPU.

06Как вызвать Nemotron 3.5 Lightning на OpenRouter
Если вы не хотите предоставлять GPU или управлять движком вывода, вызывайте Lightning через OpenRouter. Стандартный идентификатор модели сохраняет тот же API, пока мы маршрутизируем запросы между доступными провайдерами для этой модели. Ниже приведен пример кода на TypeScript для вызова модели с использованием структурированного вывода (JSON Schema).
import { OpenRouter } from "@openrouter/sdk"
const openRouter = new OpenRouter({
apiKey: process.env.OPENROUTER_API_KEY
});
const result = await openRouter.chat.send({
chatRequest: {
model: "nvidia/nemotron-3.5-lightning",
messages: [
{
role: "user",
content: 'Ticket: "Checkout returns a 500 after I click Pay. Started this morning, three customers affected." Return its category and priority.'
},
],
responseFormat: {
type: "json_schema",
jsonSchema: {
name: "triage",
strict: true,
schema: {
type: "object",
properties: {
category: { type: "string" },
priority: { type: "string", enum: ["low", "medium", "high"] },
},
required: ["category", "priority"],
additionalProperties: false,
},
},
},
provider: {
requireParameters: true,
},
},
});
if ("choices" in result)) {
throw new Error("Expected a non-streaming response");
}
console.log(result.choices[0]?.message.content);При запуске этого запроса модель вернула {"category": "Bug (Payment Checkout)", "priority": "medium"}. Выборочные результаты варьируются между запусками, и схема, а не значения, является тем, что гарантирует запрос. По умолчанию мы предпочитаем провайдеров, которые поддерживают параметры tools и response_format, которые вы отправляете, и провайдер, который не поддерживает параметр, игнорирует его. Установка require_parameters в true, как в примере, ограничивает запрос провайдерами, которые поддерживают каждый параметр в нем.
Чтобы попробовать бесплатный эндпоинт, измените идентификатор модели на nvidia/nemotron-3.5-lightning:free. Бесплатный эндпоинт не указывает response_format, поэтому удалите это поле там и проверьте JSON самостоятельно. Он полезен для оценки и экспериментов с низкой нагрузкой, и имеет другие пределы и доступность, чем стандартный эндпоинт.
nvidia/nemotron-3.5-lightning:nitro для сортировки провайдеров по пропускной способности и nvidia/nemotron-3.5-lightning:exacto для предпочтения провайдеров с более сильными сигналами качества вызова инструментов. Для модели, выбранной для задержки и использования инструментов, Nitro и Exacto — это два варианта, которые стоит знать.07Что это значит на практике
Nemotron 3.5 Lightning стоит оценивать, когда вам нужна быстрая, открытая модель для частых, четко определенных шагов агента. Ее архитектура 30B-A3B, поддержка инструментов и низкая заявленная цена за токен делают ее кандидатом на роль модели выполнения для агентов, которые в противном случае отправляли бы каждый вызов гораздо более крупной модели рассуждений.
Используйте название модели как отправную точку, а не как окончательное решение. Создайте набор оценки из вызовов инструментов и задач, которые выполняет ваш агент. Измерьте успех задачи, повторные попытки, задержку и общую стоимость в течение всего выполнения. Более дешевый вызов не поможет, если агент повторяет его или эскалирует результат достаточно часто, чтобы свести на нет экономию. Начните с nvidia/nemotron-3.5-lightning или используйте nvidia/nemotron-3.5-lightning:free для тестирования модели перед добавлением платного трафика.
Для российских разработчиков локальный запуск через GGUF или NVFP4 на доступном оборудовании (например, RTX 3090/4090 с 24GB VRAM для базовых задач или A100/H100 для продвинутых сценариев) открывает возможности для создания приватных AI-агентов, не зависящих от зарубежных облачных провайдеров. Это особенно актуально в условиях ограничений на доступ к некоторым сервисам и необходимости обеспечения безопасности данных.
Источник: OpenRouter ↗
