Главная/Блог/Гайд/NVIDIA NeMo Switchyard: Маршрутизация…
Гайд11 мин чтения · 12 августа 2026 г.

NVIDIA NeMo Switchyard: Маршрутизация AI-агентов для оптимизации затрат и качества

Узнайте, как NVIDIA NeMo Switchyard позволяет динамически распределять задачи AI-агентов между различными моделями, балансируя между производительностью, стоимостью и эффективностью.

NVIDIA NeMo Switchyard: Маршрутизация AI-агентов для оптимизации затрат и качества

Создание надежного AI-агента — это не просто выбор одной мощной языковой модели и запуск её в работу. Это сложный инженерный процесс, требующий понимания того, что каждая модель обладает своими уникальными сильными сторонами, слабостями и, что критически важно, профилем затрат. Эти характеристики могут меняться от одной рабочей нагрузки к другой или даже внутри одного и того же рабочего процесса. Например, задача агента может требовать быстрой классификации на одном этапе, глубокого логического рассуждения на следующем и использования более легкой модели для рутинных задач подтверждения. Отправка каждого запроса в самую большую и дорогую модель приводит к неоправданному росту затрат и задержек, тогда как использование только малых моделей может снизить качество выполнения сложных задач.

Здесь на сцену выходит маршрутизация моделей (model routing). Этот подход позволяет оркестровать работу специализированных и передовых (frontier) моделей так, чтобы каждая задача выполнялась моделью, наиболее подходящей для нее. NVIDIA NeMo Switchyard превращает эту сложную инженерную проблему в практическое решение для рабочих нагрузок агентов. Разработчики получают возможность маршрутизировать запросы между моделями, не перестраивая свои приложения вокруг выбора конкретного провайдера или модели. В этой статье мы подробно разберем, как работает NeMo Switchyard, какие алгоритмы маршрутизации он предлагает и как это решение помогает бизнесу экономить ресурсы без потери качества.

01Как принимают решения маршрутизаторы моделей

Чтобы понять ценность маршрутизации, рассмотрим систему моделей, выполняющую задачу компьютерного использования (computer-use), измеренную с помощью бенчмарка Terminal-Bench Hard. Как показывает анализ, даже если модель DeepSeek V4 демонстрирует самую высокую общую точность, она не является лучшей для каждой группы задач. Например, для групп задач, связанных с машинным обучением (ML) и обучением с подкреплением (RL), модель Kimi K2.6 может быть более подходящей, а для математики и науки предпочтительнее Qwen3.5 397B A17B. Остальные шесть групп задач лучше всего выполнять с помощью DeepSeek V4. Такой подход можно применять как на уровне отдельных задач, так и на разных этапах решения одной сложной задачи.

Точность моделей на различных группах задач в Terminal-Bench Hard с агентом Terminus
Точность моделей на различных группах задач в Terminal-Bench Hard с агентом Terminus

Однако точность — не единственный фактор. Стоимость и время завершения значительно усложняют принятие решений. Каждая модель имеет свои затраты на запуск или доступ, а также свой профиль «болтливости» (verbosity), который относится не только к количеству токенов, но и к количеству вызовов инструментов (tool calls). Построение эффективного маршрутизатора требует учета сигналов из различных источников. В целом, эффективные решения о маршрутизации опираются на три ключевые области:

  • Возможности модели (Model capabilities): Какая модель способна правильно решить задачу?
  • Профиль стоимости модели (Model cost profile): Какие задержки и финансовые затраты связаны с каждой моделью?
  • Инфраструктура (Infrastructure): Системные сигналы, обеспечивающие надежные и бесшовные передачи данных между компонентами.

Для анализа сигналов возможностей и стоимости маршрутизатор может смотреть на сам запрос. Например, классификатор может определить тему запроса, сопоставить её с моделью в пуле и направить запрос соответствующим образом. Также используются модели встраивания (embedding models) или создатели признаков (feature crafters) для извлечения характеристик из запроса. Кроме того, маршрутизатор может анализировать состояния моделей, такие как logprobs, каскады, оценки трассировки агента, остаточные потоки (residual streams) моделей, матрицы внимания и другие метрики. Наконец, учитываются системные сигналы: ценообразование, задержка, нагрузка и специфические для агента сигналы, такие как ошибки.

💡
Важный нюанс. Маршрутизатор должен учитывать не только какие сигналы использовать, но и когда и где их оценивать. Например, для многошаговой задачи агента маршрутизатор может направлять весь запрос на конкретную модель или принимать решения на каждом шаге. Вся система может использовать общий пул, или под-агенты могут использовать специализированные пулы моделей для своих задач.

02Как NeMo Switchyard обеспечивает маршрутизацию

NeMo Switchyard решает эти вызовы с помощью интеллектуального уровня оркестрации, который поддерживает несколько маршрутизаторов. Разработчики также могут приносить свои собственные алгоритмы маршрутизации или данные для настройки. Фундаментом системы является NeMo Switchyard-libsy — провайдер-агностический SDK (Software Development Kit). Он представляет запросы, определяет доступные модели для системы и управляет вызовами к выбранной модели.

Каждая целевая модель имеет семантическое имя, а клиент, стоящий за ней, сопоставляет это имя с конечной точкой провайдера и идентификатором модели. Это разделение сохраняет логику маршрутизации независимой от конкретного провайдера. Это критически важно, потому что развертывание моделей постоянно меняется. Команда может обновить модель, переместить её на другой endpoint или использовать другого провайдера, не меняя интеграцию маршрутизации. NeMo Switchyard позволяет вызывать модель через целевой клиент или возвращать вызов хост-приложению, давая среде выполнения агента, платформе вывода или шлюзу контроль над тем, как обслуживаются запросы, сохраняя при этом тот же контракт маршрутизации.

Архитектурная диаграмма NeMo Switchyard, показывающая взаимодействие компонентов
Архитектурная диаграмма NeMo Switchyard, показывающая взаимодействие компонентов

Сервер NeMo Switchyard служит эталоном для предоставления маршрутизации через общие API, имитируя шлюз LLM. Он принимает запросы в форматах OpenAI, Anthropic и Responses API, преобразует их во внутренний формат запроса NeMo Switchyard и возвращает ожидаемый формат ответа. Он также записывает выбранную модель, обоснование решения, использование токенов, задержку и результаты вызовов, что позволяет командам проверять работу маршрутизации в реальном времени.

Кроме того, NeMo Switchyard может переносить состояние маршрутизации через сессию агента, если политика требует этого. Он может сохранять информацию из предыдущих шагов, такую как результаты инструментов или решения об аффилированности, и делать этот контекст доступным для последующих решений о маршрутизации. Маршрут может оставаться без состояния (stateless), если эта история не нужна.

03Алгоритмы маршрутизации в NeMo Switchyard

С инфраструктурой на месте следующим шагом является рассмотрение подходов к маршрутизации, которые её используют. NeMo Switchyard предлагает как маршрутизаторы, не требующие настройки (tuning-free), так и настраиваемые (tunable) маршрутизаторы.

Маршрутизаторы, не требующие настройки (Tuning-free routers)

NeMo Switchyard включает несколько таких маршрутизаторов, которые принимают решения без обучения на данных конкретной рабочей нагрузки:

  1. Классификатор LLM (LLM classifier): Использует LLM в качестве судьи для выбора кандидата и поддерживает привязку сессии (session affinity) к этой модели в последующих шагах. Это предотвращает повторную классификацию работы, которая не изменилась существенно в процессе решения задачи агентом. Этот подход подходит для систем без интерфейса (headless) и узкоспециализированных доменов. Например, задачи по кодированию, математике или здравоохранению можно направлять на выбранные целевые модели, в то время как NeMo Switchyard обеспечивает маршрутизацию и управление состоянием.
  2. Маршрутизатор этапов (Stage router): Агент по кодированию проходит через разные этапы. На ранних стадиях он исследует кодовую базу и восстанавливается после ошибок. Позже он переходит к более механической реализации. Эти этапы требуют разного уровня возможностей модели, что использует маршрутизатор этапов для принятия решений. Для каждого шага маршрутизатор анализирует недавнюю активность инструментов, чтобы решить, какой уровень возможностей модели нужен агенту. Серьезные ошибки, повторяющаяся непродуктивная работа или длительное исследование направляют шаг к более мощной модели. Стабильное написание и редактирование, особенно после прохождения тестов, благоприятствуют более эффективной модели. Если сигналы неоднозначны, маршрутизатор может проконсультироваться с судьей LLM перед возвратом к настроенному значению по умолчанию.
  3. Маршрутизатор эскалации (Escalation router): Начинает каждый разговор с более дешевой модели. LLM-судья отслеживает прогресс задачи шаг за шагом и переводит сессию на более мощную модель, когда обнаруживает устойчивые трудности. Этот подход предназначен для многошаговых рабочих нагрузок агентов, где меньшая модель может обрабатывать рутинную работу, но может нуждаться в поддержке после повторяющихся ошибок, циклов или дрейфа, расширяя подход классификатора LLM от статического к адаптивному.
Производительность NeMo Switchyard в сравнении с базовыми моделями
Производительность NeMo Switchyard в сравнении с базовыми моделями

Настраиваемые маршрутизаторы (Tunable routers)

Настраиваемые маршрутизаторы строятся на этом фундаменте, заменяя фиксированные эвристики сигналами, изученными из реальных данных рабочей нагрузки. Вместо того чтобы определять, какая модель наиболее подходит на основе текста запроса, настраиваемый маршрутизатор может научиться предсказывать, насколько вероятно, что каждая кандидирующая модель правильно ответит на запрос.

Маршрутизатор префилла (Prefill router): Во время обучения этот маршрутизатор извлекает остаточный поток (residual stream) LLM, чтобы оценить сложность запроса. Общий MLP-ствол (shared-trunk MLP) использует сигналы из остаточного потока и сопоставляет их с метками точности для каждой LLM в пуле маршрутизации. Во время вывода состояния префилла действуют как вход для маршрутизатора, а общий ствол предсказывает вероятность того, что каждая LLM успешно выполнит задачу или ответит на запрос. Маршрутизатор затем применяет политику, которая сочетает предсказанную точность со стоимостью, задержкой или другими ограничениями развертывания. Каждая кандидирующая модель получает оценку, и запрос направляется модели с лучшим компромиссом для данной рабочей нагрузки. Как показывает практика, маршрутизация — это не просто выбор самой сильной модели, а выбор модели, с наибольшей вероятностью удовлетворяющей требуемому уровню качества при правильной стоимости.

Зависимость точности от общей стоимости тестового набора для обученного маршрутизатора префилла
Зависимость точности от общей стоимости тестового набора для обученного маршрутизатора префилла

04Повышение эффективности агентов с помощью NeMo Switchyard

NVIDIA работает с партнерами по всей экосистеме агентов, моделей и корпоративных приложений, чтобы интегрировать маршрутизацию моделей NeMo Switchyard в существующие рабочие процессы разработчиков без отдельной настройки. Эти сотрудничества включают:

  • Рабочие процессы агентов: Рабочие процессы агентов по кодированию с Cognition, легко настраиваемая маршрутизация моделей Hermes Agent с Nous Research, рабочие процессы финансовой инженерии программного обеспечения с Ramp и оценка маршрутизации моделей с LangChain.
  • Интеграции приложений и инфраструктуры: Стек приложений LLM в виде плагина с LiteLLM; шлюз AI, управление governance и трафиком API с Kong; маршрутизация моделей Claude с Classmethod; корпоративная автоматизация и подключение с Boomi Agent Garden.
  • Отраслевые AI-агенты: Рабочие процессы формальной верификации с Cadence в ChipStack AI Super Agent и рабочие процессы агентов EDA с Siemens.

LangChain протестировал NeMo Switchyard, используя свой внутренний набор оценки глубоких агентов, который включает 145 многошаговых агентных задач, отражающих производственные нагрузки, такие как диалог службы поддержки клиентов в рамках политик, расследование инцидентов в режиме on-call и автоматизация многошаговых рабочих процессов через мессенджеры, отслеживание проблем и электронную почту. Набор оценивает использование инструментов, многошаговый поиск, операции с файловой системой и суммаризацию длинного контекста, с сценариями, заимствованными из τ²-bench airline, Berkeley Function Calling Leaderboard, FRAMES и Nexus.

По результатам пяти запусков, маршрутизация запросов между NVIDIA Nemotron 3.5 Lightning и Claude Opus 4.8 с использованием маршрутизатора эскалации обеспечила снижение затрат на 74% по сравнению с базовым уровнем, использующим только передовые модели, отправив всего 7% вызовов на передовую модель, при измеренном компромиссе точности примерно в 6 пунктов. Это демонстрирует колоссальную экономию при сохранении приемлемого качества.

Сравнение производительности и стоимости при использовании маршрутизации по этапам в Devin Desktop
Сравнение производительности и стоимости при использовании маршрутизации по этапам в Devin Desktop

Компания Cognition реализовала методологию маршрутизации по этапам NeMo Switchyard в Devin Desktop и развернула её для внутренних пользователей NVIDIA для реального тестирования. На FrontierCode Main — бенчмарке Cognition для задач кодирования производственного класса — реализация маршрутизировала между Opus 5 и Kimi K2.7. Она обеспечила производительность, близкую к передовому уровню, достигнув 50,6% при средней стоимости $3,11 — в пределах 2,8 процентных пунктов от точности Opus 5 при примерно на 28% более низкой средней стоимости.

📌
Практический результат. Совместно бенчмарк и внутреннее развертывание предоставляют практический кейс для модельно-нейтральных и адаптивных агентов, показывая, как комплементарные сильные стороны разных моделей могут применяться динамически по мере эволюции задачи.

05Что это значит на практике

Для разработчиков и инженеров, работающих с AI-агентами, внедрение NeMo Switchyard означает переход от статической архитектуры «одна модель для всех задач» к динамической, адаптивной системе. Это позволяет существенно оптимизировать затраты на inference, не жертвуя качеством результатов. Вместо того чтобы платить премию за использование самых дорогих моделей (таких как Claude Opus или GPT-4o) для каждой мелкой задачи, вы можете использовать более дешевые и быстрые модели (такие как Nemotron или Qwen) для рутинных операций, эскалируя запросы к мощным моделям только тогда, когда это действительно необходимо — например, при обнаружении сложных ошибок или необходимости глубокого логического вывода.

Кроме того, провайдер-агностический подход NeMo Switchyard защищает ваши инвестиции. Если провайдер модели изменит цены, повысит задержки или прекратит поддержку, вы можете переключить трафик на другую модель или провайдера, изменив лишь конфигурацию конечной точки, а не переписывая логику вашего агента. Это обеспечивает гибкость и устойчивость вашей AI-инфраструктуры в долгосрочной перспективе.

Разработчики могут начать с интеграций партнеров, которые приносят NeMo Switchyard в знакомые инструменты агентов, фреймворки и шлюзы, или создать собственную маршрутизацию в своих агентах и шлюзах LLM, используя инструкции NeMo Switchyard на GitHub. Система полностью открыта, что позволяет вносить свой вклад в развитие алгоритмов маршрутизации, адаптированных под специфические_use cases_ вашей компании.

⚠️
Важно помнить. Хотя маршрутизация моделей позволяет системам специализированных и передовых моделей работать вместе, создавая результат, больший, чем сумма его частей, построение полезной и готовой к производству системы маршрутизации остается сложной инженерной задачей. NeMo Switchyard упрощает эту задачу, предоставляя готовую инфраструктуру, но требует тщательной настройки политик и выбора правильных алгоритмов для вашей конкретной рабочей нагрузки.

По мере того как AI-системы все чаще объединяют модели, маршрутизация становится ключевым элементом для выбора правильной модели для каждой задачи, балансируя эффективность, качество и стоимость. Следите за обновлениями NVIDIA AI, подписываясь на новости NVIDIA и следуя за NVIDIA AI в LinkedIn, Discord и YouTube. Посетите страницу разработчика для получения ресурсов для начала работы. Исследуйте открытые модели и наборы данных Nemotron на Hugging Face и Blueprints на build.nvidia.com. Также участвуйте в прямых трансляциях Nemotron, обучающих материалах и сообществе разработчиков на форумах NVIDIA и в Discord.

Источник: NVIDIA Developer ↗