Инструменты11 августа 2026 г., 16:30 МСК🤖 Auto

NVIDIA NeMo Switchyard: Маршрутизация AI-агентов для экономии до 90% затрат

NVIDIA представила NeMo Switchyard — SDK для динамической маршрутизации запросов AI-агентов между моделями. Решение балансирует между точностью, стоимостью и задержкой, используя данные в реальном времени.

Баннер новости 5530

Проблема «одной модели» и решение NVIDIA

Создание AI-агентов часто сводится к выбору одной большой модели, что приводит к избыточным затратам и задержкам. NVIDIA NeMo Switchyard решает эту проблему, позволяя агентам динамически выбирать модель для каждого шага задачи. Система оценивает возможности модели, стоимость и инфраструктурные сигналы, отправляя запрос туда, где он будет выполнен оптимальнее всего.

Как работает маршрутизация: сигналы и алгоритмы

Решение опирается на три ключевых источника данных для принятия решений:

  • Возможности модели: Классификация запроса по теме или сложности (с помощью эмбеддингов или классификаторов).
  • Профиль стоимости: Задержка (latency), цена токенов и количество вызовов инструментов.
  • Инфраструктура: Нагрузка на сервер, ошибки, лог-вероятности (logprobs) и состояние модели в реальном времени.

NeMo Switchyard поддерживает как алгоритмы без дообучения (tuning-free), так и настраиваемые маршрутизаторы, позволяя разработчикам интегрировать собственные эвристики.

Практические результаты: Benchmark Terminal-Bench Hard

Тестирование на задаче компьютерного использования (Terminal-Bench Hard) показало, что использование одной модели (например, DeepSeek V4) не всегда оптимально. Разные задачи требуют разных специализаций. Ниже приведена сравнительная эффективность моделей в различных группах задач:

Группа задач Рекомендуемая модель Обоснование выбора
ML и RL (Машинное обучение) Kimi K2.6 Высокая точность в специфичных задачах ML, ниже стоимость, чем у флагманов
Математика и наука Qwen3.5 397B A17B Оптимальный баланс точности и объема вычислений для сложных вычислений
Остальные 6 групп задач DeepSeek V4 Лидер по общей точности, но используется только там, где это критично

Такой подход позволяет снизить общее количество токенов (как входных, так и выходных) без потери качества решения задач.

Архитектура и совместимость

NeMo Switchyard состоит из SDK switchyard-libsy и серверной части, которая эмулирует шлюз LLM. Ключевые особенности:

  • Провайдер-агностичность: Логика маршрутизации отделена от конкретных провайдеров. Можно менять бэкенд (endpoint) или модель, не переписывая код агента.
  • Поддержка API: Сервер принимает запросы в форматах OpenAI, Anthropic и Responses API, транслируя их во внутренний формат NeMo.
  • Сохранение состояния: Система может хранить контекст сессии (результаты инструментов, решения маршрутизатора) для последующих шагов агента.

Почему это важно для разработчиков

Интеграция с фреймворками вроде LangChain и тестирование с агентами от Cognition демонстрируют, что NeMo Switchyard позволяет существенно снизить затраты на инференс в продакшене. Разработчики получают инструмент для создания «системы моделей» (system-of-models), где каждый шаг работы агента выполняется самой подходящей по цене и скорости моделью, а не самым дорогим «тяжеловесом».

Источник: NVIDIA dev blog ↗