Проблема «одной модели» и решение NVIDIA
Создание AI-агентов часто сводится к выбору одной большой модели, что приводит к избыточным затратам и задержкам. NVIDIA NeMo Switchyard решает эту проблему, позволяя агентам динамически выбирать модель для каждого шага задачи. Система оценивает возможности модели, стоимость и инфраструктурные сигналы, отправляя запрос туда, где он будет выполнен оптимальнее всего.
Как работает маршрутизация: сигналы и алгоритмы
Решение опирается на три ключевых источника данных для принятия решений:
- Возможности модели: Классификация запроса по теме или сложности (с помощью эмбеддингов или классификаторов).
- Профиль стоимости: Задержка (latency), цена токенов и количество вызовов инструментов.
- Инфраструктура: Нагрузка на сервер, ошибки, лог-вероятности (logprobs) и состояние модели в реальном времени.
NeMo Switchyard поддерживает как алгоритмы без дообучения (tuning-free), так и настраиваемые маршрутизаторы, позволяя разработчикам интегрировать собственные эвристики.
Практические результаты: Benchmark Terminal-Bench Hard
Тестирование на задаче компьютерного использования (Terminal-Bench Hard) показало, что использование одной модели (например, DeepSeek V4) не всегда оптимально. Разные задачи требуют разных специализаций. Ниже приведена сравнительная эффективность моделей в различных группах задач:
| Группа задач | Рекомендуемая модель | Обоснование выбора |
|---|---|---|
| ML и RL (Машинное обучение) | Kimi K2.6 | Высокая точность в специфичных задачах ML, ниже стоимость, чем у флагманов |
| Математика и наука | Qwen3.5 397B A17B | Оптимальный баланс точности и объема вычислений для сложных вычислений |
| Остальные 6 групп задач | DeepSeek V4 | Лидер по общей точности, но используется только там, где это критично |
Такой подход позволяет снизить общее количество токенов (как входных, так и выходных) без потери качества решения задач.
Архитектура и совместимость
NeMo Switchyard состоит из SDK switchyard-libsy и серверной части, которая эмулирует шлюз LLM. Ключевые особенности:
- Провайдер-агностичность: Логика маршрутизации отделена от конкретных провайдеров. Можно менять бэкенд (endpoint) или модель, не переписывая код агента.
- Поддержка API: Сервер принимает запросы в форматах OpenAI, Anthropic и Responses API, транслируя их во внутренний формат NeMo.
- Сохранение состояния: Система может хранить контекст сессии (результаты инструментов, решения маршрутизатора) для последующих шагов агента.
Почему это важно для разработчиков
Интеграция с фреймворками вроде LangChain и тестирование с агентами от Cognition демонстрируют, что NeMo Switchyard позволяет существенно снизить затраты на инференс в продакшене. Разработчики получают инструмент для создания «системы моделей» (system-of-models), где каждый шаг работы агента выполняется самой подходящей по цене и скорости моделью, а не самым дорогим «тяжеловесом».
Источник: NVIDIA dev blog ↗
