Решение проблемы узкого горлышка мультиагентных систем
С развитием локальных AI-агентов возникла новая проблема: когда один главный агент разбивает сложную задачу на подзадачи (subagents), все они одновременно отправляют запросы на GPU. Это создает очередь и ограничивает скорость вычисления мощностью одной видеокарты. NVIDIA Personal AI Router (PAIR) решает эту проблему, действуя как виртуальный маршрутизатор, который распределяет независимые запросы инференса по всем совместимым устройствам в локальной сети.
Ключевое преимущество PAIR — отсутствие необходимости переписывать код агентов. Система работает через прокси-интерфейсы для популярных локальных движков Ollama и LM Studio. Агент продолжает видеть одно соединение, а PAIR скрытно выбирает наиболее подходящий узел для выполнения задачи.
Демонстрация производительности: 8:48 против 18:00
В ходе демонстрации с использованием фреймворка Hermes Desktop и модели Qwen 3.6 35B A3B была протестирована задача анализа почтового ящика с участием пяти субагентов. Результаты показали значительный прирост скорости за счет распределения нагрузки:
| Конфигурация | Состав оборудования | Время выполнения |
|---|---|---|
| Одно устройство | 1x NVIDIA RTX Spark (ноутбук) | 18 минут (среднее) |
| Кластер PAIR (3 узла) | 1x RTX Spark + 1x DGX Spark + 1x RTX 5090 | 8 минут 48 секунд (среднее) |
Важно отметить, что PAIR не объединяет GPU для одной задачи (tensor parallelism), а распределяет разные запросы между разными узлами (workload-level concurrency). Это позволяет использовать простаивающие мощности, например, когда основной ПК занят игрой, а фоновые задачи выполняются на других устройствах.
Технические детали и поддержка оборудования
PAIR спроектирован с учетом «эластичности» домашних кластеров. Устройства могут подключаться и отключаться динамически (например, ноутбук уходит в спящий режим). Маршрутизатор использует mDNS для обнаружения устройств и mTLS для шифрования трафика, гарантируя, что данные не покидают локальную сеть.
Система учитывает при планировании:
- Наличие требуемой модели на узле.
- Текущую загрузку GPU и наличие активных графических приложений.
- Готовность узла принимать новые задачи.
Поддерживаемое оборудование включает:
- NVIDIA GeForce RTX 20 Series и новее.
- RTX PRO workstation GPUs (Turing и новее).
- NVIDIA DGX Spark.
- Apple M4+ silicon (через совместимые интерфейсы).
Где скачать и что дальше
Бета-версия NVIDIA PAIR доступна для Windows, macOS и Linux. Проект является open-source, код размещен в репозитории Personal AI Router. Разработчики подчеркивают, что текущие цифры — это специфичный демо-сценарий, а не гарантия линейного масштабирования для всех задач, однако технология открывает путь к созданию гибких домашних AI-кластеров без сложной настройки.
Источник: NVIDIA dev blog ↗
