Проблема локального инференса и решение NVIDIA
Многослойные AI-агенты (multi-agent workflows) превращают один запрос пользователя в десятки независимых вызовов моделей. Когда все они направляются в один локальный движок (Ollama или LM Studio), возникает узкое место: очередь растет, а ресурсы соседних устройств простаивают. NVIDIA Personal AI Router (PAIR) решает эту проблему, выступая виртуальным маршрутизатором, который обнаруживает совместимые машины в домашней сети и распределяет запросы между ними.
Как работает PAIR: Архитектура и безопасность
PAIR не является новым движком инференса — он использует существующие Ollama или LM Studio на каждом узле. Ключевые технические особенности:
- Проксирование API: PAIR перехватывает стандартные порты Ollama/LM Studio и предоставляет OpenAI-совместимые эндпоинты. Агентные системы не требуют изменений кода.
- Обнаружение и сопряжение: Используется mDNS для поиска устройств. Доверие устанавливается через 6-значный PIN-код, после чего связь шифруется mTLS.
- Распределение: Запрос отправляется на один узел, где модель уже загружена. PAIR не пулирует VRAM и не шардирует модели между картами.
Демонстрация производительности
В демонстрации с использованием Hermes Desktop и модели Qwen 3.6 35B A3B, PAIR показал значительное ускорение за счет параллельной обработки пяти подзадач агентами:
| Конфигурация | Состав устройств | Среднее время выполнения |
|---|---|---|
| Одно устройство | 1x RTX Spark (ноутбук) | 18 минут |
| Кластер PAIR | 1x RTX Spark + 1x DGX Spark + 1x RTX 5090 | 8 минут 48 секунд |
Требования к оборудованию и совместимость
PAIR поддерживает смешанные среды. Узлами могут быть устройства с разными архитектурами и ОС, главное — наличие совместимого GPU и движка.
| Категория | Поддерживаемое оборудование/ПО |
|---|---|
| GPU NVIDIA | GeForce RTX 20 Series и новее, RTX PRO (Turing+), DGX Spark |
| Apple Silicon | Чипы M4 и новее |
| ОС | Windows, Linux, macOS (x64 и arm64). Windows on ARM — экспериментально. |
| Мин. требования | 8 GB RAM, 20 GB свободного места на диске |
Статус релиза
PAIR доступен в публичной бета-версии v0.1.1 под лицензией Apache 2.0. Исходный код опубликован на GitHub. На данный момент планировщик учитывает загрузку GPU и наличие модели, но не различает классы GPU или «теплоту» моделей.
Источник: MarkTechPost ↗
