Эпоха, когда запуск локальной большой языковой модели (LLM) ограничивался возможностями одной видеокарты, уходит в прошлое. Сегодняшние многоагентные рабочие процессы (multi-agent workflows) кардинально изменили архитектуру локального инференса. Представьте себе сценарий: ведущий агент (lead agent) разбивает сложную задачу на подзадачи и порождает десятки независимых субагентов. То, что пользователь воспринимает как один запрос, на самом деле превращается в поток из десятков независимых вызовов моделей. Если направить этот поток в единую локальную среду исполнения, все эти вызовы начнут конкурировать за одни и те же слоты выполнения. Очередь растет, а мощная рабочая станция, ноутбук или DGX Spark, находящиеся в той же сети, простаивают, не участвуя в обработке.
Именно эту узкую горловину (bottleneck) решает решить NVIDIA Personal AI Router (PAIR). Анонсированная на этой неделе, PAIR — это виртуальный маршрутизатор инференса. Он автоматически обнаруживает совместимые машины в домашней или офисной сети и распределяет независимые запросы инференса между ними. Важно понимать: PAIR не является новым движком инференса. Он не заменяет Ollama или LM Studio. Эти программы по-прежнему выполняют модель на том узле, который выберет PAIR. PAIR выступает в роли интеллектуального диспетчера, оптимизирующего использование ресурсов.
01Почему это важно: Архитектура без нового API
Самое важное архитектурное решение, которое делает PAIR привлекательным для разработчиков, заключается в том, что он не вводит новый кластерный API. Вместо этого PAIR проксирует интерфейсы, совместимые с Ollama и LM Studio, которые уже используют существующие агентные фреймворки. Он перехватывает стандартные порты, которые использует каждый движок. Если ваш хостер (harness) слушает другой порт, порт прокси можно настроить в настройках движка PAIR. Репозиторий также открывает прокси-эндпоинты, совместимые с OpenAI.
Последствие этого подхода фундаментально: существующие агентные хостеры не требуют изменений. Агент решает, какую работу запросить, а PAIR решает, где она будет выполнена. Это снижает порог входа до минимума. Вам не нужно переписывать код своих агентов, чтобы начать использовать распределенные вычисления. Вы просто подключаете новые устройства к сети, и система начинает работать.
02Обнаружение, сопряжение и безопасность
Как PAIR находит устройства в сети? Он использует протокол mDNS (multicast DNS) для автоматического обнаружения nearby-систем. Если автоматическое обнаружение по какой-то причине не срабатывает, узел можно добавить вручную по IP-адресу. Однако безопасность здесь стоит на первом месте. Доверие устанавливается с помощью шестизначного PIN-кода, который отображается на приглашающей машине и вводится на приглашаемой. Вся коммуникация между узлами блокируется до завершения сопряжения (pairing).
После успешного сопряжения трафик между узлами защищается с помощью mTLS (mutual Transport Layer Security) с использованием сгенерированных сертификатов. Это гарантирует, что даже в домашней сети ваши данные и модели остаются в безопасности. Каждый узел запускает Ollama или LM Studio. Примечательно, что PAIR может установить движок и начать загрузку моделей на сопряженные системы, что устраняет большую часть ручной настройки кросс-машинного окружения. Это экономит часы времени, которые обычно тратятся на синхронизацию версий библиотек и моделей.
03Как работает планировщик (Scheduler)
Механизм выбора узла для выполнения запроса основан на пяти ключевых сигналах. Узел становится доступным для запроса только тогда, когда: 1. Узел онлайн и готов к работе. 2. Поддерживаемый движок (Ollama/LM Studio) включен. 3. Точно запрошенная модель присутствует на узле. 4. Текущая нагрузка на узел и движок известна. 5. Текущая загрузка GPU известна.

Важно отметить, что модели не должны быть идентичными во всем кластере. Различные системы могут содержать разные модели, и PAIR маршрутизирует запросы в соответствии с местоположением модели. Загрузка одного и того же тега (тега версии) на несколько узлов просто расширяет пул доступных узлов. Это создает гибкую среду, где вы можете использовать разные модели на разных устройствах в зависимости от их спецификаций.
Это уровень конкурентности на уровне рабочих задач (workload-level concurrency), и граница здесь четкая. PAIR назначает каждый запрос одному доступному узлу, где он остается на протяжении всего своего жизненного цикла. PAIR не пулирует VRAM (не объединяет видеопамять), не объединяет GPU в один большой ускоритель и не разделяет (sharding) один запрос между машинами. Это распределение задач, а не распределение вычислений внутри одной задачи.
04Демонстрация производительности: Цифры и контекст
NVIDIA продемонстрировала работу PAIR в связке с Hermes Desktop, который создает рабочую нагрузку из пяти субагентов над синтетическим почтовым ящиком домашнего хозяйства. Ollama выполняет Qwen 3.6 35B A3B на каждом выбранном узле. Результаты впечатляют, но требуют контекста.
На одном ноутбуке с RTX Spark рабочая нагрузка заняла в среднем 18 минут. На трехустройственном кластере PAIR, состоящем из ноутбука RTX Spark, DGX Spark и RTX 5090, она заняла в среднем 8 минут 48 секунд. Это ускорение почти в два раза. Однако стоит отметить, что это неофициальные данные демонстрации. Реальные результаты могут варьироваться в зависимости от качества сети, типа моделей и сложности задач субагентов. Тем не менее, это доказывает концепцию: добавление вычислительных узлов линейно или даже сублинейно снижает время выполнения сложных многоагентных сценариев.
05Поддерживаемое оборудование и системные требования
PAIR поддерживает широкий спектр оборудования, что делает его доступным для энтузиастов и профессионалов. Поддерживаются видеокарты GeForce RTX 20-й серии и новее, рабочие GPU RTX PRO от Turing и новее, DGX Spark, а также чипы Apple M4 и новее. Узлы Windows, Linux и macOS могут быть сопряжены друг с другом, как на x64, так и на arm64. Однако Windows на ARM находится в экспериментальной стадии.
Системные требования относительно скромны: валидированные конфигурации требуют 8 ГБ ОЗУ или больше и рекомендуют 20 ГБ свободного места на диске. Другие дистрибутивы Linux можно собрать из исходного кода. Это означает, что даже старые ноутбуки с поддержкой CUDA могут стать частью вашего вычислительного кластера, если они соответствуют минимальным требованиям по памяти.

06Что это значит на практике
Для разработчиков AI и энтузиастов локального запуска PAIR открывает новые горизонты. Больше не нужно покупать одну дорогую видеокарту с огромным объемом памяти, чтобы запустить сложную модель. Вместо этого можно собрать кластер из нескольких доступных устройств. Например, можно использовать старый MacBook Pro для обработки текстовых запросов, игровой ПК с RTX 4090 для генерации изображений или кода, и DGX Spark для фоновых задач. PAIR будет автоматически маршрутизировать запросы туда, где есть нужная модель и свободные ресурсы.
Это особенно актуально для России, где доступ к облачным AI-сервисам может быть ограничен или дорог. Локальный запуск становится не просто хобби, а необходимостью. PAIR позволяет максимизировать отдачу от имеющегося «железа». Если у вас есть несколько устройств, они больше не простаивают, пока вы работаете с одним из них. Они работают вместе, как единый организм.
Также стоит отметить, что PAIR не требует глубоких знаний в администрировании кластеров. Установка движков и загрузка моделей автоматизированы. Это снижает барьер для входа. Даже если вы не являетесь экспертом в Kubernetes или Docker, вы можете запустить распределенный AI-кластер за несколько минут. Это демократизирует доступ к мощным вычислительным ресурсам.
В будущем, по мере развития многоагентных систем, потребность в таких инструментах будет только расти. Чем больше агентов взаимодействуют друг с другом, тем выше нагрузка на инфраструктуру. PAIR предоставляет элегантное решение этой проблемы, позволяя масштабироваться горизонтально, используя доступные ресурсы, а не вертикально, покупая все более мощное оборудование.
Если вы хотите попробовать PAIR, вы можете посетить страницу продукта NVIDIA, технический блог, репозиторий GitHub, руководство по началу работы и FAQ. Также можно следить за обновлениями в Twitter и присоединиться к сообществу ML на Reddit. Для тех, кто предпочитает Telegram, также есть возможность присоединиться к каналу.
PAIR — это не просто еще один инструмент для оптимизации. Это шаг к новой парадигме локального AI, где границы между устройствами стираются, а вычислительные ресурсы становятся гибкими и доступными. Это делает локальный запуск более мощным, эффективным и доступным для всех, кто хочет использовать силу искусственного интеллекта без зависимости от облачных провайдеров.
Источник: MarkTechPost ↗
