NVIDIA представила открытый инструмент NVIDIA PAIR® (Personal AI Router®), распространяемый по лицензии Apache 2.0. Разработка предназначена для балансировки и маршрутизации запросов на инференс больших языковых моделей между компьютерами в рамках единой локальной сети.

По оценкам инженеров, большинство домашних систем с дискретными графическими ускорителями большую часть времени работают с низкой загрузкой. При наличии в доме нескольких компьютеров — например, основного ПК с видеокартой GeForce RTX® и второго ПК или ноутбука — их суммарная вычислительная мощность в простое остается невостребованной. NVIDIA PAIR® предлагает задействовать эти ресурсы для выполнения задач машинного обучения, сохраняя обработку данных внутри домашней сети.

Как это работает

Концепция распределения ИИ-инференса между домашними ПК в сети через NVIDIA PAIR®. Источник.
Концепция распределения ИИ-инференса между домашними ПК в сети через NVIDIA PAIR®. Источник.

С технической точки зрения NVIDIA PAIR® не является механизмом параллелизма и не реализует распределенный инференс одной модели на нескольких ПК. Инструмент не объединяет VRAM разных физических ускорителей в единый логический массив. Запустить модель, объем параметров которой превышает объем VRAM одного конкретного графического ускорителя, за счет добавления второго компьютера не получится.

Инструмент функционирует как сетевой прокси-сервер и маршрутизатор прикладного уровня (L7). В инфраструктуре он располагается между клиентским приложением (например, мультиагентным фреймворком) и локальными движками инференса — Ollama или LM Studio, перехватывая исходящие REST API-запросы в формате, совместимом с OpenAI.

Каталог готовых ИИ‑моделей

Сервис для запуска и управления LLM в облаке Selectel. Выберите модель, конфигурацию и получите готовый эндпоинт для работы с ней.

Подробнее →

Посмотрим на этапы процесса взаимодействия.

  1. Происходит поиск устройств в локальной сети через протокол mDNS. Сопряжение узлов выполняется по шестизначному коду, после чего сетевой трафик между узлами шифруется с помощью mTLS.

  2. При поступлении запроса на инференс NVIDIA PAIR® обращается к текущему состоянию подключенных узлов. На этапе бета-версии планировщик учитывает длину очереди активных задач, факт предзагрузки нужной модели в память конкретного узла и текущую загрузку GPU.

  3. Реализовано динамическое перенаправление запросов: если на одном из компьютеров запущен трехмерный рендеринг или игра, планировщик временно обходит данный узел при распределении входящего запроса и направляет задачу на свободное устройство. Как только вычислительные ресурсы ПК высвобождаются, узел снова начинает получать задачи от роутера.

Дашборд приложения Personal AI Router. Источник.
Дашборд приложения Personal AI Router. Источник.

Поскольку между узлами передаются только входящие данные и сгенерированный результат, требования к пропускной способности локальной сети остаются минимальными — достаточно стандартного подключения Ethernet или Wi-Fi.

Практические сценарии применения

NVIDIA предлагает три варианта использования своей системы. Во-первых, мультиагентные процессы: главный агент генерирует задачи сразу для нескольких субагентов, а их последовательное исполнение на одном GPU создает очередь. NVIDIA PAIR® распределяет независимые запросы субагентов по разным физическим ПК в сети, обеспечивая их параллельную обработку. В демонстрационном тесте NVIDIA с пятью субагентами на модели Qwen3.6 35B A3B на двух компьютерах с видеокартами GeForce RTX® 5090 время выполнения сценария сократилось с 6 минут 18 секунд до 3 минут 48 секунд.

Сравнение времени выполнения мультиагентного сценария Hermes на одном ПК с GeForce RTX® 5090 и в кластере из двух узлов NVIDIA PAIR®. Источник.
Сравнение времени выполнения мультиагентного сценария Hermes на одном ПК с GeForce RTX® 5090 и в кластере из двух узлов NVIDIA PAIR®. Источник.

Во-вторых, параллельная многозадачность: можно одновременно запускать и обрабатывать сразу несколько независимых пользовательских сессий с моделями на разных устройствах без падения производительности и взаимного ожидания в очереди.

В-третьих, это вынос вычислений. Пользователь может продолжать работать или играть на основном ПК, пока фоновые задачи инференса автоматически перенаправляются на второй компьютер или ноутбук в той же локальной сети.

Три ключевых сценария использования NVIDIA PAIR®. Источник.
Три ключевых сценария использования NVIDIA PAIR®. Источник.

Совместимость и требования

Приложение не требует специализированных драйверов уровня ядра и работает на операционных системах Windows®, Linux® и macOS®.

В качестве вычислительных узлов могут выступать системы с видеокартами GeForce RTX®, профессиональными ускорителями DGX, а также графическими процессорами других производителей (включая решения AMD, Intel и интегрированную графику Apple Silicon), если на устройстве запущен поддерживаемый движок Ollama или LM Studio. В рамках базовых тестов NVIDIA подтверждена стабильная работа кластера, объединяющего до 18 узлов.

В целом этот инструмент не совершает каких-то технологических прорывов в области инференса моделей. Однако он закрывает прикладную задачу: превращает разрозненное домашнее железо в утилитарный локальный кластер без сложной настройки инфраструктуры и лишних затрат.