Az NVIDIA Personal AI Router (PAIR) egy virtuális inferencia‑router, amely a felhasználó helyi hálózatán található gépek AI‑kapacitását használja fel a többügynökös és al‑ügynökös munkafolyamatok okozta torlódás csökkentésére. Nem maga a modellvégrehajtó motor: az Ollama vagy LM Studio továbbra is a kiválasztott gépen futtatja a modellt. A PAIR feladata, hogy felfedezze a résztvevő rendszereket, nyomon kövesse azok készenlétét, ütemezze az egyes, független inferencia‑kéréseket, majd visszaküldje a választ az eredeti alkalmazásnak.
PAIR beta verziója elérhető támogatott Windows, macOS és Linux rendszereken grafikus és terminál felületen. Kompatibilis rendszerek közé tartoznak a NVIDIA GeForce RTX 20 Series és újabb GPU‑k, NVIDIA RTX PRO workstation GPU‑k (Turing architektúra és újabb), NVIDIA DGX Spark és Apple M4+ chipek.
Miért van szükség erre?
A modern AI‑ügynökök gyakran bontanak részmunkákra egy összetett feladatot, és specializált al‑ügynökökhöz delegálják a részkérdéseket. Ez a szélességi (breadth‑first) megközelítés gyorsíthatja a feladatmegoldást és javíthatja a válaszok minőségét, ugyanakkor az inferencia‑rétegen egyszerre sok, független modellhívás keletkezik, amelyek mind egy helyi GPU‑motor erőforrásaiért versengenek. Ez sorba állást és lassulást eredményezhet, még akkor is, ha a hálózaton máshol vannak kihasználatlan, kompatibilis gépek.
Hogyan működik a PAIR?
-
Helyi hálózati felfedezés: Miután a PAIR telepítve van a kompatibilis Windows, macOS vagy Linux gépeken, mDNS segítségével automatikusan megtalálja a közeli rendszereket; szükség esetén IP‑címmel is hozzáadható egy csomópont. A kapcsolódás csak a felhasználó jóváhagyása után jön létre, és a csomópontok közötti kommunikáció MTLS és generált tanúsítványok segítségével titkosított.
-
Inferencia‑motorok és modellek előkészítése: Minden résztvevő csomóponton egy támogatott helyi inferencia‑motor fut (Ollama vagy LM Studio). A PAIR segíthet a motor telepítésében és a modellek letöltésében is. Egy csomópont csak akkor lesz jogosult egy adott kérés fogadására, ha a szükséges motor engedélyezve van és a pontos kért modell jelen van azon a gépen.
-
Proxyként működés: A PAIR az Ollama és LM Studio ismert helyi interfészeit proxyzza, így az ügynökök nem igényelnek új API‑integrációt. Az alkalmazások a megszokott végpontjukon keresztül küldik a kéréseket; a PAIR átveszi az alapértelmezett portot (konfigurálható, ha más portot használnak).
-
Ütemezés egy jogosult csomópontra: A router a csomópontok aktuális állapota (online‑e, motor engedélyezve, a modell jelenléte, aktív munkák és GPU‑kihasználtság) alapján szűri a lehetőségeket, kiválaszt egy jogosult gépet, majd a kiválasztott csomópont helyileg végrehajtja a kérést. Minden inferencia‑kérés egyszerre csak egy csomóponton fusson végig — a PAIR nem oszt meg egy kérést több GPU között.
-
Válasz visszaadása és láthatóság: A kiválasztott motor végrehajtja a kérést, a választ a PAIR visszacsatornázza az eredeti alkalmazásnak, és a PAIR felületén (Jobs és metrikák nézet) megjelenik, hogy melyik csomópont futtatta a kérést.
Milyen problémákat old meg a PAIR?
PAIR elsősorban az olyan munkaterhelésekben hasznos, amelyek egyszerre több, független inferencia‑kérést hoznak létre, például többügynökös alkalmazásoknál vagy párhuzamos, helyi AI eszközök futtatásakor. A PAIR előnyei:
- Független feladatok irányítása a helyi hálózaton elérhető, kész rendszerek között.
- Sorban állás csökkentése, ha több kérés várna egyetlen helyi motorra.
- Rövidebb végső befejezési idő egy megfelelően párhuzamosítható munkafolyamatnál és kompatibilis konfigurációnál.
- A fő gép felszabadítása játékhoz, kreatív munkához vagy más interaktív feladatokhoz.
- A meglévő helyi inferencia‑munkafolyamat megtartása, így az alkalmazás‑oldal nem kell megváltozzon.
Mit nem csinál a PAIR?
- Nem egyesíti a GPU‑kat vagy a VRAM‑ot egy nagyobb gyorsítóra.
- Nem shardolja vagy osztja szét egyetlen inferencia‑kérést több gép között.
- Nem ad jelentős előnyt olyan, erősen szekvenciális munkáknál vagy amikor csak egy csomóponton van a szükséges modell.
Példa: Hermes öt al‑ügynökös demonstráció
A bemutatóban a Hermes Desktop hozza létre az al‑ügynök‑munkát, az Ollama pedig a PAIR által kiválasztott csomópontokon futtatja a modelleket. A feladat egy szintetikus háztartási postafiók elemzése és egy "Sunday Reset" terv elkészítése volt, bizonyítékokkal alátámasztva.
A konfiguráció‑specifikus, nem hivatalos demó szerint ugyanazon öt al‑ügynökös munkát Qwen 3.6 35B A3B modellel egy NVIDIA RTX Spark laptopon átlagosan 18 perc alatt fejezték be. Egy háromgépes PAIR klaszterrel — RTX Spark laptop, DGX Spark és RTX 5090 — ugyanez a feladat átlagosan 8 perc 48 másodperc alatt fejeződött be. A cikk hangsúlyozza, hogy ez nem általános benchmark és az eredmények függenek a párhuzamosíthatóságtól, a modelltől, a beállításoktól, a hardvertől, a hálózattól és a csomópontok elérhetőségétől.
A PAIR Jobs felülete adja meg a valós képet arról, hogy hol futott az inferencia; a Hermes ügynökök száma és a PAIR‑ben megjelenő job‑szám különböző mérések (egy ügynök több modellkérést generálhat).
A PAIR használatának lépései
- Töltsük le az NVIDIA PAIR beta verzióját egy támogatott Windows, macOS vagy Linux rendszerre.
- Telepítsük a PAIR‑t azokat a gépeket, amelyeket be szeretnénk vonni (NVIDIA RTX PC‑k, NVIDIA RTX PRO workstationok, vagy NVIDIA DGX Spark rendszerek, illetve Apple M4+ gépek esetén is támogatott).
- Fedezzük fel és párosítsuk biztonságosan a helyi hálózaton a kívánt rendszereket.
- Engedélyezzük az Ollama‑t vagy LM Studio‑t és töltsük le vagy helyezzük el a szükséges modelleket a jogosult csomópontokon.
- Futtassunk egy kompatibilis ügynököt egy PAIR‑ral telepített rendszeren, amely Ollama‑t vagy LM Studio‑t használ.
Nyílt forráskód és fejlesztési lehetőségek
Az NVIDIA PAIR projekt nyílt forráskódú: a fejlesztők átnézhetik a forráskódot, hibákat jelenthetnek és hozzájárulhatnak a felfedezés, párosítás, útválasztás, motorintegráció, modellek, végpontok és a felhasználói élmény fejlesztéséhez.
Összefoglalás
A PAIR célja, hogy a dinamikus, otthoni NVIDIA rendszerekből klaszterszerű kapacitást varázsoljon anélkül, hogy a helyi munkafolyamatokat át kellene tervezni. Különösen akkor lehet hasznos, amikor egy ügynök több független modellhívást generál egyszerre: a PAIR ilyen esetekben képes szétszórni ezeket a hívásokat a hálózaton elérhető gépek között, csökkentve a sorban állást és gyorsítva a párhuzamosítható munkafolyamatokat.



