Eszközök

Mesterséges intelligenciával generált szöveg

NVIDIA PAIR: helyi hálózaton szétosztott inferencia, hogy csökkenjen a többügynökös torlódás

A főszereplő az NVIDIA Personal AI Router (PAIR), amely egy virtuális inferencia-elosztó a helyi hálózaton.

NVIDIA PAIR: helyi hálózaton szétosztott inferencia, hogy csökkenjen a többügynökös torlódás

Az NVIDIA Personal AI Router (PAIR) egy virtuális inferencia‑router, amely a felhasználó helyi hálózatán található gépek AI‑kapacitását használja fel a többügynökös és al‑ügynökös munkafolyamatok okozta torlódás csökkentésére. Nem maga a modellvégrehajtó motor: az Ollama vagy LM Studio továbbra is a kiválasztott gépen futtatja a modellt. A PAIR feladata, hogy felfedezze a résztvevő rendszereket, nyomon kövesse azok készenlétét, ütemezze az egyes, független inferencia‑kéréseket, majd visszaküldje a választ az eredeti alkalmazásnak.

PAIR beta verziója elérhető támogatott Windows, macOS és Linux rendszereken grafikus és terminál felületen. Kompatibilis rendszerek közé tartoznak a NVIDIA GeForce RTX 20 Series és újabb GPU‑k, NVIDIA RTX PRO workstation GPU‑k (Turing architektúra és újabb), NVIDIA DGX Spark és Apple M4+ chipek.

Miért van szükség erre?

A modern AI‑ügynökök gyakran bontanak részmunkákra egy összetett feladatot, és specializált al‑ügynökökhöz delegálják a részkérdéseket. Ez a szélességi (breadth‑first) megközelítés gyorsíthatja a feladatmegoldást és javíthatja a válaszok minőségét, ugyanakkor az inferencia‑rétegen egyszerre sok, független modellhívás keletkezik, amelyek mind egy helyi GPU‑motor erőforrásaiért versengenek. Ez sorba állást és lassulást eredményezhet, még akkor is, ha a hálózaton máshol vannak kihasználatlan, kompatibilis gépek.

Hogyan működik a PAIR?

  • Helyi hálózati felfedezés: Miután a PAIR telepítve van a kompatibilis Windows, macOS vagy Linux gépeken, mDNS segítségével automatikusan megtalálja a közeli rendszereket; szükség esetén IP‑címmel is hozzáadható egy csomópont. A kapcsolódás csak a felhasználó jóváhagyása után jön létre, és a csomópontok közötti kommunikáció MTLS és generált tanúsítványok segítségével titkosított.

  • Inferencia‑motorok és modellek előkészítése: Minden résztvevő csomóponton egy támogatott helyi inferencia‑motor fut (Ollama vagy LM Studio). A PAIR segíthet a motor telepítésében és a modellek letöltésében is. Egy csomópont csak akkor lesz jogosult egy adott kérés fogadására, ha a szükséges motor engedélyezve van és a pontos kért modell jelen van azon a gépen.

  • Proxyként működés: A PAIR az Ollama és LM Studio ismert helyi interfészeit proxyzza, így az ügynökök nem igényelnek új API‑integrációt. Az alkalmazások a megszokott végpontjukon keresztül küldik a kéréseket; a PAIR átveszi az alapértelmezett portot (konfigurálható, ha más portot használnak).

  • Ütemezés egy jogosult csomópontra: A router a csomópontok aktuális állapota (online‑e, motor engedélyezve, a modell jelenléte, aktív munkák és GPU‑kihasználtság) alapján szűri a lehetőségeket, kiválaszt egy jogosult gépet, majd a kiválasztott csomópont helyileg végrehajtja a kérést. Minden inferencia‑kérés egyszerre csak egy csomóponton fusson végig — a PAIR nem oszt meg egy kérést több GPU között.

  • Válasz visszaadása és láthatóság: A kiválasztott motor végrehajtja a kérést, a választ a PAIR visszacsatornázza az eredeti alkalmazásnak, és a PAIR felületén (Jobs és metrikák nézet) megjelenik, hogy melyik csomópont futtatta a kérést.

Milyen problémákat old meg a PAIR?

PAIR elsősorban az olyan munkaterhelésekben hasznos, amelyek egyszerre több, független inferencia‑kérést hoznak létre, például többügynökös alkalmazásoknál vagy párhuzamos, helyi AI eszközök futtatásakor. A PAIR előnyei:

  • Független feladatok irányítása a helyi hálózaton elérhető, kész rendszerek között.
  • Sorban állás csökkentése, ha több kérés várna egyetlen helyi motorra.
  • Rövidebb végső befejezési idő egy megfelelően párhuzamosítható munkafolyamatnál és kompatibilis konfigurációnál.
  • A fő gép felszabadítása játékhoz, kreatív munkához vagy más interaktív feladatokhoz.
  • A meglévő helyi inferencia‑munkafolyamat megtartása, így az alkalmazás‑oldal nem kell megváltozzon.

Mit nem csinál a PAIR?

  • Nem egyesíti a GPU‑kat vagy a VRAM‑ot egy nagyobb gyorsítóra.
  • Nem shardolja vagy osztja szét egyetlen inferencia‑kérést több gép között.
  • Nem ad jelentős előnyt olyan, erősen szekvenciális munkáknál vagy amikor csak egy csomóponton van a szükséges modell.

Példa: Hermes öt al‑ügynökös demonstráció

A bemutatóban a Hermes Desktop hozza létre az al‑ügynök‑munkát, az Ollama pedig a PAIR által kiválasztott csomópontokon futtatja a modelleket. A feladat egy szintetikus háztartási postafiók elemzése és egy "Sunday Reset" terv elkészítése volt, bizonyítékokkal alátámasztva.

A konfiguráció‑specifikus, nem hivatalos demó szerint ugyanazon öt al‑ügynökös munkát Qwen 3.6 35B A3B modellel egy NVIDIA RTX Spark laptopon átlagosan 18 perc alatt fejezték be. Egy háromgépes PAIR klaszterrel — RTX Spark laptop, DGX Spark és RTX 5090 — ugyanez a feladat átlagosan 8 perc 48 másodperc alatt fejeződött be. A cikk hangsúlyozza, hogy ez nem általános benchmark és az eredmények függenek a párhuzamosíthatóságtól, a modelltől, a beállításoktól, a hardvertől, a hálózattól és a csomópontok elérhetőségétől.

A PAIR Jobs felülete adja meg a valós képet arról, hogy hol futott az inferencia; a Hermes ügynökök száma és a PAIR‑ben megjelenő job‑szám különböző mérések (egy ügynök több modellkérést generálhat).

A PAIR használatának lépései

  1. Töltsük le az NVIDIA PAIR beta verzióját egy támogatott Windows, macOS vagy Linux rendszerre.
  2. Telepítsük a PAIR‑t azokat a gépeket, amelyeket be szeretnénk vonni (NVIDIA RTX PC‑k, NVIDIA RTX PRO workstationok, vagy NVIDIA DGX Spark rendszerek, illetve Apple M4+ gépek esetén is támogatott).
  3. Fedezzük fel és párosítsuk biztonságosan a helyi hálózaton a kívánt rendszereket.
  4. Engedélyezzük az Ollama‑t vagy LM Studio‑t és töltsük le vagy helyezzük el a szükséges modelleket a jogosult csomópontokon.
  5. Futtassunk egy kompatibilis ügynököt egy PAIR‑ral telepített rendszeren, amely Ollama‑t vagy LM Studio‑t használ.

Nyílt forráskód és fejlesztési lehetőségek

Az NVIDIA PAIR projekt nyílt forráskódú: a fejlesztők átnézhetik a forráskódot, hibákat jelenthetnek és hozzájárulhatnak a felfedezés, párosítás, útválasztás, motorintegráció, modellek, végpontok és a felhasználói élmény fejlesztéséhez.

Összefoglalás

A PAIR célja, hogy a dinamikus, otthoni NVIDIA rendszerekből klaszterszerű kapacitást varázsoljon anélkül, hogy a helyi munkafolyamatokat át kellene tervezni. Különösen akkor lehet hasznos, amikor egy ügynök több független modellhívást generál egyszerre: a PAIR ilyen esetekben képes szétszórni ezeket a hívásokat a hálózaton elérhető gépek között, csökkentve a sorban állást és gyorsítva a párhuzamosítható munkafolyamatokat.