Eszközök

NVLink: skálázható, alacsony késleltetésű hálózat az AI-feldolgozó központokhoz

A cikk főszereplője az NVIDIA és annak NVLink skálázódó hálózati technológiája, amely az AI „factory” adatközpontok számára készült.

NVLink: skálázható, alacsony késleltetésű hálózat az AI-feldolgozó központokhoz

A mesterséges intelligencia iránti kereslet gyorsan növekszik: a munkaterhelések nagyobbak, a modellek összetettebbek, és egyre nagyobb nyomás nehezedik arra, hogy gyorsabban telepítsék az AI-számítási infrastruktúrát. Az „AI factory” — adatközpont-szintű rendszerek, amelyek folyamatosan adatot és energiát alakítanak át intelligenciává — válik a skálázható AI-kiszolgálás alapmodelljévé.

Ez a megközelítés megváltoztatta a rendszerek tervezését és üzemeltetését: a csúcs-accellerátor FLOPS már önmagában nem elegendő. A mai munkaterhelések, köztük trilliónyi paramétert meghaladó modellek, mixture-of-experts (MoE) architektúrák, hosszú kontextusú következtetések és diszaggregált szolgáltatás igénylik, hogy sok gyorsító egyetlen számítási egységként működjön együtt. Ez magas sávszélességű, alacsony késleltetésű GPU–GPU kommunikációt, hálózaton belüli gyors műveleteket (collectives) és szoftver-érzékeny ütemezést követel meg.

Mivel az összetevők száma óriási, a megbízhatóságot a teljes adatközpontra ki kell terjeszteni. Az iparág gyors üteméhez a technológiának és az ellátási láncnak is képesnek kell lennie lépést tartani.

Miért számít a scale-up hálózat?

A scale-out hálózatok szervereket kötnek össze a teljes adatközpontban; a scale-up hálózatok pedig lehetővé teszik, hogy egy domain GPU-i egyetlen számítási motorként viselkedjenek. Mindkettő fontos, de különböző problémákat oldanak meg. A scale-up domain az a hely, ahol a legtöbb késleltetés-érzékeny kommunikáció történik a modern tréning és inference feladatoknál.

Például MoE-inference esetén az expert-parallelizmus elosztja az experteket a GPU-kon és nagy batchméreteket használ a maximális átviteli kapacitás érdekében. Ez intenzív all-to-all kommunikációt hoz létre: tokenek kiszállítása, feldolgozása, összegyűjtése, újrarendezése és továbbadása párhuzamosan kell, hogy történjen. Ha a fabric alacsony sávszélességű vagy nagy késleltetésű, a kommunikációs overhead elronthatja az expert-parallelizmus előnyeit — ugyanez igaz MoE-k tréningjére is.

Következtetés: az all-to-all sávszélesség és a késleltetés kritikus az AI factory teljesítménye szempontjából. A célra épített, a rendszer többi részével együtt tervezett scale-up hálózat javítja a tokenek átvitelét, csökkenti a tréningidőt, növeli a kihasználtságot és csökkenti az egy tokenre jutó költséget.

NVLink: célzott megoldás az AI factory-khoz

A NVIDIA NVLink célzottan a scale-up hálózati réteget szolgálja. A hatodik generációs NVLink interconnect NVLink 6 Switch-szel úgy lett tervezve, hogy gyorsítsa az AI inference-t, a tréninget és más párhuzamos számítási munkaterheléseket, amelyek nagy, gyors GPU–GPU kommunikációt igényelnek. Támogatja a SHARP jellegű in-network compute-ot kolektív műveletek áthárítására, és rack-szintű megbízhatósági funkciókat tartalmaz a gyártásra alkalmas rendelkezésre állás érdekében.

NVLink extrém co-design eredménye: a chipptől a szoftverig bezárólag minden réteg együtt van optimalizálva. A technológia évek óta érett, széles körben telepített, és a modern AI-infrastruktúra gerincét képezi.

Mértékadó teljesítmény és konkrét számok

A Vera Rubin NVL72 platformmal a hatodik generációs NVLink biztosítja a következőket egy 72 GPU-s scale-up domainben:

  • 3,6 TB/s kétirányú GPU–GPU sávszélesség GPU-nként
  • 260 TB/s rack-aggregált GPU-sávszélesség
  • GPU–GPU végpontok közötti késleltetés 3X-kal kisebb az off-the-shelf Ethernet alapú alternatíváknál
  • 10X magasabb csomagátviteli ráta
  • 130 TFLOPS in-network compute (összesen a rackben)

Egy NVLink Switch tálca négy NVLink 6 switch chipet tartalmaz, 28,8 TB/s tálcaösszsávszélességgel és 14,4 TFLOPS FP8 in-network compute képességgel. Az NVLink roadmap up to 1152 GPU-s scale-up domain támogatását és co-packaged optikai kapcsolódást is megemlíti.

NVIDIA bemutatók szerint nagy MoE modelleken (például DeepSeek-R1, Qwen 235B és egy szimulált 2T paraméterű LLM) az NVLink akár 2,3-szoros decode troughput-ot tud elérni vezető, kész Ethernet alapú megoldásokhoz képest egy 72-accelerátoros scale-up domainben (szimuláción alapuló eredmények).

Teljes rendszerre kiterjedő értékelés szükségessége

A gyártói adatlapok gyakran egyszerű sávszélesség-számokra összpontosítanak (link rate, összes switch kapacitás stb.), de a mai AI munkaterhelések értékeléséhez gyárszintű nézőpont kell. A tényleges, teljes rendszer által nyújtott teljesítmény határozza meg, hány token dolgozható fel egy adott idő, energia és hely (factory square foot) alatt. Ez magában foglalja az all-to-all sávszélességet, az end-to-end késleltetést (GPU HBM-ből a hálózaton keresztül minden más GPU HBM-jébe), a hálózaton belüli compute-ot a redukciókhoz, és a teljes vertikumban integrált szoftvert, amely képes útválasztást optimalizálni, kolletív műveleteket kezelni, linkforgalmat terheléskiegyenlíteni és adatátvitelt pipeline-olni.

A tényleges teljesítmény csak addig számít, amíg a gyár működőképes: a hosszú rendelkezésre állás, folyamatos egészségfigyelés és alkatrészszintű karbantartás biztosítja a jóputot — azaz a gyár élettartama alatt megtermelt hasznos kapacitást.

Nem bizonyított technológiák vagy nem scale-up célra tervezett megoldások alkalmazása kockázatot jelenthet a gyártási teljesítmény, a kiesések és az ellátási megbízhatóság szempontjából. A cél a fenntartható, megbízható ROI biztosítása a gyár élettartama alatt.

Kulcsmutatók a scale-up hálózatoknál

Három fő kritérium határozza meg a scale-up hálózatok értékelését:

  • Delivered Performance: sávszélesség, késleltetés, end-to-end teljesítmény, in-network compute, és teljes vertikumú szoftverintegráció.
  • Factory Resiliency: hosszú üzemidő, folyamatos telemetria, alkatrész-szintű karbantartás támogatása működés közben.
  • Platform Maturity and Supply Chain: érett technológia, széles körű telepítések és megbízható ellátási lánc.

Resziliencia és üzemeltethetőség: NVLink 6 funkciói

A hatodik generációs NVLink Switch bevezet olyan kezelési és megbízhatósági funkciókat, amelyek az AI factory üzemeltetését segítik:

  • Control plane resilience
  • Részben feltöltött rackek támogatása
  • Hot-swappable switch tálcák
  • Szoftveresen definiált útválasztás management controller fallback lehetőséggel
  • Dinamikus forgalom-átirányítás
  • Üzem közbeni szoftverfrissítések
  • Finoman hangolt link-telemetria hibazurakesítéshez

Ezek a képességek lehetővé teszik, hogy egy hiba ne vigye ki az egész racket a szolgálatból, hanem a telemetria és izoláció segítségével fenntartsák a gyár hasznos kapacitását.

Szoftver és ökoszisztéma

A NVLink stack szoftverelemei közé tartozik többek között az NVIDIA Dynamo, NVIDIA TensorRT-LLM, NVIDIA Collective Communications Library (NCCL) és a CUDA alapok. A Dynamo disaggregált servinget, dinamikus GPU-allokációt és KV-cache-érzékeny útválasztást támogat; a TensorRT-LLM optimalizált LLM inference könyvtár; a NIXL gyors adatmozgást segítő könyvtár; az NCCL pedig topológia-érzékeny collectives és SHARP támogatást nyújt.

A hardver és szoftver extrém co-designja olyan teljesítményjavulásokat tesz lehetővé, amelyek nem érhetők el elkülönített fejlesztéssel. Példaként a Hopper–Blackwell átmenetben, amely megduplázta az NVLink sávszélességet és kiterjesztette a scale-up domaint 8-ról 72 GPU-ra, valamint beépítette a Dynamót, a NVIDIA 50X javulást ért el MoE inference teljesítmény per watt tekintetében. A Vera Rubin platform ezt tovább fokozza a sávszélesség és az in-network compute megduplázásával.

CPU–GPU koherencia: NVLink-C2C

Az AI factory-k nem csak GPU–GPU sávszélességet igényelnek, hanem magas sávszélességű, koherens CPU–GPU kapcsolatot is. Az NVIDIA NVLink-C2C ezt a kapcsolatot adja: a Vera CPU-kkal a Vera Rubin NVL72 platformban 1,8 TB/s koherens sávszélességet biztosít CPU és GPU között, ami 7-szerese a PCIe Gen6 sávszélességnek. A Vera CPU 88 NVIDIA Olympus egy magjával, nagy memória-sávszélességgel és energiahatékony működéssel készült az ilyen szerephez.

NVLink Fusion: semi-custom XPU-k integrálása

Azok a skálázók, amelyek saját, speciális XPU-kat fejlesztenek, gyakran nehézségekbe ütköznek a scale-up networking és a rack-szintű architektúra integrálása során. Az NVIDIA NVLink Fusion lehetővé teszi, hogy félig egyedi gyorsítók csatlakozzanak az NVIDIA NVLink ökoszisztémához, így csökkentve a fejlesztési komplexitást, növelve a teljesítményt és felgyorsítva a piacra jutást. Ez lehetővé teszi a heterogén infrastruktúra egyszerűbb üzemeltetését és a disaggregált számítási modelleket.

Következtetés

A következő generációs AI factory-kat nem a leggyorsabb önálló gyorsító fogja nyerni, hanem az az infrastruktúra, amely a legtöbb intelligenciát képes előállítani a legalacsonyabb token-költséggel, gyors ütemben, alacsony bevezetési kockázattal. A NVLink hatodik generációja vezető teljesítményt (3X alacsonyabb késleltetés, 10X magasabb csomagsebesség, 130 TFLOPS in-network compute), gyári üzemeltetésre szánt rezilienciát és érett, bizonyított platformot kínál, amelyet több mint egy évtizednyi beruházás és telepítés támaszt alá. NVLink célja, hogy biztosítsa a teljesítményt, üzemeltethetőséget és folyamatos innovációt, amelyek az AI factory-k működéséhez szükségesek.