Eszközök

Mesterséges intelligenciával generált szöveg

NVLink 6: többrétegű hibatűrés a Vera Rubin AI gyárak számára

A cikk főszereplője az NVIDIA és annak NVLink 6 hálózati megoldása, amely a Vera Rubin platform és a Vera Rubin NVL72 rackmotor alapját képezi, 72 Rubin GPU egyesítésével.

NVLink 6: többrétegű hibatűrés a Vera Rubin AI gyárak számára

A folyamatos működés maximalizálása kritikus a nagyléptékű AI „gyárak” üzemeltetői számára: a tanítás során a fürt minden GPU-ja ezernyi kollektív szinkronizációs művelettel dolgozik másodpercenként, míg inference-szolgáltatásnál egy váratlan kiesés azonnal csökkenti a kiszolgált lekérések mennyiségét és a bevételt. Az NVIDIA erre válaszul az NVLink 6 multi-rétegű hibatűrési megközelítését mutatja be, amelyet a Vera Rubin platform és a NVL72 rack-szintű számítási egység dolgozóinak megbízható, veszteségmentes hálózati működésére terveztek.

Mi az NVLink 6 és hol használják?

A Vera Rubin egy teljes verem AI-platform, amelyről az NVIDIA azt állítja, hogy az AI-munkaterhelésekhez a tanítást negyedannyi GPU-val képes elvégezni, és a legjobb inference-throughput/watt arányt célozza a token-költség minimalizálásával. A Vera Rubin NVL72 rack-szintű számítási motor 72 Rubin GPU-t kapcsol össze egyetlen, skálázható domainné a NVLink 6 skálázódó hálózati váz segítségével, így a GPU-k egyetlen egységként működhetnek.

Miért kell multi-rétegű megoldás?

Nagy rendszerméretben a véletlenszerű hibák, linkromlások és csomópont-kiesések elkerülhetetlenek. Az NVLink 6 célja az, hogy ezeket a jelenségeket és következményeiket több szinten — fizikai, link, rendszer és alkalmazás — lokalizálja és korrigálja, így megelőzve a kollektív műveletek és az inference szolgáltatások megszakadását. Az architektúra három fő rétegre épít:

  • Fizikai és link réteg: natively lossless szerkezet FEC, PLR és UPHY mechanizmusokkal, valamint credit-based flow control (CBFC) és aktív hibazárással.
  • Rendszer- és vezérlési réteg: redundáns switch tálcák, elosztott NMX vezérlők és kettős out-of-band menedzsment utak a single-point-of-failure elkerülésére.
  • Alkalmazási réteg: Shadow Engine Recovery, NCCL-elasticity, CUDA-alapú checkpointing és alkalmazásszintű mentési/restore mechanizmusok a gyors failoverhez.

Fizikai réteg: zaj és jelromlás kezelése

NVLink a szilicon szinten küzd az elektromos zaj és jeldegradáció ellen. A rendszer könnyített Forward Error Correction (FEC) megoldást alkalmaz, mert a Physical Layer Retry (PLR) gyors, alacsony késleltetésű visszaküldési lehetőséget biztosít második védelmi vonalként. Az adó oldal fejlettebb hibajavító kódokat illeszthet az adatfolyamhoz, a vevő pedig inline képes egy- és többbites hibákat helyreállítani közel nulla késleltés mellett. Az NVIDIA állítása szerint ez hozzájárul ahhoz, hogy NVLink 3× alacsonyabb end-to-end késleltetést és 10× magasabb csomagkezelési rátát ér el a generikus Ethernet alternatívákhoz képest.

Ha az FEC nem tudja helyreállítani a hibát, a PLR fizikai rétegű újraküldésével a packet drop-okat gyakorlatilag nullára csökkentik anélkül, hogy magasabb szintű szoftverrétegek bevonására lenne szükség. Súlyos degradáció esetén az UPHY recovery gyorsan újrakalibrálja a fizikai paramétereket, miközben a csomagok hardver replay pufferben várakoznak, így adatvesztés nem történik.

Link réteg: veszteségmentes továbbítás hitelalapú vezérléssel

A Link rétegben a credit-based flow control (CBFC) a kulcs: a küldő csak akkor ad be csomagot a hálózatba, ha rendelkezik a következő ugrás pufferkapacitását jelző kreditekkel. Ez proaktív módon kiküszöböli a csomagvesztést, ellentétben a hagyományos Ethernet-kiegészítő megoldásokkal (mint Priority Flow Control vagy ECN), amelyek reaktívok és saját hibamódokat hozhatnak be (head-of-line blocking, PFC-storm, deadlock). CBFC mellett a Link Manager képes autonóm link- és trunk-rebalancingre, hogy a fizikai linkek degradációját helyben gyógyítsa.

Mivel az adatok nem vesznek el csendben az átvitel közben, a hálózat viselkedése kiszámítható és alacsony késleltetésű marad, miközben a hardverhibák lokálisan körbezárhatók anélkül, hogy a teljes domainben retranszmissziós lavina vagy kollektív megállás alakulna ki.

Alkalmazási réteg: szoftveres helyreállítás és gyors failover

Az alkalmazási réteg szoftveres tranzakció-helyreállítást (SW Recovery) hajt végre tipikus esetben körülbelül 1,5 másodperc alatt. A NMX Controller közvetlenül kommunikál a GPU driverekkel, és „contain and drain” állapotba helyezi a hibás linkeket, lehetővé téve a hardver automatikus retrainelését anélkül, hogy a teljes hálózatra visszanyomást okozna.

A vezérlési sík single point of failure kockázatát az NMX High Availability (NMX-HA) csökkenti: ha egy switch tálcán futó NMX-C meghibásodik, a funkció másodpercek alatt átköltözik egy tartalék tálcára. A kapcsoló tálca adatútja pedig le van választva a menedzsment CPU-tól, így egy NVOS újraindítás vagy CPU-hiba esetén az adatút folyamatosan képes keretek továbbítására az üzemszünet elkerülésével.

NCCL és Shadow Engine Recovery: gyors helyreállítás inference esetén

Az NVLink fizikai és link rétegei a legtöbb hibát orvosolják, de nem javítható megszakadások eljuthatnak a szoftverig. Multi-GPU inference telepítéseknél az NVIDIA Collective Communications Library (NCCL) felel a gyors szinkronizációért. Ha egy NVLink kapcsolat súlyosan megszakad, a NCCL kommunikációs műveletek hibát jelezhetnek, ami korábban a teljes inference engine hideg újraindítását igényelte: model súlyok újratöltése, kernelkompiláció és CUDA-graph újrafogás, ami percekig tarthatott.

A Shadow Engine Recovery (az NVIDIA Dynamo részét képező megoldás) elkerüli a hideg újraindítást: az aktív inference-folyamat mellett előre inicializált, inaktív „árnyék” replika fut, amely saját NCCL/NIXL kommunikátorokat hoz létre indításkor. Hiba esetén ez a készenlétben lévő folyamat azonnal át tudja venni a forgalmat anélkül, hogy újra fel kellene építeni a kommunikációs topológiát vagy újra kellene tölteni a modelleket. NVIDIA által közölt benchmarkon B200 GPU-kon a Shadow Engine Recovery csökkentette az inference leállási időt 283 másodpercről 7,3 másodpercig.

Ezen túlmenően a szoftveres stack támogatja a NCCL elasticity-t is, amely dinamikusan skálázza a kommunikátorokat a változó node-szám kezeléséhez.

CUDA checkpointing és gyors újraindítások

Olykor mégis szükség lehet a folyamatok újraindítására más node-okon. A CUDA CRIU-alapú processz-szintű checkpointing lehetővé teszi a teljes LLM worker folyamatok mentését és gyors visszaállítását a GPU-n, megkerülve a teljes indítási overheadet. A Dynamo Snapshot integrálja ezeket a megoldásokat, és az NCCL prototípus cuda-checkpoint támogatásának köszönhetően várhatóan a közeljövőben többnode-os checkpointok is elérhetők lesznek, ami nagymértékben csökkenti a latency-érzékeny inference munkafolyamatok újraindítási idejét.

Az NVNeMo aszinkron checkpointolása és az NVComp tömörítési megoldásai további időmegtakarítást tesznek lehetővé, így nagy modellek esetén a szinkron blokkolási időt percekről másodpercekre lehet csökkenteni.

Rendszerszintű üzemidő és rakszintű szervizelhetőség

A System Layer kezeli a hosszabb távú állapotmegőrzést és a fizikai rack-szintű egészségügyi tevékenységeket, ahol a helyreállítási idők gyakran egy perc fölé is nyúlhatnak. Az NCCL tudatosan ismeri az NVLink topológiát, és képes rekonstruálni kollektív gyűrűket vagy fastruktúrákat a degradált linkek megkerülésére. A CUDA runtime részletes hibajelentéssel segít abban, hogy a hardverhibák tisztán jelenjenek meg a futtatókörnyezet számára, elkerülve a néma rendszerlefagyásokat.

A Switch Admin State lehetővé teszi egyetlen switch tálca cseréjét úgy, hogy a teljes NVLink domainet nem kell leüríteni; a kicserélt linkek csak akkor válhatnak újra aktívvá, ha az adminisztrátor külön engedélyezi. Az NMX automatikusan felfedezi a rendelkezésre álló hardvert és beállítja a routingot részben feltöltött rakszerkezeteknél is, így a szakaszos telepítés és karbantartás alatt a működés folyamatos marad.

XPUs és NVLink Fusion

NVLink 6 resiliency megközelítése nem csak NVIDIA GPU-kra korlátozódik. Az NVLink Fusion lehetővé teszi, hogy harmadik féltől származó, egyedi XPUs is örököljék ugyanazt a NVLink skálázódó hálózati vázat és multi-rétegű hibatűrési stack-et. Ez segíti a hiperskalerek és AI-native cégek egyedi sziliciumának megbízható integrációját, csökkentve a fejlesztési kockázatot és gyorsítva a piacra jutást.

Következtetések

Az NVLink 6 több szintű, hardver-szoftver integrált megoldást kínál arra, hogy a nagy AI-fürtök számára valóban veszteségmentes és magas rendelkezésre állású hálózati működést biztosítson. Az architektúra fizikai szintű hibajavítást, hitelalapú áramlásszabályozást, redundáns vezérlési síkot és gyors szoftveres helyreállítást kombinálva igyekszik minimalizálni a tanítási és inference-időben bekövetkező kieséseket, amelyeket a skálázódó AI rendszereknél elkerülhetetlennek tartanak.

Az NVIDIA által közölt teljesítményi és helyreállítási számok (3× alacsonyabb end-to-end késleltetés, 10× magasabb csomagsebesség, valamint a B200 benchmarkon 283s → 7,3s csökkentés inference újraindításnál) tükrözik a vállalat által hangsúlyozott célokat: maximális MTBI és folyamatos rendelkezésre állás a Vera Rubin AI platformon.