A NVIDIA Rubin GPU a vállalat Vera Rubin platformjának központi komponenseként jelent meg, kifejezetten az ún. agentic — azaz több lépésen, tervezéssel, eszközhasználattal és ellenőrzéssel zajló, folyamatos következtetést és generálást igénylő — munkaterhelések kiszolgálására. A tervezés célja, hogy egyenértékű energiafelhasználás mellett többszörös (akár 10×) agentic átvitelt biztosítson a korábbi Blackwell generációhoz képest.
Hardveres jellemzők és architektúra
A Rubin GPU két, reticle-limitált számítási die-ből áll, amelyeket az NVIDIA High-Bandwidth Interface (NV-HBI) köt össze egyetlen csomagban. A chip adat szerint 336 milliárd tranzisztort tartalmaz, 224 streaming multiprocesszort (SM) és 896 Tensor Core‑t. A harmadik generációs Transformer Engine adaptív precizitás-kezelést kínál, és a Nvidia szerint akár 50 petaflops NVFP4 inferencia‑teljesítményt tud biztosítani.
A GPU belső erőforrásait Graphics Processor Cluster (GPC) egységekbe szervezték, központosított L2 cache-sel. A GigaThread Engine a munkamegosztást koordinálja, a MIG Control lehetővé teszi a GPU-partícionálást több munkaterhelés számára, és az NV-DEC a dekódolást gyorsítja. Ezek együtt segítik a magas kihasználtság fenntartását a változatos agentic feladatok alatt.
Memória és I/O: HBM4, KV cache és magas sávszélesség
A Rubin GPU csomagonként legfeljebb 288 GB HBM4 memóriát integrál, amelyet dedikált HBM vezérlők és 12‑Hi lapkás felépítés hajtanak. A csúcs sávszélesség elméletileg 22 TB/s lehet, ami a vállalat szerint 2,8× javulás a Blackwell generációhoz képest. A memória‑alrendszer hatékonyságát egy továbbfejlesztett Tensor Memory Accelerator (TMA) növeli, amely hatékonyabban kezeli a komplex tenzor‑elrendezéseket és a megosztott leírókat (descriptorokat).
A skálázódó GPU‑GPU kommunikációhoz az NVLink 6 összesen 3,600 GB/s skálázódó sávszélességet biztosít az NVLink Switch felé, az NVLink‑C2C pedig 1,800 GB/s koherens CPU–GPU kommunikációhoz. A host‑kapcsolat x16 PCIe Gen 6 formátumban legfeljebb 256 GB/s.
Késleltetéscsökkentés és kritikus inferenciaútvonalak
A Rubin nem csak nyers Tensor Core‑teljesítményt növeli, hanem a gyakorlati inferenciai útvonalakat is gyorsítja: adatmozgatást, mátrixműveleteket, hosszú kontextusú attention műveleteket és kernel‑közi átmeneteket.
-
MoE modellekhez: a TMA inline descriptor update támogatása lehetővé teszi, hogy egy közös leírót használva a kernel futásidőben írja felül a memóriapointert és stride‑ot, csökkentve a metadata‑kezelés és adatmozgatás költségét. Ez segít, hogy a Mixture‑of‑Experts modellek jobban skálázzanak növekvő szakértőszám mellett.
-
K‑dimenzió duplázása: a Rubin GPU óránkénti Tensor Core‑throughput‑ját úgy növelték, hogy megduplázták a K dimenzió mentén feldolgozható adat mennyiségét. Ennek eredményeként kevesebb K‑ciklusra van szükség egy GEMM‑hez, ami csökkenti a ciklus‑overheadet és jobb Tensor Core kihasználtságot eredményez, különösen több GPU‑ra bontott végrehajtásnál.
-
Attention és hosszú kontextus: Rubin az aktivációs sparsity és adaptív tömörítés kombinációját alkalmazza a QK^T közbenső mátrixok tömörítésére (strukturált 2:4 sparsity), így a softmax és a következő attention GEMM kevesebb adatot dolgoz fel. A Rubin exponenciális művelet‑átviteli teljesítménye is nőtt: a vállalati adatok szerint FP32‑ben 2×, BF16/FP16‑ban 4× az exponenciális throughput a Blackwellhez viszonyítva, ami csökkenti a softmax‑szűk keresztmetszetet.
-
Finomabb kernel‑koordináció: a korábbi bulk‑triggering helyett Rubin tile‑szintű triggerelést tesz lehetővé, ami azt jelenti, hogy egy fogyasztó‑kernel hamarabb elkezdhet dolgozni, amint a szükséges bemenetek egy része rendelkezésre áll, így csökkennek a GPU‑idővonalon keletkező üres idők.
Kommunikációs gyorsítások és számlált írások
A rack‑szintű skálázás kritikus részét képező GPU‑GPU kommunikációt a Rubin counted writes funkcióval egyszerűsíti. Ez lehetővé teszi, hogy a fogadó GPU hatékonyabban kövesse nyomon egy eszköz‑kezdeményezésű NVLink átvitel befejeződését, csökkentve a szinkronizációs overheadet és a késleltetést a gyakori, finoman részletezett kommunikációs mintákban.
Rendszerszintű energiahatékonyság és rack‑skálázás
A Vera Rubin NVL72 rack‑konstrukció a GPU‑architektúrát kiterjeszti egy integrált, ellenálló rack‑szintű végrehajtási tartománnyá. A rack a GPU‑k, a kapcsoló‑tálcák, a 45°C‑os folyadékhűtés, a dinamikus rack‑szintű energiaelosztás és az Intelligent Power Smoothing elemeit egyesíti.
Intelligent Power Smoothing és energiatárolás kombinációjával a Vera Rubin rendszer a változó igények miatti csúcsokat csillapítja: a cég közlése szerint a korábbi technikákhoz képest nagyjából 10% átlagos teljesítménycsökkenést és körülbelül 20% csökkenést ér el az 50 ms‑os csúcsfogyasztásban. A DSX MaxLPS megoldás pedig a vállalat szerint lehetővé teheti, hogy ugyanazon teljesítménykeret mellett akár 40%‑kal több GPU‑t adjanak üzembe energiahatékony üzemi pontokon, miközben a DSX OS az üzemeltetési réteget, ütemezést és életciklus‑menedzsmentet biztosítja.
A rack dizájn hot‑swappable NVLink switch‑tálcákat, javított RAS (reliability, availability, serviceability) képességeket és rugalmas NVLink/Spectrum‑X Ethernet csatlakoztathatóságot kínál, amely a többrackes, pod‑skálájú agentic rendszerek alapját képezi.
Összegzés
A Rubin GPU és a Vera Rubin NVL72 rendszer a nyers számítási sűrűség mellett a memória‑ és kommunikációs utakat, a kernel‑koordinációt és a rack‑szintű energia‑menedzsmentet is célzottan fejleszti. Az architektúra célja a jobb tokens-per-watt és a rövidebb végrehajtási késleltetés biztosítása agentic munkaterhelésekhez: nagy kontextusok, több lépéses következtetések, MoE dekódolás és alacsony késleltetésű interakciók folyamatos kiszolgálása mellett. A vállalat saját mérései alapján ez generációs ugrást jelenthet a hasznos inferencia‑átvitelben és az energiahatékonyságban a Blackwell családhoz képest.



