NVIDIA a Vera CPU‑t az agentikus mesterséges intelligencia (AI) igényeihez igazította, ahol a CPU egyre nagyobb szerepet kap az ütemezés, eszközhasználat, kontextus‑lekérés, adatbázis‑interakciók és eredményfeldolgozás kritikus végrehajtó útjában. Mivel ezek a vezérlési hurkok párhuzamosan futnak egy „AI‑gyárban”, a CPU teljesítménye egyre nagyobb hatással van az egyes ügynökök (agentek) válaszidejére és az egész rendszer áteresztőképességére.
A hagyományos felhő‑CPU dizájnoktól eltérően az agentikus munkaterhelések más jellemzőket igényelnek: kiváló egy szálú teljesítményt még teljes terhelés mellett, elegendő memóriasávszélességet magonként, kiszámítható késleltetést párhuzamosság esetén, valamint hatékony kezelést szabálytalan vezérlési áramlás, hosszú függőségi láncok és pointer‑orientált adatszerkezetek esetén. Erre a feladatra építették a Vera CPU‑t, központi eleme a tervezésnek az Olympus mag.
Ez a cikk áttekinti az Olympus mag architektúráját, a többszálúsítás megközelítését, a koherens összeköttetést, a memória alrendszert és a skálázást támogató biztonsági elemeket, amelyek célja a magas egy szálú teljesítmény fenntartása AI‑gyári méretekben. Részletes műszaki tárgyalás található a Vera CPU white paperben.
Olympus: magas IPC és egy szálú előrehaladás
Az Olympus magot rendszer‑szintű, széles körű együtttervezéssel fejlesztették a Vera Rubin platformon belül, amely CPU‑kat, GPU‑kat, hálózatot, tárolót, memóriarendszereket és szoftvert fog össze. Az Olympus célja az utasítások per ciklus (IPC) maximalizálása olyan, erősen párhuzamos AI‑infrastruktúra munkaterhelésekhez, amelyek gyakran ágaznak el, nagy kód‑lábnyomúak és késleltetés‑érzékenyek.
Az Olympus főbb blokkjai:
- Front end: optimalizált elágazás‑előrejelzők, széles utasítás‑letöltés és 10‑utas dekóder.
- Mid core: kritikus útgyorsítás, széles átnevező és nagyméretű reorder buffer a mély out‑of‑order végrehajtáshoz.
- Execution engine: kiegyensúlyozott végrehajtó egységek egész skálája (egész szám, vektor, lebegőpontos, titkosítás, betöltés/mentés).
- Cache alrendszer: késleltetésre optimalizált utasítás‑ és adatcsatornák, több hardveres előgyorsító és graf‑prefetcher.
Front end
Az Olympus front end úgy készült, hogy folyamatosan hasznos utasításokkal lássa el a magot nagy, elágazás‑gazdag szoftverrendszerek esetén is. A magba épített elágazás‑előrejelző alrendszer tartalmaz egy neurális elágazás‑előrejelzőt, amely javítja a pontosságot statisztikailag elfogult, nehezen becsülhető elágazási mintákon. A rendszer képes legfeljebb két „taken branch” támogatására ciklusonként, ami csökkenti a rossz irányú végrehajtást és fenntartja a front‑end átvitelt.
Mid core
Agentikus munkafolyamatok gyakran hosszú, egymásra épülő feladatláncokból állnak (interpreterek, objektum‑átjárás, futtatási állapot kezelése, eszköz‑kimenetek feldolgozása). Az Olympus mid core‑ja igyekszik feltárni és felgyorsítani a rejtett párhuzamosságot: széles átnevező/hozzárendelő motor, nagy reorder buffer és kiterjedt fizikai regiszter‑kapacitás tart több utasítást „repülésben”. Függőség‑törő képességek — például memória átnevezés, érték‑előrejelzés és kritikus út gyorsítás — csökkentik a pointer‑nehéz kód miatti várakozásokat.
Execution engine
A végrehajtó egység dinamikusan ütemezi az operációkat széles erőforráskészleten át (egész szám, vektor, ágak, betöltés/mentés, kripto stb.) és mély out‑of‑order végrehajtást használ, hogy magas IPC‑t érjen el. Ez a kiegyensúlyozott megközelítés hatékonyan kezeli a branch‑gazdag szoftvereket, vektorizált adatfeldolgozást, AI előfeldolgozást, titkosítást, tömörítést és analitikát.
Cache alrendszer
Az agentek gyakran olyan adatszerkezeteken dolgoznak (runtime objektumok, indexek, gráfok, sparse adatok), amelyek nem illeszkednek jól a hagyományos cache‑mintákhoz. Az Olympus cache alrendszere mély hierarchiát, memória‑disambiguációt és több hardveres előgyorsítót kombinál, köztük egy gráf‑prefetchert, hogy csökkentse a szabálytalan memóriakérések miatti várakozási időt és növelje a memória‑szintű párhuzamosságot.
Többszálúsítás: NVIDIA Spatial Multithreading (SMT)
A többszálúsítás fontos az agentikus munkaterheléseknél, ahol eseményvezérelt, rövid rohamszerű feladatok és háttértevékenység váltakozik. A hagyományos SMT erőforrás‑megosztásból profitál, ugyanakkor zajos szomszéd (noisy‑neighbor) hatást eredményezhet: elágazás‑előrejelzés, dekódolási sávszélesség, végrehajtó erőforrások, cache és memória‑sávszélesség feletti versengés csökkentheti a kiszámíthatóságot.
A Vera CPU e helyett NVIDIA Spatial Multithreadinget alkalmaz: a széles Olympus mag erőforrásait úgy tervezték, hogy jobban lehessen partícionálni két hardveres szál között. Így a mag működhet magas áteresztőképességű egy szálú magként (a testvérszál kezelve a menedzsment‑munka), vagy két jobban izolált végrehajtási kontextusként, ha nagyobb szál‑sűrűség szükséges. A Vera CPU 88 Olympus maggal és 176 SMT szállal képes nagyszámú párhuzamos agent feladatot támogatni, csökkentve a szálak közti interferenciát és javítva a késleltetés/átviteli következetességet.
Koherens hálózat és nagy sávszélességű memória
Egy magas IPC‑jú mag csak akkor tudja kihasználni előnyét, ha a processzor többi része is tudja ellátni utasításokkal és adatokkal. A Vera CPU az Olympus magot az NVIDIA Scalable Coherency Fabric (SCF)‑pel és SOCAMM2 LPDDR5X memóriával párosítja, hogy kiegyensúlyozott platformot nyújtson AI‑gyári CPU‑végrehajtáshoz.
-
NVIDIA Scalable Coherency Fabric: a SCF a Vera CPU kommunikációs gerince, amely összeköti az Olympus magokat, a megosztott cache‑t, memória‑vezérlőket, I/O‑t és NVLink‑C2C interfészeket egy koherens, nagy sávszélességű on‑die hálózaton keresztül. A SCF akár 3,4 TB/s hálózati sávszélességet és 164 MB egységes L3 cache‑t integrál a magok között, csökkentve a die‑hop késleltetést és a topológiai variabilitást.
-
SOCAMM2 LPDDR5X memória: a memóriarendszer akár 1,2 TB/s aggregált sávszélességet biztosít, ami magonként akár 14 GB/s‑nak felel meg, így a magok jobb eséllyel tudják fenntartani hasznos munkavégzésüket magas párhuzamosság mellett. A SOCAMM2 moduláris, cserélhető LPDDR5X modulokat használ, megőrizve az LPDDR rövid elektromos utakat és adatközpont‑szintű javíthatóságot (RAS képességek).
Skálázás, I/O és bizalmas végrehajtás
A Vera CPU nem csak utasításokat hajt végre gyorsan: az adatok mozgatása, az gyors skálázás és a biztonságos végrehajtás egyaránt kritikus.
-
Dual‑socket skálázás: a Vera CPU második generációs NVLink‑C2C‑vel kínál magas sávszélességű, koherens foglalatról‑foglalatra kapcsolódást, lehetővé téve két CPU számára az egységes működést egy koherens rendszerként. A monolitikus compute die és az egységes cache miatt minden socket egyetlen NUMA domainként jelenik meg, így a két‑NUMA csomópontú topológia egyszerűbb programozást és kiszámíthatóbb skálázást eredményez.
-
I/O: PCIe 6.4 támogatás és 176 PCIe sáv egy dual‑socket konstrukcióban a modern hálózatokhoz, tároláshoz és gyorsítókhoz. Emellett CXL 3.1 támogatás révén koherens memória‑kiterjesztés, memóriapoolozás és komponálható infrastruktúra is elérhető.
-
Confidential Compute: a Vera Rubin NVL72 kiterjeszti a Confidential Computing‑et a skálázódó AI infrastruktúrára, védve az in‑use adatokat CPU‑k, koherens GPU‑k és kapcsolatok között. Az alapok között szerepel az Arm CCA/RME, per‑VM titkosítási kulcsok, biztonságos hozzárendelés TDISP‑képes koherens eszközöknek és autentikált C2C titkosítás a koherens linkek védelméhez.
Teljesítmény agentikus munkaterheléseken
A Vera tervezési döntéseinek gyakorlati következményeit agentikus munkaterheléseken is mérik. A központi mérőszám a terhelt egy‑szálú teljesítmény: agentikus AI és reinforcement learning rendszerek gyakran sok sandboxot és eszközt futtatnak párhuzamosan, ezért fontos, hogy egy szál folyamatosan haladjon akkor is, amikor a socket megosztja az energia‑, cache‑ és memória‑erőforrásokat.
NVIDIA bemutatása szerint a Vera CPU agentikus munkaterheléseken akár 1,8× jobb teljesítményt ér el (ábra alapján), és a SPEC CPU® 2026 eredményeket belső mérések szerint 2026 júliusában rögzítették. A részletes méréseket és konfigurációs adatokat a Vera CPU white paper tartalmazza.
Összefoglalás
A Vera CPU Olympus magjára és az azt körülvevő rendszer‑szintű elemekre (SCF, SOCAMM2 LPDDR5X, NVLink‑C2C, PCIe 6.4, CXL 3.1, Confidential Compute) építve NVIDIA olyan platformot kommunikál, amely a magas egy szálú előrehaladást és kiszámítható késleltetést helyezi előtérbe agentikus AI, reinforcement learning, gráf‑analitika és adatfeldolgozó munkák számára. A dizájn célja, hogy a CPU‑oldali végrehajtás ne legyen szűk keresztmetszet egy AI‑gyár teljesítményében és megbízhatóságában.
A további műszaki részletek és a mérések konfigurációja a Vera CPU white paperben találhatók.



