A SemiAnalysis AgentX benchmark, amely valós jellegű, előre rögzített kódoló ügynök (agent) munkameneteket játszik le, újratervezett mérőszámokkal vizsgálja az ügynökalapú (agentic) AI-szolgáltatások hardverhatékonyságát. Az NVIDIA által bemutatott eredmények szerint a Vera Rubin NVL72 egyes méréseken akár 30× nagyobb token-throughputot képes előállítani megawattenként, szemben a GB300 NVL72-vel a DeepSeek V4‑Pro munkaterhelésnél 160 token/s felhasználói interaktivitásnál. A GB300 NVL72 továbbra is jelentős, többszörös előnyt tart fenn az előző generációs H200 NVL8-cal szemben több agentikus forgatókönyvben.
Mi az AgentX és miért fontos?
AgentX az InferenceX nyílt forrású benchmark-csomag egy eleme, amelyet a SemiAnalysis fejlesztett az ügynökalapú kódolási inferencia hatékonyságának mérésére. Ellentétben a rövid, fix hosszú prompt–válasz mérésekkel, AgentX valós, előre rögzített Claude Code munkameneteket játszik le, amelyek több lépéses érvelést, eszközhasználatot (tool calls) és növekvő kontextust tartalmaznak. A cél az, hogy a mérések tükrözzék a gyakorlatban előforduló hosszú, állapotfüggő, megszakított és párhuzamos igénybevételeket.
A benchmark a szolgáltatási rutinok viselkedését méri újrajátszott forgalmon keresztül: megőrzi a munkamenetek kontextusát, a bemeneti/kimeneti sorhosszokat, az eredeti érvelési időket és az eszközhívások késleltetését, így a KV-cache kapacitásnyomását és a valódi timingot is reprodukálja. Minden rendszer ugyanazt a rögzített forgalmat kapja, ezért az eltérések a tényleges szolgáltatási stack különbségeit tükrözik.
Mérés és metrika: tokens per megawatt és felhasználói élmény
AgentX elsődleges metrikája az AI‑gyár szempontjából a „tokens per megawatt” — azaz hány kimeneti token állítható elő megawattenként fenntartva a kívánt felhasználói élményt. A benchmark négy felhasználói élmény-intervallumot mér:
- E2E Normalized Interactivity: teljes kérést szemléltető, beküldéstől az utolsó token érkezéséig számított átlagos kimeneti token/idegység arány. Megmutatja, mennyi felhasználó által látható outputot ad a platform megawattenként egy kompletten mért élménnyel.
- Standard Interactivity: a tényleges generálás alatti token/óra arány, az első és utolsó token közti időt figyelembe véve; kizárja a TTFT-et.
- E2E Latency: teljes kérés lezajlási ideje; a rövidebb jobb, mert egy magas hatékonyság csak akkor használható, ha a kérések befejezése elfogadható időn belül történik.
- TTFT (Time To First Token): az első kimeneti tokenig eltelt idő; fontos, ha az ügynökök sűrűn indítanak hosszú-kontekstuális fordulókat.
AgentX a konkurenciát változó párhuzamossági szinteken futtatva térképezi fel a throughput–interaktivitás kompromisszumát, és minden ponton megadja a fenntartott throughputot megawattenként.
NVIDIA Vera Rubin NVL72: előzetes AgentX eredmények
Az NVIDIA által mért és SemiAnalysis felülvizsgálatára váró adatok szerint a Vera Rubin NVL72 a DeepSeek V4‑Pro AgentX munkaterhelésen, 160 token/s felhasználói interaktivitásnál, egyes mérési pontokon akár 30× nagyobb AI‑factory throughputot ad megawattenként a GB300 NVL72-hez viszonyítva. Ez arra utal, hogy a Rubin architektúra jelentősen növelheti az ügynökalapú inferencia kapacitását ugyanazon interaktivitási cél megtartása mellett.
Az NVIDIA részletesebb műszaki magyarázatát a Rubin GPU-architektúra tervezéséről a „Inside NVIDIA Rubin GPU Architecture: Powering the Era of Agentic AI” anyag tartalmazza.
NVIDIA GB300 NVL72: AgentX eredmények és gazdaságosság
A SemiAnalysis AgentX mérésein a GB300 NVL72 szintén jelentős teljesítményelőnyt mutatott az előző generációs H200 NVL8-cal szemben:
- DeepSeek V4 Pro 1.6T munkaterhelésen a GB300 NVL72 legfeljebb 15× magasabb token-throughputot nyújt megawattenként, mint a H200 NVL8.
- Ez az előny a költséghatékonyságban is megjelenik: a GB300 NVL72 akár 10× alacsonyabb tokenköltséget adhat millió tokenenként, ami operátori szinten több interaktív kapacitást vagy alacsonyabb működtetési költséget jelent ugyanazon infrastruktúra- és energia‑keret mellett.
A GB300 előnye tovább nő a nagyobb modelleknél: Kimi K3 2.8T modellen a GB300 NVL72 körülbelül 80× jobb throughputot ér el megawattenként a H200 NVL8-hoz képest, és az interaktivitási határt nagyjából 215 token/s/felhasználóig tolja ki — jóval túl azon a tartományon, amelyet a H200 NVL8 elér.
Műszaki összetevők, amelyek hozzájárulnak az eredményekhez
A GB300 NVL72 eredményei rendszer‑szintű optimalizációk eredményei: a futtató környezetek, modell‑kernel-ek és a scale-up fabric együttese lehetővé teszi a nagy MoE (Mixture of Experts) modellek fegyelmezett, reagáló inferenciáját, még növekvő kontextus és párhuzamosság mellett.
Fontos technológiák és megközelítések:
- MoE-serving runtime-ok: keretrendszerek, például SGLang, TensorRT-LLM és vLLM képesek elosztani az expert munkát az NVL72 tartományában. Módszerek, mint a Wide Expert Parallelism és DeepEP, segítenek egyensúlyozni az expert terhelést több GPU között.
- MoE-kernel-ek és kommunikációs átfedés: DeepGEMM-alapú kernel-ek, MXFP4/MXFP8 kevert precíziós formátumok és fuzionált MoE végrehajtási utak csökkentik az expert-stádiumok közti adatmozgatást; a kommunikáció és a Tensor Core számítás átfedése javítja a token-throughputot.
- NVIDIA Dynamo: külön kezeli a prefill és decode fázisokat, függetlenül skálázható munkacsoportokkal, session-aware servinget és KV-cache‑tudatos routert alkalmazva, hogy csökkentse a szükségtelen prefill számításokat és fenntartsa a gyors többszörös fordulós kiszolgálást.
- NVLink scale-up fabric: a GB300 NVL72 72 GPU-ját NVLink köti össze, magas sávszélességű rack-szintű domainné téve a rendszert, ami elengedhetetlen a memória, kommunikáció és KV-cache mozgás koordinált kiszolgálásához.
Mire számíthatunk tovább az ügynökalapú AI-tól?
A Vera Rubin NVL72 arra mutat rá, hogy a rack‑szintű, hosszú-kontekstuális és elosztott végrehajtási mintákra hangolt rendszerek jelentősen növelhetik az ügynökalapú inferencia hatékonyságát. A teljes Vera Rubin platform az egyes munkafázisokat a legalkalmasabb erőforrásokra bízza: Rubin GPU-k a nagy kontextus és hatékony dekódolás kezelésére, Vera CPU-k az eszközvégrehajtásra és KV‑cache offloadra, valamint Groq 3 LPX a nagyon alacsony késleltetésű interaktivitás kiaknázására.
A cél az, hogy csökkentsék az újraszámítást és a várakozási időt, fenntartsák az interaktív teljesítményt a növekvő munkamenetek mellett, és a rendelkezésre álló energia nagyobb részét hasznos agentikus kimenetté alakítsák.
Köszönetnyilvánítás
Az eredmények előállításához NVIDIA mérnökeinek, köztük Xin Li, Ankur Singh, Anthony Casagrande, Jonas Li, Po‑Han Huang és Xiaoming Chen hozzájárulásai járultak hozzá.
Ez a cikk a SemiAnalysis AgentX benchmark és az NVIDIA által mért előzetes NVL72 eredmények alapján íródott; az NVIDIA-méréseket a SemiAnalysis felülvizsgálata még megerősítheti.



