NVIDIA közlése szerint a GB300 NVL72 rack‑skálás rendszer világcsúcsot állított fel a DeepSeek‑V3 671B modell előtréningjében: 256 GPU használata mellett a rendszer 1 648 TFLOPs per GPU képesített teljesítményt mutatott be. A vállalat hangsúlyozza, hogy az eredmény a hardver, az összeköttetés és a szoftver közös tervezésének (co‑design) és folyamatos optimalizációjának köszönhető.
Miért fontos ez MoE (mixture of experts) modelleknél
A cikk szerint a nagy, határmodellt célzó előtréningeknél az ipar gyorsan az MoE architektúrák felé fordult, mert ezek jelentősen csökkentik a tokenenkénti számítási igényt. DeepSeek‑V3 esetén a modell teljes paraméterszáma 671 milliárd, de tokenenként csak mintegy 37 milliárd paraméter aktiválódik, tehát a per‑token költség egy jóval kisebb modellhez hasonlítható.
Az árt a kommunikációs költség: az „expert” komponensek külön GPU‑kon tárolódnak, ezért minden MoE rétegben tokeneket kell küldeni és visszaadni egy összekötő (all‑to‑all) kommunikációs mintázaton keresztül az előre- és visszaterjesztés során. Mivel ez a kommunikáció minden rétegben és minden tanítási lépésben megtörténik, a késleltetések összegződnek; ha az all‑to‑all nem fér el a számítás mögött, a GPU‑k hozzáadása már nem növeli a teljes áteresztőképességet.
Két szintű kommunikációs kihívás és a GB300 NVL72 tervezése
A hatékony előtréninghez szoros összekapcsoltságú scale‑up domén szükséges, ahol minden GPU non‑blocking, egyenletes sávszélességet és alacsony késleltetést kap. Nagy modellekhez több rack kell, és a rackszintű (scale‑out) forgalmat is meg kell oldani úgy, hogy az a számítás ablakán belül megérkezzen és kiszámítható maradjon. A siker mérőszáma a leadott FLOPok mennyisége (delivered FLOPs), nem a peak FLOPok.
A GB300 NVL72 ezeket a követelményeket együtt kezeli: rack‑skálás rendszerként extrém együtttervezéssel (silicon, interconnect, hálózat és szoftver mint egységes platform) készült.
- Az NVLink ötödik generációja a scale‑up hátteret adja: 72 NVIDIA Blackwell Ultra GPU‑t kezel egy egységként, egy GPU‑ra 1,8 TB/s sávszélességet és rack szintű, nem blokkoló 130 TB/s all‑to‑all sávszélességet biztosítva, így minden GPU egyetlen ugrással éri el a többit.
- Az NVLink memória‑szemantikus: egy GPU közvetlenül olvas és ír egy társ HBM‑jét natív memória műveletekként egy veszteségmentes, flow‑vezérelt hálózaton, ami alacsony késleltetésű adatutat jelent, és lehetővé teszi, hogy redukciók a kapcsolóban is fussanak.
- A rackszintet túlmutató skálázódás NVIDIA ConnectX‑8 SuperNIC‑eken keresztül történik, 800 Gb/s per‑GPU sebességgel, NVIDIA Quantum‑X800 InfiniBand vagy NVIDIA Spectrum‑X Ethernet használatával, hogy a gradientforgalom a számítás mögött maradjon.
Továbbá az infrastruktúra szintjén az NVIDIA BlueField DPU‑k izolált infrastruktúra‑feldolgozási domént nyújtanak hálózat, tárolás, biztonság és telemetria kezelésére, csökkentve a hoszt CPU terhelését nagy skálájú tréningeknél.
Szoftveroptimalizációk és mérési eredmények
A tréning szoftveroldalát NVIDIA Megatron Core‑ral mérték és hangolták a GB300 NVL72 rendszeren. Megatron Core esetében a DeepSeek‑V3 671B előtréning 256 GPU mellett 1 648 TFLOPs/GPU leadott teljesítményt mutatott, szemben a korábbi GB200 NVL72‑n mért 606 TFLOPs/GPU‑val — ez hozzávetőlegesen 3×‑os növekedés egy generáción belül.
A cég kiemeli, hogy a szoftveres fejlesztések hosszabb távon is számottevő nyereséget hoznak: ugyanazon GB300 NVL72 rack‑rendszeren belül fél év alatt 1,5×‑es teljesítménynövekedést értek el kizárólag szoftveroptimalizációkkal.
Nyílt forráskódú keretrendszerekre gyakorolt hatás:
- TorchTitan (PyTorch stack) optimalizációk összegző hatása nagy: a DeepSeek‑V3 671B esetén a GB300 NVL72‑n ezek az optimalizációk körülbelül 6×‑os leadott teljesítménynövekedést eredményeztek ugyanazon infrastruktúrán.
- JAX esetén az NVIDIA által hozzáadott optimalizációk fél év alatt közel 10×‑es javulást hoztak 256 GPU skálán a DeepSeek‑V3 671B‑n; a legfrissebb szoftververzió 1 025 TFLOPs/GPU leadott átviteli sebességet ért el JAX‑on.
A skálázás eredményei: Megatron Core 256‑ról 1 024 GPU‑ra növelve megőrzi a per‑GPU teljesítmény 98,5%-át; TorchTitan és JAX mindketten körülbelül 97%-ot tartanak meg. Ez azt jelenti, hogy a hozzáadott infrastruktúra döntő része ténylegesen új rendszer‑szintű token/másodperc átvitelt jelent, az 800 Gb/s per‑GPU hálózat mellett a gradientforgalom rejtve marad a számítás mögött.
Rekord és távlatok
NVIDIA szerint a GB300 NVL72‑n elért 1 648 TFLOPs/GPU rekord lehetővé teszi ugyanannak az előtréning‑feladatnak a korábbi generációhoz képest jóval kevesebb hardverrel történő végrehajtását. A vállalat hangsúlyozza, hogy ezek az eredmények nem a plafont jelentik, hanem egy alapot a további hardver‑ és szoftverfejlesztésekhez.
Elismerések
A cég megemlítette, hogy a rekord eléréséhez sok NVIDIA‑mérnök hozzájárult; a névlistában többek között Aidyn Aitzhan, Michael Andersch, Jan Bernloehr és mások szerepelnek.
(A közlemény számszerű eredményeire és a megadott architekturális részletekre támaszkodtunk; dátumok vagy további külső vizsgálati adatok a forráscikkben nem szerepeltek.)



