Eszközök

Mesterséges intelligenciával generált szöveg

NVIDIA NIM 2.0.12: Nemotron 3 Ultra-val akár 2,5× több egyidejű felhasználó a 4×B200 rendszeren

A főszereplő az NVIDIA NIM (NVIDIA Inference Microservice) és a Nemotron 3 Ultra nagy nyelvi modell.

NVIDIA NIM 2.0.12: Nemotron 3 Ultra-val akár 2,5× több egyidejű felhasználó a 4×B200 rendszeren

NVIDIA NIM 2.0.12 egy előre validált, modell- és GPU‑tudatos kiszolgálócsomagot kínál, amely célja a produkciós üzemre optimalizált inferencia‑kiszolgálás megkönnyítése. Egy bemutatott esetben, Nemotron 3 Ultra modellre 4×B200 hardveren a NIM‑es konfiguráció közel 2,5× nagyobb kimeneti token‑átvitelt ér el a NIM nélküli alapértelmezett verzi óhoz képest, ami több egyidejű felhasználót tesz lehetővé azonos interaktivitás mellett.

Mit csinál a NIM (NVIDIA Inference Microservice)?

A NIM célja, hogy a modellek üzemeltetésekor felmerülő teljesítmény‑ és üzemeltetési döntéseket kész, tesztelt konfigurációkká és konténerizált szolgáltatássá csomagolja. Az NVIDIA mérnökei támogatott modell–GPU–precizitás kombinációkhoz validált futásidejű beállításokat adnak, és a csomagot szabványos API-k mögé szervezik. A NIM Certified további vállalati funkciókat ad: rendszeres inferencia‑stack frissítéseket, CVE‑kezelést, szélesebb körű hardvervalidációt és kereskedelmi támogatást az NVIDIA AI Enterprise szolgáltatáson keresztül.

Esettanulmány: Nemotron 3 Ultra a 4×B200 rendszeren

A cikkben bemutatott benchmark definíciója:

  • Hardver: 4×B200
  • Agentic munkaterhelés: 64K/400/76% KV reuse/50 TPS/user (20 ms ITL)

A publikált Pareto‑ábra a NIM kikapcsolt (NIM Off) nyílt forráskódú alapverziót hasonlítja össze a teljesen optimalizált NIM 2.0.12‑es szolgáltatócsomaggal (NIM On). A mérési pontoknál 50 TPS/user cél mellett a NIM On konfiguráció több mint 2,5× nagyobb rendszer‑throughputot produkál a baseline‑hoz képest, ami közvetlenül több egyidejű felhasználót jelent ugyanazon interaktivitás megtartása mellett.

Konkrét számok a cikk alapján (4×B200, 50 TPS/user cél):

  • NIM Off (alapértelmezett): 718 tok/s
  • NIM On (2.0.12, optimalizált): 1,997 tok/s (~2.5× a baseline‑hoz képest)

Az optimalizált stack tartalmazza: cache/state reuse, MTP spekulatív dekódolás és javításai, autotuned kernel‑ek, partial‑prefix matching, ütemező, batching, memória‑ és párhuzamosság‑hangolás.

Miből állnak az optimalizációk?

A mért javulás nem egyetlen kapcsoló hatása, hanem több, kölcsönhatásban lévő konfigurációs réteg együttese:

  • Precizitás és autotuned, modell‑ismerő kernel‑ek: a mixture‑of‑experts és Mamba kernel‑ek hatékonyabban térképezik a hibrid architektúrát a NVIDIA Blackwell GPU‑kra.
  • Párhuzamos végrehajtás: tensor‑párhuzamosság négy GPU között, illetve szakértő‑tudatos végrehajtás a mixture‑of‑experts rétegeknél a jobb kihasználtságért.
  • Prefix és modell‑állapot újrahasznosítás: prefix cache megakadályozza a megismételt kontextus újraszámolását; partial‑prefix matching részleges egyezés esetén is visszanyerhet újrafelhasználást; Mamba állapot‑cache beállítások a modell architektúrájához hangolva.
  • Ütemező, batching és memória hangolás: concorrens szekvencia‑limitek, batched‑token limitek, blokk‑méret és GPU‑memória kiosztás azért, hogy több munka legyen egyszerre folyamatban anélkül, hogy átlépnék a latency célértéket.
  • MTP spekulatív dekódolás: a NIM 2.0.12 tartalmazza az MTP‑t és kapcsolódó javításait; az inkrementális haszon az elfogadási rátától és a rendelkezésre álló memória‑tartaléktól függ.

Hogyan mérje le a NIM‑et a saját munkaterhelésén?

A cikk hangsúlyozza, hogy a publikált görbék kiindulópontot adnak, de nem garantálják, hogy minden alkalmazás ugyanazt az eredményt éri el. A leggyorsabb mód a megfelelőség ellenőrzésére: visszajátszani reprezentatív forgalmat és Pareto‑görbét építeni a felhasználói latency‑metrika alapján. Ajánlott lépések (röviden):

  • Rögzítse és használja a pontos szoftververziókat (NIM 2.0.12 vagy újabb), pinelje az image taget vagy digestet.
  • Készítsen reprezentatív forgalmi trace‑et Mooncake JSONL formátumban vagy rögzítsen szabályozott NIM kéréseket, ügyelve az érzékeny adatok tisztítására.
  • Használja az NVIDIA AIPerf‑et a forgalom visszajátszásához és teljesítményméréshez.
  • Válassza ki a Pareto pontot, amely teljesíti az SLO/latency feltételeket.

A cikk egy példaszkriptet is mutat egy AIPerf koncurrency sweep‑hez, amelyet a saját trace‑eivel és végpont‑paramétereivel kell testreszabni.

Telepítési útmutató összefoglaló

A Nemotron 3 Ultra NIM 2.0.12 letöltéséhez az NGC felületéről le kell fogadni a megfelelő taget vagy digestet, kiválasztani egy profil‑beállítást, majd konténerként futtatni a csomagot. A dokumentáció példákat ad a környezeti változókra és a docker run parancsra; egy tipikus profil agentic munkaterhelésre 4×B200 rendszeren:

  • NIM_MODEL_PROFILE: vllm-nvidia-b200-nvfp4-tp4-pp1-throughput-90.0
  • NIM_SPECDEC_ENABLE=1 a spekulatív dekódolás engedélyezéséhez

Miért számít ez a gyakorlatban?

A NIM 2.0.12 példája megmutatja, hogy a teljesítmény‑mérnökség és az üzemeltetési validáció csomagolva mennyire növelheti a hatékonyságot és a felhasználószámot egy adott GPU‑készleten. Az NVIDIA azt is ígéri, hogy további, különböző modellekhez optimalizált NIM konfigurációk érkeznek, további validált kiindulópontokat adva a fejlesztőknek a saját latency, throughput és költség céljaik eléréséhez.

Következő lépések

Töltse le a Nemotron 3 Ultra NIM 2.0.12‑t az NGC‑ről, futtassa a környezetében, és replayelje a reprezentatív forgalmat NVIDIA AIPerf‑pel, hogy kiválassza a saját alkalmazására legmegfelelőbb Pareto pontot.