Ahogy a nagyméretű nyelvi modellek (LLM) inferenciája egyre gyakrabban dolgoz fel érzékeny adatokat és üzleti kontextust személyes, vállalati és szabályozott környezetekben, a feldolgozást megbízható, védelemmel ellátott futtatási környezetben kell elvégezni. Az NVIDIA Confidential Computing (CC) ezt teszi lehetővé memória‑titkosított confidential virtual machine (CVM) megoldásokkal, confidential GPU‑kkal és titkosított NVIDIA NVLink kapcsolatokkal, így támogatva a produkciós AI‑inferenciát megbízható hardveren.
Ez a cikk a TensorRT LLM és más inferencia‑keretrendszerek CC‑szemléletű adaptációját vizsgálja Blackwell‑alapú NVIDIA B200 GPU-kon, és bemutat egy kontrollált módszertant, amelyet platformmérnökök használhatnak saját munkaterhelésük CC‑miatti teljesítményveszteségének kvantifikálására.
Munkaterhelés kiválasztása a CC hatásainak láthatóvá tételéhez
A CC okozta overhead láthatósága nagyban függ a munkaterhelés jellemzőitől. Nagy érkezési ráta az állandó titkosítási költségeket elosztja több kérés között, így a közvetlen hatások nehezebben észlelhetők. A CC hatások kimutatásához célszerű olyan feladatot választani, amelynél hosszú a bemeneti kontextus, kiterjedt az output generálás, és alacsony a párhuzamosság. A hosszú kontextus terheli az előtöltés (prefill) adatmozgatást, a hosszú dekódolási idő felerősíti a tokenenkénti kis CC‑költségeket, az alacsony párhuzamosság pedig korlátozza a költségek elrejtését több egyidejű kérés között.
A teljesítménymérnökök a következő konfigurációt használták a bemutatott vizsgálathoz:
- Modell: nvidia/DeepSeek-R1-0528-NVFP4
- Inference framework: TensorRT LLM, PyTorch backend
- I/O szekvencia hossz: 32K input / 1K output
- Egyidejű kérések: 1, 2, 4, 8 és 16
- Párhuzamosság: TP=8, EP=1, PP=1
- KV cache: FP8
CC‑on vs CC‑off kontrollált összehasonlítás és mérőszámok
A CC‑hatás szigorú elkülönítéséhez ugyanazt a munkaterhelést két állapotban futtatták: Confidential Compute kikapcsolva (CC off) és bekapcsolva (CC on), miközben a modell, hardver, keretrendszer verzió, szekvenciahosszak, párhuzamosság és párhuzamos kérések nem változtak — így a CC állapota volt az egyetlen változó.
Használt mérőszámok:
- Output throughput retained: 100 × (CC on output tokens/s ÷ CC off output tokens/s)
- Latency overhead Time Per Output Token (TPOT): 100 × (CC on TPOT ÷ CC off TPOT − 1)
A vizsgálat hardver- és szoftverkonfigurációja (összefoglalva):
- Hardver: NVIDIA DGX B200 rendszer (8 NVIDIA B200 GPU)
- Platform: Intel TDX
- Host OS: Ubuntu 25.10, kernel 6.17.0-20-generic
- Guest OS: Ubuntu 24.04.4 LTS, kernel 6.8.0-124-generic
- Guest vCPUs: 256, Guest NUMA: 2 nodes
- NVIDIA driver: 595.71.05
- VBIOS: FW 1.4.x [97.10.64.00.0C]
- GPU teljesítménylimit: 1,000 W
- CUDA: 13.2
- TensorRT LLM: nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc22
- NCCL: v2.30
- OpenSSL: 3.6.0
- Orchestration: Docker Container + NVIDIA Container Toolkit
Teljesítmény eredmények
A mérések szerint a concurrency szinteken 1–16 között a CC bekapcsolt állapot 96.1%–98.2% közötti output‑token áteresztőképességet tartott meg a CC‑off bázishoz képest. A TPOT mutató átlagosan 1.2%–4.3% többlet késleltetést mutatott a CC‑on futtatásoknál a CC‑off referencia értékhez viszonyítva.
(Ezeket az eredményeket a cikkben szereplő ábrák szemléltetik: CC on vs CC off output‑token throughput és CC on TPOT relatív alakulása concurrency 1–16 értékeken.)
Mi okozza a CC overheadet és hogyan csökkenthető
A NVIDIA Blackwell confidential computing architektúrája hardver által érvényesített védett útvonalakat vezet be az in‑use adatok és munkaterhelések védelmére. Ezek a biztonsági utak megváltoztatják a futtatókörnyezet bizonyos alapfeltevéseit, például az memória‑mozgatás, időzítés, ütemezés és több‑GPU kommunikáció viselkedését. A TensorRT LLM és a hozzá hasonló keretrendszerek CC‑tudatos adaptációi a következő területeken csökkentik a teljesítményveszteséget:
- Host–device adatmozgatás
- Probléma: a B200 CC konfigurációban a host→device átvitel szoftveres, titkosított bounce bufferen keresztül zajlik, mert a GPU nem fér közvetlenül hozzá a védett CVM memóriához. Ennek következtében a pinned memória nem biztosítja a szokásos aszinkron átvitel előnyét, és egyes másolatok blokkolhatják a hívó szálat.
- Mitigációk: TensorRT LLM CC‑tudatos memóriaválasztást alkalmaz, az érintett utakra pageable memóriát használva a pinned helyett. Továbbá a GPU→host ismétlődő token és sampling adatok visszamásolását aszinkron munkamenetre delegálja, így a védett másolatok nem blokkolják a főütemezőt a dekódolás alatt (részletek: TensorRT LLM PR #11573).
- Kernel autotuner időzítése
- Probléma: az autotuner hagyományosan CUDA eseményeket használ a taktika‑összehasonlításhoz; a tesztelt CC konfigurációban a CUDA‑események időbélyegzéséből instabil időmérési jel keletkezett, ami lassabb taktika kiválasztásához vezethetett.
- Mitigáció: CC alatt a TensorRT LLM a GPU %globaltimer‑ét használja a taktika‑mérésekhez, miközben a CC‑n kívüli környezetben megtartja a CUDA eseményeket (részletek: TensorRT LLM PR #11657).
- Több‑GPU kommunikáció választása
- Probléma: NVLS (NVLink SHARP) multicast nem érhető el a B200 CC konfigurációkban. NVLS hiányában az NCCL_SYMMETRIC nem biztosítja a multicast előnyt, és előfordulhat, hogy a memóriaregisztráció és a rangok közötti szinkronizáció költségei megmaradnak, mielőtt alternatív, nem‑multicast kollektív útvonalra váltana.
- Mitigáció: a keretrendszereknek CC‑célzásnál fel kell ismerniük az NVLS elérhetőségét, és a üzenetméret, topológia és munkaterhelés alapján olyan kommunikációs algoritmust kell választaniuk, amely minimalizálja a késleltetést.
Ajánlások gyártóknak és üzemeltetőknek
Az eredmények azt mutatják, hogy a confidential computing bekapcsolása nem zárja ki a közel produkciós teljesítményt, feltéve, hogy a keretrendszer és a CC környezet együtt van optimalizálva. A gyakorlatban ez a következőket jelenti:
- Kezeld a biztonsági konfigurációt és a teljesítményoptimalizálást egyetlen, teljes stackre kiterjedő feladatként.
- Kapcsold be a Confidential Computinget, attestáld a környezetet, és futtass CC‑on és CC‑off összehasonlító benchmarkokat a ténylegesen kiszolgálni kívánt munkaterheléssel.
- Használd az NVIDIA Trusted Computing dokumentációját és kövesd a TensorRT LLM kiadási megjegyzéseit a legújabb CC‑támogatásokért.
Összegzés
A TensorRT LLM CC‑tudatos adaptációival (adatmozgatás, autotuning és több‑GPU kommunikáció terén) a confidential DeepSeek‑R1 inferencia több mint 96%‑ban megtartotta a CC‑off output‑token áteresztőképességet, miközben a tokenenkénti késleltetés növekedése 5% alatt maradt nyolc NVIDIA B200 GPU használata mellett. Ahogy a szervezetek privát inferenciát vezetnek be produkcióban, a biztonsági beállításokat és a teljesítményoptimalizálást össze kell hangolni teljes‑stack mérnöki feladatként.
Köszönetnyilvánítás
Külön köszönet Dan Hansennek, Sheel Pethe‑nek, Samuel Mendoza‑Jonasnak, Moein Ghaniyounnak, Vidhya Krishnan‑nak, Avinash Ahuja‑nak, Laikh Tewari‑nak, Laura Martinez‑nek és Matheen Raza‑nak a mérnöki hozzájárulásokért, technikai útmutatásért, elemzésért és a gondos lektorálásért.



