Az MLPerf Inference v6.1 Edge Agentic benchmarkon NVIDIA TensorRT Edge-LLM futtatott Qwen3.6-27B modellt egyetlen NVIDIA Jetson AGX Thor Developer Kiten, és jelentős gyorsulást ért el a referencia futáshoz képest. A rendszer az agentikus (többlépéses, eszközhívásokat is végrehajtó) munkaterheletet 52,33 token/másodperces kimeneti átbocsátással teljesítette, és a 1 007 teljesített fordulatot 24 perc 36 másodperc alatt dolgozta fel — ez 6,4-szer gyorsabb, mint a Jetson-on futtatott llama.cpp referencia, amely 2 óra 37 percet igényelt.
Mit mér az MLPerf Edge Agentic?
Az MLPerf Edge Agentic azt vizsgálja, hogyan teljesít egy OpenAI-kompatibilis modellvégpont valós agentikus munkameneteken. A benchmark két fázisból áll:
- Teljesítményfázis: rögzített szoftvermérnöki agent-pályákat játsszanak vissza. A modell felhasználói kérést kap, eszközhívást generál, megfigyeli az eszközeredményt, majd folytatja a beszélgetést. A teljesítmény-munkaterhelés 20 beszélgetést és összesen 1 007 generált fordulatot tartalmaz; a bemenet hossza fordulatonként növekszik és kb. 23,5 ezer tokenig terjed, így a hosszú kontextus hatékony kezelése kulcsfontosságú. A mérés része az IoU-alapú inline pontosság ellenőrzése is.
- Pontosságfázis: a Berkeley Function Calling Leaderboard (BFCL) v4 egyszeri fordulós promptjait használja, kikapcsolt érveléssel, hogy rövidebb idő alatt mérhető legyen az edge eszközökön. Itt azt vizsgálják, hogy a modell helyes függvényt választ-e, érvényes argumentumokat generál-e, és nem hív-e eszközt feleslegesen.
A Jetson AGX Thorra leadott eredmény részletei
A TensorRT Edge-LLM beküldés SingleStream módban futtatta a Qwen3.6-27B modellt egy Jetson AGX Thor Developer Kit-en, 128 GB-os unified memóriával és MAXN energiaüzemmódban. A mérési adatok a következők:
- Kimeneti átbocsátás: 52,33 token/másodperc
- Medián első tokenig eltelt idő: 247,12 ms
- Medián idő tokenenként: 14,68 ms
- BFCL összpontosság: 87,94%
A MLCommons Edge Agentic példája emellett közöl egy llama.cpp referenciarun-t ugyanazon a hardveren, amely Q4_K_M kvantizációt használva 2 óra 37 perc alatt fejezte be a munkaterhelést. A TensorRT Edge-LLM beküldés 24 perc 36 másodperc alatt végzett, azaz 6,4× gyorsabb teljesítményt mutat.
Milyen optimalizációk tették lehetővé a gyorsulást?
A beküldés több technikát kombinált az inferencia felgyorsítására, miközben megtartotta az MLPerf által megkövetelt pontosságot:
-
NVFP4 kvantizáció: a Qwen3.6-27B modell súlyaihoz és aktivációihoz NVFP4 (4-bites lebegőpontos formátum) használatos, a nyelvi fej (language-model head) beleértve; a KV-cache FP8 formátumú. Az NVFP4 a Jetson AGX Thor Blackwell GPU-jának támogatott formátuma. A kisebb modellek kisebb memóriaigényük miatt csökkentett DRAM-sávszélesség-terhelést és gyorsabb dekódolást eredményeznek.
-
KV-cache és rekurzív állapot újrahasznosítása: az agent-pályák során a beszélgetés legtöbb előző tokenje minden új kérésnél része az inputnak. A TensorRT Edge-LLM felismeri az újrahasználható prompt-prefixeket és visszaállítja a cache-elt attention KV oldalakat, valamint a Qwen3.6 hibrid architektúrájához szükséges rekurzív állapotot és részleges KV-oldal állapotot. Így csak a beszélgetés új suffixét kell előtölteni. A méréseken a prompt tokenek mintegy 96%-át forró cache szolgálta ki; összesen kb. 13,6M prompt-tokenből csak ~0,5M-ot kellett újratölteni a fordulatok során.
-
Fa-alapú többtokenes előrejelzés (tree-based MTP): az autoregresszív dekódolás helyett a rendszer egy draft-modellt használ több token előrejelzésére, majd a célmodellt egyszerre ellenőrzi. A TensorRT Edge-LLM lineáris MTP mellett faalapú MTP-t is implementál: a magas valószínűségű folytatásjelölteket fává szervezi, a célmodell egy előre futtatással ellenőrzi őket, és a futás elfogadott ágát követve egyszerre halad előre több tokennel. Az MLPerf szerver konfigurációja 8 draft lépést, a top-2 jelöltet minden mélységnél és egy 16 node-os verifikációs fát használ. A faalapú MTP különösen hasznos függvényhívásoknál (tool calling), és a mért munkaterhelésen a lineáris 3-lépéses MTP-hez képest további kb. 40% dekódolási gyorsulást adhat.
Ezek az optimalizációk együtt csökkentik a hosszú kontextusú előtöltések költségét (KV-cache újrahasznosítás) és a generálás során szükséges modelllépések számát (MTP).
Telepítés és reprodukálás
A beküldés megvalósítása elérhető a TensorRT Edge-LLM release/0.9.1-mlpinf ágban. Az ág tartalmazza a modell export beállításait, TensorRT engine építési parancsokat, szerver- és MLPerf kliens konfigurációt. A rövid lépések a reprodukáláshoz:
- Klónozza a TensorRT Edge-LLM repót és inicializálja a submodule-okat.
- Töltse le a kalibrált NVFP4 checkpointot (centml/Qwen3.6-27B-NVFP4-W4A4-mlpinf).
- Az mlperf/README.md alapján exportálja a modellt tree-MTP interfésszel és építse meg az alap és draft TensorRT engine-eket.
- Indítsa el az OpenAI-kompatibilis TensorRT Edge-LLM szervert a mellékelt script segítségével.
- Klónozza az MLCommons endpoint harness-t, telepítse a BFCL függőségeket, állítsa be a model és tokenizer útvonalakat a mlperf/config.yaml-ben, és futtassa a benchmarkot.
A beküldött konfiguráció teljesítmény- és pontosságfázist futtat, temperature=0, seed=42, reasoning letiltva és egyetlen párhuzamossággal. Az "--accuracy-only" opcióval csak a BFCL pontosságfázis futtatható.
Köszönetnyilvánítás
A munka a TensorRT Edge-LLM, ModelOpt, Jetson és MLPerf csapatok hozzájárulásait tükrözi az NVIDIÁ-n belül, különösen Zihao Kong, Xiang Guo, Yoco Xiao, Qikai Li és Ashwin Nanjappa részvételével. Köszönet jár az MLCommons közösségnek az Edge Agentic benchmark és az endpoint harness kidolgozásáért.
Tables, forráslinkek és a teljes MLPerf Inference v6.1 eredmények megtekinthetők az MLCommons bejelentésében; továbbá NVIDIA közlemény ismerteti a szerver-szintű Vera Rubin eredményeket is.



