Eszközök

Mesterséges intelligenciával generált szöveg

Hogyan futtathatók és gyorsíthatók a gondolkodó modellek NVIDIA Jetson eszközökön

A cikk főszereplője az NVIDIA Jetson platform és a fejlesztők, akik mostantól helyben, hálózati függőség nélkül futtathatnak többlépéses gondolkodást végző modelleket.

Hogyan futtathatók és gyorsíthatók a gondolkodó modellek NVIDIA Jetson eszközökön

A 2026-ban megjelent, kompakt nyílt modellek többlépéses következtetési és agent-szerű képességeket hoztak az élre, amelyeket korábban nagy adatközponti rendszerekre korlátoztak. Ezek a modellek ma már futtathatók NVIDIA Jetson eszközökön, ami lehetővé teszi alacsony késleltetésű, hálózattól független megoldásokat — például járműfülkéi asszisztenseket, valós idejű anomália-észlelést vagy távoli környezetben dolgozó robotokat.

Mi változott és miért számít

A 2026-ban kiadott modellek architektúra- és tanítási fejlesztései (például distillation) miatt a korábbi frontier modellek intelligenciaszintjéhez hasonló képességek kevesebb paraméterrel érhetők el. Az Artificial Analysis Intelligence Index szerint a 2026-os, élre alkalmas modellek intelligenciaszintje hasonló a 2025-ös vezető modellekéhez, miközben jóval kevesebb paramétert használnak. Ennek következményei: kevesebb hálózati függőség, alacsonyabb költség és az érzékeny adatok helyben tarthatósága.

Melyik modellt válasszuk Jetsonra?

A modellarchitektúra és a tanítási módszerek más-más kompromisszumokat adnak kapacitás, memóriafelhasználás és válaszgenerálási sebesség között. Két példa:

  • Qwen3.8-27B: sűrű (dense) modell, minden tokennél az összes 27 milliárd paraméter aktiválódik — ez jellemzően jobb minőségű, de lassabb generálást eredményez tokenenként.
  • Nemotron 3.5 Lightning: mixture-of-experts (MoE) architektúra, összesen 30 milliárd paraméter, de tokenenként csak ~3 milliárd aktiválódik — ez gyorsabb token-generálást tesz lehetővé olyan munkafolyamatoknál, ahol sok rövidebb döntésre van szükség.

A választásnál vegye figyelembe az alkalmazás eszközeit és döntési mintáit: hosszú ideig futó agent-loops-oknál, amelyek folyamatos szenzoradatokat és naplókat dolgoznak fel, a gyors token-generálás (Nemotron 3.5 Lightning) csökkentheti a teljes ciklusidőt, míg a ritkább, de mélyebb döntéseket igénylő feladatoknál (például komplex tervezés) a Qwen3.8-27B lehet előnyösebb.

Hardverajánlás a Jetson családon belül:

  • Jetson Orin Nano: jó kiindulópontként Gemma 4 E4B.
  • Jetson AGX Orin és Jetson AGX Thor: erős opciók a Nemotron 3.5 Lightning és a Qwen3.8-27B számára, mivel ezekhez kvantált checkpointok és optimalizált futtatók állnak rendelkezésre.

Modelleket helyben lehet üzemeltetni ismert keretrendszerekkel, például vLLM vagy llama.cpp, így a következtetési ciklus nem függ végig az adatközponttól.

Hogyan gyorsítható a következtetés Jetsonon?

Két kiegészítő technika nyújt jelentős teljesítményjavulást:

  1. NVFP4 kvantizáció: csökkenti a modellek műveleteinek és memóriahasználatának költségét alacsonyabb számábrázolási pontossággal, miközben a minőség közel marad a BF16-hez.
  2. Speculative decoding (spekulatív dekódolás): egy kisebb „draft” modell több javasolt tokent hoz létre egy lépésben, amelyeket a fő modell egyszerre ellenőriz; ha több token elfogadott, a generálás több tokennel lép előre egy verifikációs lépésben.

E két optimalizáció együtt adja a legnagyobb hasznot: NVFP4 csökkenti az egy-egy modellezési átmenet költségét, míg a spekulatív dekódolás növeli az egy ellenőrzés során elfogadott tokenek számát. A tesztekben ezek kombinációja akár 6.28x dekódolási átbocsátás-növekedést hozott BF16-hez képest Jetsonon.

A legjobban működő spekulatív módszer modellfüggő: Nemotron 3.5 Lightningnél a DSpark, míg Qwen3.8-27B-nél a DFlash2 adta a legjobb eredményt a tesztelt konfigurációkban. Több draft-módszer létezik: MTP, DFlash és DSpark; mind futtatható Jetsonon, de eltérően generálnak és értékelnek javaslatokat.

Konkrét teljesítményszámok a vizsgált munkaterheletekkel

A SpeedBench négy kategóriát vizsgált: írás (writing), következtetés (reasoning), összegzés (summarization) és retrieval-augmented generation (RAG). A leggyorsabb konfigurációk mellett a kimeneti token/sekundum értékek a következők voltak:

  • Nemotron 3.5 Lightning + DSpark (NVFP4): 123.01–138.02 output token/s (munkaterhelttől függően).
  • Qwen3.8-27B + DFlash2 (NVFP4): 27.69–34.44 output token/s.

A spekulatív gyorsulás mértéke munkafüggő volt; RAG és írás kategóriákon tapasztalták a legnagyobb előnyt mindkét modellnél.

Előfeltételek és futtatási példa vLLM-mel

Szükséges feltételek:

  • Jetson AGX Thor vagy Jetson AGX Orin (illetve Orin Nano Gemma 4 E4B-hez).
  • JetPack 7.2, NVIDIA Container Runtime és Docker konfigurálva.
  • Elég tárhely a modellek és draft-checkpointok számára.
  • Elfogadott licencfeltételek az NVIDIA Nemotron és Qwen3.8 checkpointokra.

Példa: indítsa el a vllm/vllm-openai:v0.28.0 konténert:

docker run --pull=always --runtime nvidia --rm -it \
--network host \
--ipc=host \
-v ~/.cache/huggingface:/root/.cache/huggingface \
--entrypoint bash \
vllm/vllm-openai:v0.28.0

Nemotron 3.5 Lightning (NVFP4 + DSpark) vLLM parancs a konténerben:

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
  --reasoning-parser nemotron_v3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --max-model-len 128000 \
  --kv-cache-dtype fp8 \
  --gpu-memory-utilization 0.7 \
  --trust-remote-code \
  --max-num-batched-tokens 16384 \
  --enable-prefix-caching \
  --speculative-config '{"method":"dspark","model":"nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark","num_speculative_tokens":5}' \
  --mamba-backend flashinfer \
  --mamba-ssm-cache-dtype float16 \
  --enable-mamba-cache-stochastic-rounding \
  --mamba-cache-philox-rounds 5 \
  --mamba-cache-mode align

Qwen3.8-27B (NVFP4 + DFlash2) vLLM parancs:

VLLM_GDN_DECODE_KERNEL=triton vllm serve Inferact/Qwen3.8-27B-NVFP4 \
  --served-model-name qwen38 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --max-model-len 50000 \
  --max-num-seqs 8 \
  --gpu-memory-utilization 0.85 \
  --trust-remote-code \
  --speculative-config '{"method":"dflash","model":"incoai/Qwen3.8-27B-DFlash2","num_speculative_tokens":7}'

Mindkét példa Jetson AGX Thor vagy Jetson AGX Orin eszközökre céloz.

Mikor érdemes saját checkpointot tanítani?

Többnyire érdemes kezdeni a meglévő kvantált checkpointokkal és draft-modellekkel: ezek gyakran elegendő pontosságot és gyorsulást adnak anélkül, hogy tréningre lenne szükség. Teszteljen saját alkalmazás-specifikus promptokkal, mert a publikusan elérhető benchmarkok nem feltétlenül mutatják meg, hogy a checkpoint megtartja-e az Ön számára fontos viselkedést.

Ha a kvantizáció pontosságvesztést okoz, használja az NVIDIA Model Optimizer-t kvantizáció-érzékeny tanításhoz (QAT) vagy kvantizációs distillationhöz (QAD). Hasonlóan, ha a spekulatív draftok elfogadási rátája alacsony, érdemes a vLLM Speculators tréning útmutatóját követve egy speciális speculatort tanítani a reprezentatív adatokon.

A gyakorlatban a legtöbb alkalmazásnál nem szükséges saját tréning; először mérje fel a meglévő checkpointok teljesítményét és pontosságát, és csak akkor kezdjen tréningbe, ha egyértelmű hiányt tapasztal.

Ellenőrzés és validáció

Validálja a kiválasztott spekulatív konfigurációt és kvantált checkpointot reprezentatív munkaterhelésekkel. Mérje mind a dekódolási átbocsátást (output token/s), mind az elfogadási arányt a draft-tokenokra, hogy reális képet kapjon a várható gyorsulásról és a pontosságról.

Összegzés és további források

A Jetson támogatja a 2026-os, élre alkalmas nyílt modelleket optimalizált runtime-okkal, kvantált checkpointokkal és spekulatív dekódolással. Ezzel a kiindulással át lehet térni a modellek teszteléséről az éles, helyben futó edge-alkalmazások fejlesztésére és üzemeltetésére.

További részletes útmutatók és receptek elérhetők a Jetson AI Lab Models oldalon, illetve a Jetson-hoz kapcsolódó tutorialokban a vLLM, az LLM/VLM futtatás és a spekulatív dekódolás témakörében.