A 2026-ban megjelent, kompakt nyílt modellek többlépéses következtetési és agent-szerű képességeket hoztak az élre, amelyeket korábban nagy adatközponti rendszerekre korlátoztak. Ezek a modellek ma már futtathatók NVIDIA Jetson eszközökön, ami lehetővé teszi alacsony késleltetésű, hálózattól független megoldásokat — például járműfülkéi asszisztenseket, valós idejű anomália-észlelést vagy távoli környezetben dolgozó robotokat.
Mi változott és miért számít
A 2026-ban kiadott modellek architektúra- és tanítási fejlesztései (például distillation) miatt a korábbi frontier modellek intelligenciaszintjéhez hasonló képességek kevesebb paraméterrel érhetők el. Az Artificial Analysis Intelligence Index szerint a 2026-os, élre alkalmas modellek intelligenciaszintje hasonló a 2025-ös vezető modellekéhez, miközben jóval kevesebb paramétert használnak. Ennek következményei: kevesebb hálózati függőség, alacsonyabb költség és az érzékeny adatok helyben tarthatósága.
Melyik modellt válasszuk Jetsonra?
A modellarchitektúra és a tanítási módszerek más-más kompromisszumokat adnak kapacitás, memóriafelhasználás és válaszgenerálási sebesség között. Két példa:
- Qwen3.8-27B: sűrű (dense) modell, minden tokennél az összes 27 milliárd paraméter aktiválódik — ez jellemzően jobb minőségű, de lassabb generálást eredményez tokenenként.
- Nemotron 3.5 Lightning: mixture-of-experts (MoE) architektúra, összesen 30 milliárd paraméter, de tokenenként csak ~3 milliárd aktiválódik — ez gyorsabb token-generálást tesz lehetővé olyan munkafolyamatoknál, ahol sok rövidebb döntésre van szükség.
A választásnál vegye figyelembe az alkalmazás eszközeit és döntési mintáit: hosszú ideig futó agent-loops-oknál, amelyek folyamatos szenzoradatokat és naplókat dolgoznak fel, a gyors token-generálás (Nemotron 3.5 Lightning) csökkentheti a teljes ciklusidőt, míg a ritkább, de mélyebb döntéseket igénylő feladatoknál (például komplex tervezés) a Qwen3.8-27B lehet előnyösebb.
Hardverajánlás a Jetson családon belül:
- Jetson Orin Nano: jó kiindulópontként Gemma 4 E4B.
- Jetson AGX Orin és Jetson AGX Thor: erős opciók a Nemotron 3.5 Lightning és a Qwen3.8-27B számára, mivel ezekhez kvantált checkpointok és optimalizált futtatók állnak rendelkezésre.
Modelleket helyben lehet üzemeltetni ismert keretrendszerekkel, például vLLM vagy llama.cpp, így a következtetési ciklus nem függ végig az adatközponttól.
Hogyan gyorsítható a következtetés Jetsonon?
Két kiegészítő technika nyújt jelentős teljesítményjavulást:
- NVFP4 kvantizáció: csökkenti a modellek műveleteinek és memóriahasználatának költségét alacsonyabb számábrázolási pontossággal, miközben a minőség közel marad a BF16-hez.
- Speculative decoding (spekulatív dekódolás): egy kisebb „draft” modell több javasolt tokent hoz létre egy lépésben, amelyeket a fő modell egyszerre ellenőriz; ha több token elfogadott, a generálás több tokennel lép előre egy verifikációs lépésben.
E két optimalizáció együtt adja a legnagyobb hasznot: NVFP4 csökkenti az egy-egy modellezési átmenet költségét, míg a spekulatív dekódolás növeli az egy ellenőrzés során elfogadott tokenek számát. A tesztekben ezek kombinációja akár 6.28x dekódolási átbocsátás-növekedést hozott BF16-hez képest Jetsonon.
A legjobban működő spekulatív módszer modellfüggő: Nemotron 3.5 Lightningnél a DSpark, míg Qwen3.8-27B-nél a DFlash2 adta a legjobb eredményt a tesztelt konfigurációkban. Több draft-módszer létezik: MTP, DFlash és DSpark; mind futtatható Jetsonon, de eltérően generálnak és értékelnek javaslatokat.
Konkrét teljesítményszámok a vizsgált munkaterheletekkel
A SpeedBench négy kategóriát vizsgált: írás (writing), következtetés (reasoning), összegzés (summarization) és retrieval-augmented generation (RAG). A leggyorsabb konfigurációk mellett a kimeneti token/sekundum értékek a következők voltak:
- Nemotron 3.5 Lightning + DSpark (NVFP4): 123.01–138.02 output token/s (munkaterhelttől függően).
- Qwen3.8-27B + DFlash2 (NVFP4): 27.69–34.44 output token/s.
A spekulatív gyorsulás mértéke munkafüggő volt; RAG és írás kategóriákon tapasztalták a legnagyobb előnyt mindkét modellnél.
Előfeltételek és futtatási példa vLLM-mel
Szükséges feltételek:
- Jetson AGX Thor vagy Jetson AGX Orin (illetve Orin Nano Gemma 4 E4B-hez).
- JetPack 7.2, NVIDIA Container Runtime és Docker konfigurálva.
- Elég tárhely a modellek és draft-checkpointok számára.
- Elfogadott licencfeltételek az NVIDIA Nemotron és Qwen3.8 checkpointokra.
Példa: indítsa el a vllm/vllm-openai:v0.28.0 konténert:
docker run --pull=always --runtime nvidia --rm -it \
--network host \
--ipc=host \
-v ~/.cache/huggingface:/root/.cache/huggingface \
--entrypoint bash \
vllm/vllm-openai:v0.28.0
Nemotron 3.5 Lightning (NVFP4 + DSpark) vLLM parancs a konténerben:
vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \
--reasoning-parser nemotron_v3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--max-model-len 128000 \
--kv-cache-dtype fp8 \
--gpu-memory-utilization 0.7 \
--trust-remote-code \
--max-num-batched-tokens 16384 \
--enable-prefix-caching \
--speculative-config '{"method":"dspark","model":"nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark","num_speculative_tokens":5}' \
--mamba-backend flashinfer \
--mamba-ssm-cache-dtype float16 \
--enable-mamba-cache-stochastic-rounding \
--mamba-cache-philox-rounds 5 \
--mamba-cache-mode align
Qwen3.8-27B (NVFP4 + DFlash2) vLLM parancs:
VLLM_GDN_DECODE_KERNEL=triton vllm serve Inferact/Qwen3.8-27B-NVFP4 \
--served-model-name qwen38 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--max-model-len 50000 \
--max-num-seqs 8 \
--gpu-memory-utilization 0.85 \
--trust-remote-code \
--speculative-config '{"method":"dflash","model":"incoai/Qwen3.8-27B-DFlash2","num_speculative_tokens":7}'
Mindkét példa Jetson AGX Thor vagy Jetson AGX Orin eszközökre céloz.
Mikor érdemes saját checkpointot tanítani?
Többnyire érdemes kezdeni a meglévő kvantált checkpointokkal és draft-modellekkel: ezek gyakran elegendő pontosságot és gyorsulást adnak anélkül, hogy tréningre lenne szükség. Teszteljen saját alkalmazás-specifikus promptokkal, mert a publikusan elérhető benchmarkok nem feltétlenül mutatják meg, hogy a checkpoint megtartja-e az Ön számára fontos viselkedést.
Ha a kvantizáció pontosságvesztést okoz, használja az NVIDIA Model Optimizer-t kvantizáció-érzékeny tanításhoz (QAT) vagy kvantizációs distillationhöz (QAD). Hasonlóan, ha a spekulatív draftok elfogadási rátája alacsony, érdemes a vLLM Speculators tréning útmutatóját követve egy speciális speculatort tanítani a reprezentatív adatokon.
A gyakorlatban a legtöbb alkalmazásnál nem szükséges saját tréning; először mérje fel a meglévő checkpointok teljesítményét és pontosságát, és csak akkor kezdjen tréningbe, ha egyértelmű hiányt tapasztal.
Ellenőrzés és validáció
Validálja a kiválasztott spekulatív konfigurációt és kvantált checkpointot reprezentatív munkaterhelésekkel. Mérje mind a dekódolási átbocsátást (output token/s), mind az elfogadási arányt a draft-tokenokra, hogy reális képet kapjon a várható gyorsulásról és a pontosságról.
Összegzés és további források
A Jetson támogatja a 2026-os, élre alkalmas nyílt modelleket optimalizált runtime-okkal, kvantált checkpointokkal és spekulatív dekódolással. Ezzel a kiindulással át lehet térni a modellek teszteléséről az éles, helyben futó edge-alkalmazások fejlesztésére és üzemeltetésére.
További részletes útmutatók és receptek elérhetők a Jetson AI Lab Models oldalon, illetve a Jetson-hoz kapcsolódó tutorialokban a vLLM, az LLM/VLM futtatás és a spekulatív dekódolás témakörében.



