Modellbevezetés

Mesterséges intelligenciával generált szöveg

NVIDIA bemutatja a Nemotron 3.5 Lightningot: kis, gyors MoE modell hosszú futamidejű ügynökökhöz

A főszereplő a NVIDIA és annak nyílt Nemotron modellcsaládja, amelynek legkisebb tagja a Nemotron 3.5 Lightning.

NVIDIA bemutatja a Nemotron 3.5 Lightningot: kis, gyors MoE modell hosszú futamidejű ügynökökhöz

NVIDIA bemutatta a Nemotron 3.5 Lightning modellt, egy nyílt 30 milliárd paraméteres mixture‑of‑experts (MoE) családba tartozó modellt, amelynél telepítéskor tipikusan 3 milliárd aktív paraméter fut. A Lightninget kifejezetten azokhoz az „mindig bekapcsolt” ügynökökhöz tervezték, amelyeknél a legtöbb számításesemény eszközhívásból, eredményellenőrzésből és al‑ügynökök delegálásából áll, és ahol a magas hívásszám mellett alacsony késleltetés kritikus.

Miért ez a modell az ügynökök végrehajtási rétegéhez?

A Nemotron 3.5 Lightning MoE architektúrája lehetővé teszi, hogy a router minden token esetén csak a sok „szakértő” közül néhányhoz irányítsa a számítást, így egy token feldolgozásához csak a modell paramétereinek egy töredéke aktiválódik. Ez a megközelítés a nagyobb sűrű modellek kapacitását kínálja kisebb számítási költség mellett — ezért alkalmas a magas volumenű, alacsony késleltetésű végrehajtási feladatokra. A modell a Nemotron 3 család legkisebb tagja, de több, a családnál korábban bevált technikát örököl.

Fő technikai jellemzők

  • Modellméret: 30B MoE (30 milliárd paraméter), futtatott/aktív paraméterek tipikusan 3B.
  • Spekulatív dekódolás: a többtokenes előrejelzést (multi‑token prediction, MTP) már a Nemotron 3.5 Lightning tréningje során beépítették; a modellhez MTP‑t erősítő utófázis is tartozott. Két draft‑modellt is mellékelnek: DSpark (ajánlott DGX Spark és alacsony párhuzamosságú adatközponti terhelésekhez) és DFlash.
  • Kvantálás: a kiadás NVFP4 és BF16 checkpointokat tartalmaz, az NVFP4 kernel támogatással a Blackwell, Hopper és Ampere GPU‑kon.
  • Kifejezetten ügynökházakhoz optimalizált tréning: a Lightninget olyan népszerű agent harness‑ekhez képezték, mint az OpenClaw és a Hermes Agent, amelyeket a NemoClaw biztonsági és menedzsment csomag támogat.

Teljesítmény és hatékonyság

NVIDIA szerint a Nemotron 3.5 Lightning az osztályában előnyös pontot foglal el az accuracy‑vs‑speed Pareto‑fronton az Artificial Analysis Intelligence Indexen, kombinálva többféle értékelést (ügynöki feladatok, kódolás, tudományos következtetés, általános intelligencia). A cég kiemeli, hogy a Lightning akár 4×‑es kimeneti sebességet érhet el hasonló méretű modellekkel összehasonlítva. Konkrét összehasonlításként a PinchBench méréseiben a Lightning 86% pontosságnál 10 000 feladat elvégzésekor mintegy 30%-kal gyorsabb volt, mint a Qwen3.6 35B hasonló pontosság mellett. Ezek az adatok a magasabb inference throughput‑nak és token‑hatékonyságnak tulajdoníthatók, ami az mindig‑futó ügynökök számára fontos: a tokenek hasznos munkává konvertálódnak gyorsabban.

Hogyan tartja meg a sebességet pontosságvesztés nélkül?

A Lightning kombinálja a következőket:

  • Spekulatív dekódolás és MTP beépítése a pretraining során, plusz MTP‑t erősítő utófázis.
  • Két draft‑modell (DSpark és DFlash) a különböző inferencia‑típusokhoz és párhuzamossági szintekhez.
  • NVFP4 kvantálás, amely ugyanazokat a specializált kernel‑útvonalakat használja, mint a nagyobb Nemotron 3 Ultra modell.

Testreszabhatóság és finomhangolás

A Nemotron 3.5 Lightning kifejezetten könnyen testreszabható: a kisebb modellek olcsóbban és gyorsabban finomhangolhatók, és kevesebb erőforrást igényelnek. A kiadás részeként a súlyok, a tréningadatok és a receptek permisszív licenc alatt (OpenMDW‑1.1) érhetők el, és a következő eszközök használhatók a testreszabáshoz:

  • LoRA vagy teljes SFT finomhangolás a NeMo Automodel és NeMo Megatron Bridge segítségével.
  • Reinforcement learning és környezet‑alapú értékelés a NeMo RL és NeMo Gym eszközökkel. A kiadás része a Nemotron‑RL Agentic Terminal Pivot nyílt RL adatcsomag is, amelyet bizonyos kódolási képességek képzéséhez használtak.

Model routing: NeMo Switchyard

A Nemotron 3.5 Lightning célja, hogy a frontvonalon végzett, rutin jellegű feladatokat kezelje—például git pull hívások, eszközök eredményeinek validálása és kimenetek formázása—így a drágább „frontier” modellek a komplex irányítást és tervezést végezhetik. A modellek közötti feladatirányítást (routing) és orkestrációt az NVIDIA NeMo Switchyard könyvtár kezeli: a Switchyard segítségével a Lightning egy célpontként szerepelhet a routingban, és a lekérések a leghatékonyabb modellhez juthatnak el (planok felfelé, execute‑ok lefelé).

Helyi és felhőbeli futtatás, partner ökoszisztéma

A Lightning célja, hogy elérhető legyen helyi rendszereken is: például NVIDIA Jetson, GeForce RTX 5090 és DGX Spark konfigurációkon. A modell támogatott több ipari eszközkészlettel (LM Studio, llama.cpp, Ollama, Unsloth) és bevezetési útmutatókkal (vLLM, SGLang, TensorRT‑LLM). Nagyobb partner‑ és ökoszisztéma támogatás is fennáll mind a tréning, mind az inferencia és a harness szintjén; a listában szerepelnek például Ollama, Exo, LM Studio, OpenClaw, Hermes Agent, Google Cloud Gemini Enterprise Agent Platform, Microsoft Foundry, valamint számos GSI és felhő szolgáltató és inferencia‑hostolt szolgáltató.

Hol érhető el és hogyan kezdjen hozzá?

A Nemotron 3.5 Lightning teljesen nyílt: a súlyokat és a kapcsolódó anyagokat a Hugging Face‑en és a ModelScope‑on lehet letölteni, továbbá kipróbálható a build.nvidia.com‑on vagy OpenRouteren keresztül. A fejlesztők dokumentációt, cookbookot, Switchyard routing leírásokat és bevezetési útmutatókat találnak az NVIDIA erőforrásai között.

Összefoglalás

A Nemotron 3.5 Lightning-et azzal a céllal tervezték, hogy a hosszú ideig futó, mindig elérhető AI‑ügynökök leggyakoribb, nagy volumenű végrehajtási feladatait gyorsan és hatékonyan végezze. A MoE architektúra, a spekulatív dekódolás, az NVFP4 kvantálás és a NeMo Switchyard‑al való integráció együttesen azt a megközelítést tükrözi, amelyben a rendszermodellek — nagy, „frontier” reasoner‑ok és kisebb végrehajtó modellek — együtt dolgoznak az erőforrások optimális elosztásáért.