Nvidia új, nyílt forráskódú megoldást jelentett be, amely egyszerre célozza meg az ügynökalapú (agentic) rendszerek költség- és teljesítményproblémáit: a Nemotron 3.5 Lightning nevű, 30 milliárd paraméteres mixture-of-experts modellt és a NeMo Switchyard nevű nyílt forráskódú routing-könyvtárat. A cég szerint a kombináció lehetővé teszi, hogy egyes lépéseket olcsóbb, de hatékonyabb modellekre irányítsanak, miközben megőrzik a frontier-szintű feladatmegoldó képességet.
Mire jó a Switchyard és miért fontos a routing?
A problémát, amire Nvidia reagál, sok vállalat ismeri: mindig bekapcsolt ügynökök futtatásakor a döntés gyakran az, hogy minden hívást egy legmodernebb (frontier) modellre küldjenek — ez nagyon megdrágítja az üzemeltetést. A másik véglet, ha vállalatok saját routing logikát építenek, akkor az maga is jelentős mérnöki munkát és folyamatos karbantartást igényel.
A NeMo Switchyard célja, hogy per-lépés (per-step) döntéseket hozva az ügynök állapotát, a feladat összetettségét és a várható token-kibocsátást figyelembe véve válassza ki az adott lépéshez legmegfelelőbb modellt. Nvidia szerint ez nem pusztán egy statikus preferencia vagy egy „okosabb router” — a megközelítés lényege, hogy egyaránt nyílt forrású modellt és nyílt forráskódú routingot kínáljanak, amelyet a cég partnerei és az ökoszisztéma könnyen integrálhatnak.
Kari Briski, az Nvidia generatív AI-ért felelős alelnöke a bemutatón kiemelte: „ez a modellrendszer ereje: a munkafolyamat egyes lépéseihez a legmegfelelőbb modellt rendeljük”. A routing stratégiák között található véletlenszerű választás, állapatalapú (agent state) routing és osztályozó alapú routing is; a Switchyard ráadásul a token-verbosity (mennyire hajlamos egy modell sok token kimenetet generálni) előrejelzését is használhatja a költséghatékonyabb opciók előnyben részesítésére.
Integráció és partneri ökoszisztéma
Nvidia úgy pozícionálta a Switchyardot, hogy ne helyettesítse a meglévő routing-szolgáltatásokat, hanem integrálódjon azokkal. Két partnercsoportot említettek: azokat az agent-keretrendszereket, amelyek közvetlenül hívhatják a Switchyardot (például Cognition, LangChain és Nous Research), valamint azokat az LLM-gatewayeket, amelyek beépített Switchyard-támogatást biztosítanak termékeikben (például Kong, LiteLLM és OpenRouter). Kong például natívan szállítja a Switchyardot a Kong AI Gateway részeként.
Nvidia azt hangsúlyozza, hogy az együttműködő ökoszisztéma kulcsfontosságú: OpenRouter, LiteLLM és Kong már integrálták a routing algoritmust, így a fejlesztők az általuk használt eszközök mellett vehetik igénybe a Switchyard funkcióit.
Mérési eredmények és korai tesztek
Nvidia kilenc partnerrel végzett korai tesztelés eredményeit ismertette néhány konkrét számmal:
- LangChain: 145 multi-turn Deep Agents feladaton 74%-os költségcsökkenést jelentettek, miután a hívások mindössze 7%-át irányították frontier modellre — ennek 6%-os pontosságveszteség volt a tradeoffja.
- Ramp: a Ramp SWE-Benchen frontier teljesítményt ért el, miközben költségeket 58%-kal és futási időt 33%-kal csökkentett.
- Cognition: a Switchyard staged routerét integrálva Devin Desktopba belső használatra, közel-frontier teljesítményt mértek a FrontierCode Mainen, miközben az átlagköltséget 28%-kal csökkentették a minden hívás frontier modellre irányításához képest.
Ezek a számok azt mutatják, hogy az intelligens routing jelentős költségmegtakarítást eredményezhet alacsony, jól kontrollált teljesítménycsökkenés mellett.
A Nemotron 3.5 Lightning modell jellemzői
Nemotron 3.5 Lightning egy önálló, nyílt modelligény, kifejezetten nagy volumenű, specializált agent feladatokhoz. A Lightning az Nvidia korábbi Nemotron 3 család által bevezetett hibrid Mamba-Transformer, latent mixture-of-experts architektúrát folytatja — ugyanannak az architektúrának a leszármazottja, amely a Nemotron 3 Super mögött áll.
Fontos megjegyezni, hogy Lightning nem a széleskörű általános intelligencia vezetője a méretkategóriájában: az Artificial Analysis Intelligence Index kilenc vizsgálaton alapuló benchmarkján Lightning 24 pontot ért el, ami megegyezik a gpt-oss-120b-vel és elmarad több 30 milliárd körüli modellel, például a Nemotron 3 Super, Gemma 4 31B, Claude 4.5 Haiku és Mistral Medium 3.5 mögött.
Nvidia azonban specifikus, agent-feladatokra fókuszáló mutatókat hangsúlyoz: a cég által közölt PinchBench-adatok szerint Lightning nagyjából 30%-kal gyorsabban teljesíti a Qwen3.6-35B-vel összehasonlítva azonos pontosság mellett, és egyes esetekben gyorsabb, mint a Gemma 4 26B hasonló pontosság mellett. Nvidia továbbá azt állítja, hogy Lightning egyes post-training finomhangolások után nagyobb gyakorlati nyereséget adhat a valós agent munkafolyamatokban.
A cég konkrét partnereihez kötődő előtte-utána adatok között szerepelnek példák: CrowdStrike, CodeRabbit, Harvey és Trajectory, illetve Lila Sciences esetei — Nvidia szerint a CodeRabbitnál egy standard NeMo Auto modell recept, egy epach-cal való betanítás után, működő routing agentbe építve körülbelül két óra alatt előállítható, ráadásul a költség hozzávetőlegesen 85 dollár volt a megadott esetben.
Mit jelent mindez a vállalatok számára?
Az új bejelentés több szempontból is rávilágít az ügynökalapú rendszerek fejlődésére:
- A routing döntések dinamikussá válnak: a korábbi, egyetlen alapmodell köré épített pipeline-ok helyett a gyakorlatban egyes lépéseknél élő jelek (ügynök állapot, hibajelzések, token-költség) alapján döntenek majd.
- A nyílt forráskód most két rétegen is költséglehetőséget jelent: a modell-oldalon és a routing-oldalon egyaránt. Nvidia új érve, hogy ha egy szereplő mindkettőt kontrollálja nyílt licenc alatt, az hatékonyabb költségcsökkentést hozhat, mint pusztán olcsóbb súlyok kínálata.
- A verseny fókusza a „legjobb modellről” a „legjobb rendszerre” tolódik: ahogy a routing-könyvtárak érettebbé válnak, a differenciálás egyre inkább azon múlik, hogy a routing réteg mennyire jól párosítja a modelleket a valós feladatokkal — ez nehezebben mérhető és kommunikálható, mint egyetlen modell benchmark-eredménye.
Végső soron a Nemotron 3.5 Lightning és a NeMo Switchyard bejelentése azt a stratégiát tükrözi, hogy Nvidia a nyílt forrás és az ökoszisztéma-vezérelt integráció kombinációjával próbálja csökkenteni az ügynökök üzemeltetési költségeit, miközben fenntartja a magas szintű feladatmegoldó képességet. A megoldás hatékonyságát a korai partnermérések ígéretesen alátámasztják, de a piaci hatás és a versenytársak válaszlépései határozzák majd meg, mennyire terjed el a megközelítés.



