Az NVIDIA NeMo Switchyard egy nyílt forráskódú, szolgáltatófüggetlen SDK és futtatási réteg, amely lehetővé teszi, hogy több, különböző képességű és költségprofilú nyelvi modellt együttesen használó "system-of-models" megközelítést alkalmazzanak AI-ügynökökben. A cél az, hogy az egyes ügynöki feladatlépésekhez azt a modellt válasszák, amelyik a legjobban megfelel a pontossági, késleltetési és költségbeli követelményeknek — ahelyett, hogy minden kérést mindig a legerősebb vagy éppen a legolcsóbb modellre küldenének.
A routing alapelvei és milyen jelekre támaszkodik
A NeMo Switchyard valós időben értékeli a bejövő kéréseket és a rendelkezésre álló kontextust, majd a konfigurált modellkészletből a legmegfelelőbbet választja. A routing-döntések hatékony meghozatalához három fő jelcsoport szükséges:
- Modellképességek: melyik modell képes a feladatot helyesen megoldani.
- Modellköltségprofil: egy adott modell késleltetése és költsége a futtatás vagy elérés során.
- Infrastruktúra: rendszer-szintű jelek (pl. ár, késleltetés, terhelés, hibák) és a zökkenőmentes átadás támogatása.
A routerek különféle forrásokból nyerhetnek jeleket: maga a kérés (klasszifikációs címkézés, beágyazások), a modell állapota (logprobok, residual stream, attention mátrixok stb.) és a rendszer-mutatók (ár, késleltetés, erőforrás-használat). Fontos eldönteni azt is, hogy a jeleket mikor és hol értékelik — például routing teljes kérésekre vagy lépésenként egy többfordulós feladat során.
Architektúra és eszközkészlet
A NeMo Switchyard mögötti provider-agnosztikus SDK (switchyard-lib) reprezentálja a kéréseket, a rendszerben elérhető modelleket, és menedzseli a kiválasztott modellre irányuló hívásokat. Minden modell célnak egy szemantikus nevet rendelnek, a kliens pedig ezt a nevet mappeli a konkrét szolgáltatói végpontra és modellazonosítóra — így a routing logika független marad a konkrét szolgáltatótól.
A rendszer képes routing-állapotot megtartani egy ügynök munkamenetén keresztül, ha a stratégia megköveteli (például korábbi fordulók eszközhasználati eredményei, affinitás-döntések tárolása). Ugyanakkor lehet állapotnélküli útvonalat is alkalmazni, ha a történet nem szükséges.
A NeMo Switchyard szerver referenciaimplementációként szolgálhat, és képes OpenAI-, Anthropic- és Responses API-kéréseket fogadni, belső formátumba konvertálni, és a várt válaszformátummal visszaadni. Emellett naplózza a kiválasztott modellt, a döntés indoklását, tokenhasználatot, késleltetést és hívás-kimeneteket az ellenőrzéshez.
Routing-megoldások: tuning-mentes és hangolható routerek
NeMo Switchyard két fő routerkategóriát kínál: tuning-mentes (heurisztikus) és hangolható (tanuló) routereket.
Tuning-mentes routerek
-
LLM classifier: egy LLM-et használ bíróként, hogy egy jelölt LLM-et válasszon, és munkamenet-affinitást tartson fenn az adott modellel a későbbi fordulókra. Hasznos headless vagy domén-specifikus rendszerekhez (pl. kódolás, matematika, egészségügy).
-
Stage router: különösen kódoló ügynököknél alkalmazható, amelyek több fázison haladnak át (felfedezés, hibajavítás, mechanikus megvalósítás). A stage router az eszközhasználati előzményeket vizsgálva dönt arról, hogy az adott fordulóhoz robusztusabb vagy költséghatékonyabb modell szükséges-e.
-
Escalation router: minden beszélgetést kezdetben alacsonyabb költségű modellel indít, majd egy LLM bíró fordulóról fordulóra figyeli a feladat előrehaladását, és tartós nehézség észlelése esetén előrehalad a nagyobb képességű modellre. Ez különösen többfordulós ügynöki munkafolyamatokhoz alkalmas, ahol az egyszerű rutinmunka egy kisebb modelltől elvárható.
Hangolható routerek
A hangolható routerek valós világbeli munkaterhelési adatokból tanulnak jelzéseket a fix heuristikák helyett, és valószínűségeket jósolnak arra, hogy egy-egy jelölt modell helyesen válaszol-e.
- Prefill router: tanítás közben a router kinyeri az LLM residual streamjét a lekérdezés komplexitásának becslésére. Egy megosztott MLP (shared-trunk) a residual stream és egyéb jelek alapján minden routing modellt illetően pontossági címkéket tanul. Infernciáláskor ezek a prefill-állapotok a router bemenetét képezik, a modell valószínűségeket ad, és egy politika kombinálja a várt pontosságot költséggel, késleltetéssel vagy egyéb korlátozásokkal, hogy kiválassza a legjobb kompromisszumot.
Mérések és partner-implementációk — gyakorlati eredmények
LangChain benchmark: egy belső, 145 többfordulós ügynöki feladatot tartalmazó tesztsorozaton (valós világra hajazó munkafolyamatok, eszközhasználat, hosszú-kontekstuális összegzések stb.) a NeMo Switchyard escalation routerrel végzett routing a NVIDIA Nemotron 3.5 Lightning és Claude Opus 4.8 modellek között 74% költségcsökkenést eredményezett egy frontier-only (csak a legerősebb modell) bázishoz képest az öt futás átlaga alapján. Ugyanekkor a hívásoknak csak 7%-át küldték a frontier modellre, ami körülbelül ~6 pontos pontosság-veszteséggel járt a mérés szerint.
Cognition belső telepítés: a Cognition a NeMo Switchyard staged-routing módszert alkalmazta Devin Desktopban, éles belső felhasználói tesztre. A FrontendCode Main benchmarkon, amely gyártás szintű kódolási feladatokat mér, a megoldás Opus 5 és Kimi K2.7 között route-olt; az eredmény közel frontier-szintű teljesítmény volt: 50,6% pontosság 3,11 dolláros átlagköltség mellett — ez 2,8 százalékponttal maradt el az Opus 5 pontosságától, és körülbelül 28%-kal alacsonyabb átlagköltséget ért el.
Ezek a példák azt mutatják, hogy a modell-semleges, adaptív routing gyakorlati megtakarítást és költséghatékonyságot hozhat, miközben a feladat evolúciójához illeszkedve dinamikusan alkalmazkodik.
Integrációk és elérhetőség
NVIDIA partnerekkel dolgozik együtt, hogy a NeMo Switchyard beépüljön meglévő ügynökeszközökbe és infrastruktúrákba: például kódoló ügynökökkel a Cognition, Hermes Agent-routingt a Nous Research, pénzügyi szoftverfejlesztési munkafolyamatokkal a Ramp, integrációkkal LangChain, LiteLLM, Kong, Classmethod, Boomi Agent Garden, valamint ipari ügyfelekkel, mint a Cadence és a Siemens.
A NeMo Switchyard teljesen nyílt forráskódú; a fejlesztők GitHubon találják az SDK-t és a dokumentációt, és beépíthetik a routingot saját ügynökökbe vagy LLM-gatewayekbe.
Összegzés
Ahogy az AI-rendszerek egyre inkább kombinálják a specializált és frontier modelleket, a routing létfontosságúvá válik annak eldöntéséhez, hogy melyik modell a legalkalmasabb egy adott feladatlépéshez a minőség, költség és késleltetés egyensúlyában. A NeMo Switchyard egy gyakorlati, szolgáltatófüggetlen eszközkészletet és referencia-szervert biztosít, amely segíti a fejlesztőket abban, hogy modellek közti irányítást vezessék be anélkül, hogy alkalmazásaikat minden egyes szolgáltatóváltoztatáskor újraépítenék.



