Eszközök

Mesterséges intelligenciával generált szöveg

NVIDIA NeMo Switchyard: modellek közti útválasztás az ügynökmunka hatékonyságáért

A főszereplő az NVIDIA NeMo Switchyard, egy nyílt forráskódú, szolgáltatófüggetlen SDK és szerver, amely modellek közötti dinamikus útválasztást tesz lehetővé ügynök (agent) munkafolyamatok számára.

NVIDIA NeMo Switchyard: modellek közti útválasztás az ügynökmunka hatékonyságáért

Az NVIDIA NeMo Switchyard egy nyílt forráskódú, szolgáltatófüggetlen SDK és futtatási réteg, amely lehetővé teszi, hogy több, különböző képességű és költségprofilú nyelvi modellt együttesen használó "system-of-models" megközelítést alkalmazzanak AI-ügynökökben. A cél az, hogy az egyes ügynöki feladatlépésekhez azt a modellt válasszák, amelyik a legjobban megfelel a pontossági, késleltetési és költségbeli követelményeknek — ahelyett, hogy minden kérést mindig a legerősebb vagy éppen a legolcsóbb modellre küldenének.

A routing alapelvei és milyen jelekre támaszkodik

A NeMo Switchyard valós időben értékeli a bejövő kéréseket és a rendelkezésre álló kontextust, majd a konfigurált modellkészletből a legmegfelelőbbet választja. A routing-döntések hatékony meghozatalához három fő jelcsoport szükséges:

  • Modellképességek: melyik modell képes a feladatot helyesen megoldani.
  • Modellköltségprofil: egy adott modell késleltetése és költsége a futtatás vagy elérés során.
  • Infrastruktúra: rendszer-szintű jelek (pl. ár, késleltetés, terhelés, hibák) és a zökkenőmentes átadás támogatása.

A routerek különféle forrásokból nyerhetnek jeleket: maga a kérés (klasszifikációs címkézés, beágyazások), a modell állapota (logprobok, residual stream, attention mátrixok stb.) és a rendszer-mutatók (ár, késleltetés, erőforrás-használat). Fontos eldönteni azt is, hogy a jeleket mikor és hol értékelik — például routing teljes kérésekre vagy lépésenként egy többfordulós feladat során.

Architektúra és eszközkészlet

A NeMo Switchyard mögötti provider-agnosztikus SDK (switchyard-lib) reprezentálja a kéréseket, a rendszerben elérhető modelleket, és menedzseli a kiválasztott modellre irányuló hívásokat. Minden modell célnak egy szemantikus nevet rendelnek, a kliens pedig ezt a nevet mappeli a konkrét szolgáltatói végpontra és modellazonosítóra — így a routing logika független marad a konkrét szolgáltatótól.

A rendszer képes routing-állapotot megtartani egy ügynök munkamenetén keresztül, ha a stratégia megköveteli (például korábbi fordulók eszközhasználati eredményei, affinitás-döntések tárolása). Ugyanakkor lehet állapotnélküli útvonalat is alkalmazni, ha a történet nem szükséges.

A NeMo Switchyard szerver referenciaimplementációként szolgálhat, és képes OpenAI-, Anthropic- és Responses API-kéréseket fogadni, belső formátumba konvertálni, és a várt válaszformátummal visszaadni. Emellett naplózza a kiválasztott modellt, a döntés indoklását, tokenhasználatot, késleltetést és hívás-kimeneteket az ellenőrzéshez.

Routing-megoldások: tuning-mentes és hangolható routerek

NeMo Switchyard két fő routerkategóriát kínál: tuning-mentes (heurisztikus) és hangolható (tanuló) routereket.

Tuning-mentes routerek

  • LLM classifier: egy LLM-et használ bíróként, hogy egy jelölt LLM-et válasszon, és munkamenet-affinitást tartson fenn az adott modellel a későbbi fordulókra. Hasznos headless vagy domén-specifikus rendszerekhez (pl. kódolás, matematika, egészségügy).

  • Stage router: különösen kódoló ügynököknél alkalmazható, amelyek több fázison haladnak át (felfedezés, hibajavítás, mechanikus megvalósítás). A stage router az eszközhasználati előzményeket vizsgálva dönt arról, hogy az adott fordulóhoz robusztusabb vagy költséghatékonyabb modell szükséges-e.

  • Escalation router: minden beszélgetést kezdetben alacsonyabb költségű modellel indít, majd egy LLM bíró fordulóról fordulóra figyeli a feladat előrehaladását, és tartós nehézség észlelése esetén előrehalad a nagyobb képességű modellre. Ez különösen többfordulós ügynöki munkafolyamatokhoz alkalmas, ahol az egyszerű rutinmunka egy kisebb modelltől elvárható.

Hangolható routerek

A hangolható routerek valós világbeli munkaterhelési adatokból tanulnak jelzéseket a fix heuristikák helyett, és valószínűségeket jósolnak arra, hogy egy-egy jelölt modell helyesen válaszol-e.

  • Prefill router: tanítás közben a router kinyeri az LLM residual streamjét a lekérdezés komplexitásának becslésére. Egy megosztott MLP (shared-trunk) a residual stream és egyéb jelek alapján minden routing modellt illetően pontossági címkéket tanul. Infernciáláskor ezek a prefill-állapotok a router bemenetét képezik, a modell valószínűségeket ad, és egy politika kombinálja a várt pontosságot költséggel, késleltetéssel vagy egyéb korlátozásokkal, hogy kiválassza a legjobb kompromisszumot.

Mérések és partner-implementációk — gyakorlati eredmények

LangChain benchmark: egy belső, 145 többfordulós ügynöki feladatot tartalmazó tesztsorozaton (valós világra hajazó munkafolyamatok, eszközhasználat, hosszú-kontekstuális összegzések stb.) a NeMo Switchyard escalation routerrel végzett routing a NVIDIA Nemotron 3.5 Lightning és Claude Opus 4.8 modellek között 74% költségcsökkenést eredményezett egy frontier-only (csak a legerősebb modell) bázishoz képest az öt futás átlaga alapján. Ugyanekkor a hívásoknak csak 7%-át küldték a frontier modellre, ami körülbelül ~6 pontos pontosság-veszteséggel járt a mérés szerint.

Cognition belső telepítés: a Cognition a NeMo Switchyard staged-routing módszert alkalmazta Devin Desktopban, éles belső felhasználói tesztre. A FrontendCode Main benchmarkon, amely gyártás szintű kódolási feladatokat mér, a megoldás Opus 5 és Kimi K2.7 között route-olt; az eredmény közel frontier-szintű teljesítmény volt: 50,6% pontosság 3,11 dolláros átlagköltség mellett — ez 2,8 százalékponttal maradt el az Opus 5 pontosságától, és körülbelül 28%-kal alacsonyabb átlagköltséget ért el.

Ezek a példák azt mutatják, hogy a modell-semleges, adaptív routing gyakorlati megtakarítást és költséghatékonyságot hozhat, miközben a feladat evolúciójához illeszkedve dinamikusan alkalmazkodik.

Integrációk és elérhetőség

NVIDIA partnerekkel dolgozik együtt, hogy a NeMo Switchyard beépüljön meglévő ügynökeszközökbe és infrastruktúrákba: például kódoló ügynökökkel a Cognition, Hermes Agent-routingt a Nous Research, pénzügyi szoftverfejlesztési munkafolyamatokkal a Ramp, integrációkkal LangChain, LiteLLM, Kong, Classmethod, Boomi Agent Garden, valamint ipari ügyfelekkel, mint a Cadence és a Siemens.

A NeMo Switchyard teljesen nyílt forráskódú; a fejlesztők GitHubon találják az SDK-t és a dokumentációt, és beépíthetik a routingot saját ügynökökbe vagy LLM-gatewayekbe.

Összegzés

Ahogy az AI-rendszerek egyre inkább kombinálják a specializált és frontier modelleket, a routing létfontosságúvá válik annak eldöntéséhez, hogy melyik modell a legalkalmasabb egy adott feladatlépéshez a minőség, költség és késleltetés egyensúlyában. A NeMo Switchyard egy gyakorlati, szolgáltatófüggetlen eszközkészletet és referencia-szervert biztosít, amely segíti a fejlesztőket abban, hogy modellek közti irányítást vezessék be anélkül, hogy alkalmazásaikat minden egyes szolgáltatóváltoztatáskor újraépítenék.