Agent-szerű rendszerek gyakran pontosság és költség között kompromisszumot kell, hogy kössenek: a legjobb teljesítményű, zárt "frontier" modellek drágák, míg kisebb, hatékonyabb nyílt modellek eleve alacsonyabb pontossággal indulnak. A fine-tuning egy megoldás lehet, de szakértelmet és erőforrást igényel. Egy másik megközelítés az ügynök-harness (agent harness) formális hangolása — például LangChain Deep Agents profilokkal — és az eredmények mérhető ellenőrzése kiértékelő benchmarkokkal.
Cél és eszközök
A leírt tutorial célja egy LangChain Deep Agents harness profil létrehozása az NVIDIA Nemotron 3 Ultra (Nemotron 3 Ultra) számára úgy, hogy a modell viselkedése közelebb álljon egy magasabb intelligenciájú, zárt frontier modelléhez. Minden módosítás az agent harness szintjén történik, a Nemotron 3 Ultra már meglévő NVIDIA-felhő végpontjain keresztül.
Előfeltételek:
- Python és LangChain Deep Agents telepítve.
- API-kulcs NVIDIA Nemotron 3 Ultra-hoz (például a build.nvidia.com teszteléshez vagy produkciós végpontokhoz Baseten, Crusoe, Fireworks, Nebius, Together AI stb.).
- Ajánlott: LangSmith fiók ügynök-trace gyűjtéshez.
Folyamat — kézi hangolás és ellenőrzés
LangChain Deep Agents két eszközt ad a model-specifikus hangoláshoz: egy nyílt forráskódú kiértékelő benchmarkot és az agent harness profilokat, amelyek lehetővé teszik a harness viselkedésének módosítását modell alapján. A kézi eljárás lépései Nemotron 3 Ultra hangolásához:
- Bázisérték felállítása: futtassa a benchmarkot deep agenttel és Nemotron 3 Ultra-val profil nélkül.
- Elemezze a hibákat.
- Javasoljon változtatásokat a harness profilon a hibák korrigálására.
- Futtassa újra a benchmarkot, ellenőrizze javulást és regressziók hiányát.
A profilon elvégezhető változtatások példái:
- Prompts: alap rendszerprompt módosítása, prompt-suffix alkalmazása, eszközleírások változtatása (például utasítás a Nemotron részére, hogy előnyben részesítse a tisztázó kérdéseket vagy a tool-válaszokat a modell emlékezetével szemben).
- Kizárások: eszközök vagy middleware eltávolítása.
- Bővítések: további middleware vagy al-ügynökök hozzáadása (például middleware, amely észleli a levágott modelválaszokat vagy hibás eszközneveket).
A cél: az ügynök hívásainak a modell trenírozásakor látott bemenetekhez hasonlóbbá tétele.
Példa hiba: read_file pagináció hiánya
A Nemotron 3 Ultra egy teszten meghibásodott: tests/evals/test_file_operations.py::test_read_file_truncation_recovery_with_pagination[nvidiahub:ultra-tme]. Hibaüzenet szerint a várt végső szövegben szereplő 'opal-fox-91' nem szerepelt; a modell csak az első oldalt olvasta vissza, amely csupán 'x'-eket tartalmazott. A read_file eszköz visszaadja az első oldalt (offset/limit alapú pagináció), a helyes megoldáshoz a modellnek folytatnia kellett volna a fájl olvasását offset növelésével.
A read_file eszköz fontos a LangChain Deep Agents-ben kódolási, adat-elemzési és más agentikus feladatokhoz; ezért egy mechanikus, paginációt feltüntető jelzés volt a javasolt javítás.
Javasolt javítás (middleware összefoglaló)
A bemutatott megoldás egy ReadFileContinuationNoticeMiddleware osztály volt, amely a read_file eszköz eredményéhez egy figyelmeztetést fűz, ha a visszaadott oldal sorainak száma eléri a per-read limitet. A middleware:
- Csak a read_file hívásokra reagál.
- Megszámolja a visszaadott sorokat.
- Ha a sorok száma >= limit, hozzáfűz egy üzenetet: a fájl valószínűleg folytatódik, hívja újra read_file offset=offset+limit paraméterrel.
A middleware hozzáadása a profilhoz:
- extra_middleware listához adták a ReadFileContinuationNoticeMiddleware-et és regisztrálták a profilt register_harness_profile("nvidia:nemotron-ultra", profile) hívással.
Értékelés és eredmények
A hibát javítva újrafuttatták a tesztet és a teljes benchmarkot. A bemutatott eredmények szerint:
- Baseline: Read file tests 0 / 3, Átlag: 94 / 127
- Read file middleware alkalmazása: Read file tests 3 / 3, Átlag: 96 / 127
A fájl middleware minden három read_file tesztet megoldott és a teljes benchmark pontszámát 94-ről 96/127-re növelte.
Túledződés (overfitting) kockázata
Fontos megfontolni az overfittinget: a paginációs middleware mechanikus javítás, amely inkább a megfelelő eszköz-hívásokra tanít, és kevésbé hajlamos túlilleszteni. Ezzel szemben a tesztet okozó szemantikai zavar (például "incident alerts" vs "incident triage") definiálásának hozzáadása a profilhoz nagyobb eséllyel vezetne túlillesztéshez.
Automatizáció: a javító loop agenttel
A kézi ciklus (benchmark futtatása, hibák olvasása, profil módosítása, újrafuttatás) automatizálható; az agentek jól végzik az ilyen ismétlődő folyamatokat. Geoffrey Huntley ezt a mintát a "ralph loop" néven említette: a modell többször olvassa az állapotot, egyszer módosít, és a fájlrendszert használja memóriaként.
A harness engineering ugyanígy működik, csak a kód helyett a profilfájl van szerkesztve és a tesztek helyett az értékelő benchmark került használatra. A benchmark ad objektív jelet, így az automatikus módosítások csak akkor maradnak érvényben, ha mérhetően javítanak.
LangSmith Engine a LangChain megoldása erre: termelési trace-ekben észleli a hibákat, diagnosztizálja őket a forráskód alapján, javaslatot készít, és hozzáad olyan evaluátorokat, amelyek megakadályozzák a regresszió visszatérését; minden változtatás emberi felülvizsgálat után kerül élesítésre.
Referencia implementáció és a javítási ciklus mechanikája
A cikk egy egyszerűbb, futtatható referencia implementációt ismertet a NemoClaw community repository-ban. A javítási ciklus fontos döntései:
- Igazolja többször a javítást (verify runs), mert a modellhívások és a benchmark is stokasztikusak.
- Snapshot és rollback: a profil mentése minden kísérlet előtt, visszaállítás ha nem javít.
- Tanulás az előző próbálkozásból: ha egy próbálkozás sikertelen, a következő kör megkapja, mi történt.
- A teljes suite újrafuttatása minden sikeres változtatás után, hogy regressziót vagy újonnan felfedezett hibákat találjon.
A „propose a change” lépésnél az agent:
- olvassa a sikertelen tesztet és a megfigyelt ügynök-trajectóriát,
- írható profilmásolatot kap (csak ezt módosíthatja),
- a kódbázisból olvasási jogot kap kontextusért,
- a legkisebb, általános javítást végzi, és magyarázatot ír.
Két korlátozás tartja a javaslatokat megalapozottnak: a módosítás csak a profilfájlra korlátozódik, és az agentnek általános megoldást kell preferálnia a tesztre specializált hack helyett. A validációs résztesztek elzárhatók a javaslatot tevő agent elől, így további védelem az overfitting ellen.
A cikk egy rövid napló-kimenetet is bemutat, amely megmutatja, hogy a rendszer: baseline-ról (20 passed, 1 failed) egy kör alatt megtalálta a gyökokot, alkalmazta a paginációs hintet, három egymás utáni verifikáció után FIXED státuszt kapott, majd a teljes suite újrafuttatásával 21 passed, 0 failed eredményt ért el.
Általánosíthatóság más harness-ekre
Az automatizált kör nem LangChain-specifikus: más agent-keretrendszerekre adaptáláshoz ki kell tenni három dolgot programozottan elérhető módon: (1) kiértékelések futtatása és per-teszt pass/fail valamint trajectory riportálása, (2) szerkeszthető és validálható profil vagy konfigurációs fájl, (3) egy frontier-quality modell a javítási javaslatok előállításához. Ezzel a hurok változtatás nélkül újrahasználható.
Hol lehet további anyagokat találni
- A LangChain csapat által publikált Nemotron 3 Ultra agent harness profil.
- NVIDIA NemoClaw Blueprint a LangChain Deep Agents-hez (Nemotron és NVIDIA OpenShell támogatással).
- A Nemotron 3 Ultra elérhető Baseten, Crusoe Cloud, DeepInfra, Fireworks, Nebius és Together AI platformokon.
- További források: hogyan hangolta az NVIDIA a LangChain Deep Agentet a Deep Research Bench megnyeréséhez.
Záró megjegyzés
A bemutatott munkafolyamat a harness engineeringet megalapozott, mérhető módszerré teszi: kiértékelő benchmarkokkal és szerkeszthető profilokkal automatizálható, auditálható és biztonságosan visszagörgethető iterációk hozhatók létre, amelyek javítják egy adott modell viselkedését agentikus munkafolyamatokban anélkül, hogy a teljes modellt újrafinomítanák.



