Eszközök

LangChain Deep Agents-harness profil készítése az NVIDIA Nemotron 3 Ultra számára a teljesítmény javítása érdekében

A cikk főszereplője a LangChain Deep Agents és az NVIDIA Nemotron 3 Ultra modell, amelyhez egy egyedi harness profilt hoznak létre a teljesítmény javítása érdekében.

LangChain Deep Agents-harness profil készítése az NVIDIA Nemotron 3 Ultra számára a teljesítmény javítása érdekében

Agent-szerű rendszerek gyakran pontosság és költség között kompromisszumot kell, hogy kössenek: a legjobb teljesítményű, zárt "frontier" modellek drágák, míg kisebb, hatékonyabb nyílt modellek eleve alacsonyabb pontossággal indulnak. A fine-tuning egy megoldás lehet, de szakértelmet és erőforrást igényel. Egy másik megközelítés az ügynök-harness (agent harness) formális hangolása — például LangChain Deep Agents profilokkal — és az eredmények mérhető ellenőrzése kiértékelő benchmarkokkal.

Cél és eszközök

A leírt tutorial célja egy LangChain Deep Agents harness profil létrehozása az NVIDIA Nemotron 3 Ultra (Nemotron 3 Ultra) számára úgy, hogy a modell viselkedése közelebb álljon egy magasabb intelligenciájú, zárt frontier modelléhez. Minden módosítás az agent harness szintjén történik, a Nemotron 3 Ultra már meglévő NVIDIA-felhő végpontjain keresztül.

Előfeltételek:

  • Python és LangChain Deep Agents telepítve.
  • API-kulcs NVIDIA Nemotron 3 Ultra-hoz (például a build.nvidia.com teszteléshez vagy produkciós végpontokhoz Baseten, Crusoe, Fireworks, Nebius, Together AI stb.).
  • Ajánlott: LangSmith fiók ügynök-trace gyűjtéshez.

Folyamat — kézi hangolás és ellenőrzés

LangChain Deep Agents két eszközt ad a model-specifikus hangoláshoz: egy nyílt forráskódú kiértékelő benchmarkot és az agent harness profilokat, amelyek lehetővé teszik a harness viselkedésének módosítását modell alapján. A kézi eljárás lépései Nemotron 3 Ultra hangolásához:

  1. Bázisérték felállítása: futtassa a benchmarkot deep agenttel és Nemotron 3 Ultra-val profil nélkül.
  2. Elemezze a hibákat.
  3. Javasoljon változtatásokat a harness profilon a hibák korrigálására.
  4. Futtassa újra a benchmarkot, ellenőrizze javulást és regressziók hiányát.

A profilon elvégezhető változtatások példái:

  • Prompts: alap rendszerprompt módosítása, prompt-suffix alkalmazása, eszközleírások változtatása (például utasítás a Nemotron részére, hogy előnyben részesítse a tisztázó kérdéseket vagy a tool-válaszokat a modell emlékezetével szemben).
  • Kizárások: eszközök vagy middleware eltávolítása.
  • Bővítések: további middleware vagy al-ügynökök hozzáadása (például middleware, amely észleli a levágott modelválaszokat vagy hibás eszközneveket).

A cél: az ügynök hívásainak a modell trenírozásakor látott bemenetekhez hasonlóbbá tétele.

Példa hiba: read_file pagináció hiánya

A Nemotron 3 Ultra egy teszten meghibásodott: tests/evals/test_file_operations.py::test_read_file_truncation_recovery_with_pagination[nvidiahub:ultra-tme]. Hibaüzenet szerint a várt végső szövegben szereplő 'opal-fox-91' nem szerepelt; a modell csak az első oldalt olvasta vissza, amely csupán 'x'-eket tartalmazott. A read_file eszköz visszaadja az első oldalt (offset/limit alapú pagináció), a helyes megoldáshoz a modellnek folytatnia kellett volna a fájl olvasását offset növelésével.

A read_file eszköz fontos a LangChain Deep Agents-ben kódolási, adat-elemzési és más agentikus feladatokhoz; ezért egy mechanikus, paginációt feltüntető jelzés volt a javasolt javítás.

Javasolt javítás (middleware összefoglaló)

A bemutatott megoldás egy ReadFileContinuationNoticeMiddleware osztály volt, amely a read_file eszköz eredményéhez egy figyelmeztetést fűz, ha a visszaadott oldal sorainak száma eléri a per-read limitet. A middleware:

  • Csak a read_file hívásokra reagál.
  • Megszámolja a visszaadott sorokat.
  • Ha a sorok száma >= limit, hozzáfűz egy üzenetet: a fájl valószínűleg folytatódik, hívja újra read_file offset=offset+limit paraméterrel.

A middleware hozzáadása a profilhoz:

  • extra_middleware listához adták a ReadFileContinuationNoticeMiddleware-et és regisztrálták a profilt register_harness_profile("nvidia:nemotron-ultra", profile) hívással.

Értékelés és eredmények

A hibát javítva újrafuttatták a tesztet és a teljes benchmarkot. A bemutatott eredmények szerint:

  • Baseline: Read file tests 0 / 3, Átlag: 94 / 127
  • Read file middleware alkalmazása: Read file tests 3 / 3, Átlag: 96 / 127

A fájl middleware minden három read_file tesztet megoldott és a teljes benchmark pontszámát 94-ről 96/127-re növelte.

Túledződés (overfitting) kockázata

Fontos megfontolni az overfittinget: a paginációs middleware mechanikus javítás, amely inkább a megfelelő eszköz-hívásokra tanít, és kevésbé hajlamos túlilleszteni. Ezzel szemben a tesztet okozó szemantikai zavar (például "incident alerts" vs "incident triage") definiálásának hozzáadása a profilhoz nagyobb eséllyel vezetne túlillesztéshez.

Automatizáció: a javító loop agenttel

A kézi ciklus (benchmark futtatása, hibák olvasása, profil módosítása, újrafuttatás) automatizálható; az agentek jól végzik az ilyen ismétlődő folyamatokat. Geoffrey Huntley ezt a mintát a "ralph loop" néven említette: a modell többször olvassa az állapotot, egyszer módosít, és a fájlrendszert használja memóriaként.

A harness engineering ugyanígy működik, csak a kód helyett a profilfájl van szerkesztve és a tesztek helyett az értékelő benchmark került használatra. A benchmark ad objektív jelet, így az automatikus módosítások csak akkor maradnak érvényben, ha mérhetően javítanak.

LangSmith Engine a LangChain megoldása erre: termelési trace-ekben észleli a hibákat, diagnosztizálja őket a forráskód alapján, javaslatot készít, és hozzáad olyan evaluátorokat, amelyek megakadályozzák a regresszió visszatérését; minden változtatás emberi felülvizsgálat után kerül élesítésre.

Referencia implementáció és a javítási ciklus mechanikája

A cikk egy egyszerűbb, futtatható referencia implementációt ismertet a NemoClaw community repository-ban. A javítási ciklus fontos döntései:

  • Igazolja többször a javítást (verify runs), mert a modellhívások és a benchmark is stokasztikusak.
  • Snapshot és rollback: a profil mentése minden kísérlet előtt, visszaállítás ha nem javít.
  • Tanulás az előző próbálkozásból: ha egy próbálkozás sikertelen, a következő kör megkapja, mi történt.
  • A teljes suite újrafuttatása minden sikeres változtatás után, hogy regressziót vagy újonnan felfedezett hibákat találjon.

A „propose a change” lépésnél az agent:

  • olvassa a sikertelen tesztet és a megfigyelt ügynök-trajectóriát,
  • írható profilmásolatot kap (csak ezt módosíthatja),
  • a kódbázisból olvasási jogot kap kontextusért,
  • a legkisebb, általános javítást végzi, és magyarázatot ír.

Két korlátozás tartja a javaslatokat megalapozottnak: a módosítás csak a profilfájlra korlátozódik, és az agentnek általános megoldást kell preferálnia a tesztre specializált hack helyett. A validációs résztesztek elzárhatók a javaslatot tevő agent elől, így további védelem az overfitting ellen.

A cikk egy rövid napló-kimenetet is bemutat, amely megmutatja, hogy a rendszer: baseline-ról (20 passed, 1 failed) egy kör alatt megtalálta a gyökokot, alkalmazta a paginációs hintet, három egymás utáni verifikáció után FIXED státuszt kapott, majd a teljes suite újrafuttatásával 21 passed, 0 failed eredményt ért el.

Általánosíthatóság más harness-ekre

Az automatizált kör nem LangChain-specifikus: más agent-keretrendszerekre adaptáláshoz ki kell tenni három dolgot programozottan elérhető módon: (1) kiértékelések futtatása és per-teszt pass/fail valamint trajectory riportálása, (2) szerkeszthető és validálható profil vagy konfigurációs fájl, (3) egy frontier-quality modell a javítási javaslatok előállításához. Ezzel a hurok változtatás nélkül újrahasználható.

Hol lehet további anyagokat találni

  • A LangChain csapat által publikált Nemotron 3 Ultra agent harness profil.
  • NVIDIA NemoClaw Blueprint a LangChain Deep Agents-hez (Nemotron és NVIDIA OpenShell támogatással).
  • A Nemotron 3 Ultra elérhető Baseten, Crusoe Cloud, DeepInfra, Fireworks, Nebius és Together AI platformokon.
  • További források: hogyan hangolta az NVIDIA a LangChain Deep Agentet a Deep Research Bench megnyeréséhez.

Záró megjegyzés

A bemutatott munkafolyamat a harness engineeringet megalapozott, mérhető módszerré teszi: kiértékelő benchmarkokkal és szerkeszthető profilokkal automatizálható, auditálható és biztonságosan visszagörgethető iterációk hozhatók létre, amelyek javítják egy adott modell viselkedését agentikus munkafolyamatokban anélkül, hogy a teljes modellt újrafinomítanák.