Egy gyakorlati, agentvezérelt autoresearch munkafolyamatot mutattak be, amely automatikusan felállítja a környezetet, elindítja és monitorozza a kísérleteket, majd elemzi és összegzi az eredményeket megerősítéses tanulás (RL) kutatásában. A bemutatott rendszer komponensei: NVIDIA NeMo RL, NVIDIA NeMo Gym, egy NVIDIA Brev GPU példány, és egy fejlett kódoló ügynök (Codex with GPT 5.5). A cél nem a kutató kiváltása, hanem az ismétlődő üzemeltetési és iterációs munka átruházása az ügynökre, miközben a kutatók meghatározzák a célokat és felügyelik a döntéseket.
Milyen problémát old meg ez a megközelítés?
A megerősítéses tanulásban a hasznos metrikák gyakran csak akkor válnak elérhetővé, ha a kísérleti infrastruktúra (adatgenerálás, környezet, checkpointok, logolás) működik. Az autoresearch nevű nyílt forráskódú Python projekt célja, hogy autonóm ügynökökkel magas szintű célokat hypózisokra bontson, valós kódon módosítson és teszteljen, megtartsa a javuló ötleteket, és visszaadja az eredményeket a kutatónak.
Használt eszközök és komponensek
- Codex with GPT 5.5 (frontier coding agent) a kódnavigációhoz, érveléshez és eszközhasználathoz.
- NVIDIA NeMo RL és NVIDIA NeMo Gym (a NeMo keretrendszer nyílt forrású részei) a modelltréning és a futtatási környezet biztosítására.
- NVIDIA Brev felhőpéldány, egy L40S 48 GB GPU-val a számítási munkához.
- Qwen modellek: Qwen3-VL-2B-Instruct és Qwen3-1.7B a példákban.
- Kiegészítő agent-készségek: Brev-etiquette, session-memory és autoresearch (működési szabályok, tartós munkanapló, kísérleti hurok).
Mire képes az agent a bemutató szerint?
A demonstrált munkafolyamat három fő képességet szemléltet:
- Full-stack autonómia: szoftver és hardver konfigurálása, függőségek megoldása, GPU memória és lemezkezelés, checkpointok, kísérletek indítása és hibakeresés.
- Célvezérelt autoresearch: baseline profilozás, hipotezisek létrehozása, kísérletek futtatása, metrikák elemzése és iteráció a kutatási cél felé.
- Paper-to-code: egy kutatási cikk elolvasása, implementációs terv készítése, algoritmus kódolása, tesztek hozzáadása és validációs futtatás elindítása.
Példa: star_count környezet és SFT kampány
A bemutatóban a Codex először felállította a teljes NeMo RL + NeMo Gym stacket és egy rövid pile-up (smoke test) RL tréninget a Qwen3-VL-2B-Instruct modellel. Ezt követően a kódoló ügynök új, "star count" vizuális számláló NeMo Gym környezetet tervezett és implementált, amely különböző színű csillagok számolására generál képeket több felbontáson.
A kísérleti kampány rövid összefoglalója (Codex jelentése):
- Kiinduló, kísérleti értékelés egy 64 mintás tartóhalmazon: 25.0% pontos egyezés (exact accuracy), átlagos jutalom 0.705208.
- Első LoRA SFT smoke run: 78.125% pontos egyezés.
- Nagyobb adat és lépésszám skálázás: 2048-train/256-val, 160 lépés → 95.3125% exact accuracy.
- Legjobb eredmény: 4096-train/512-val, 320 lépés → 96.875% exact accuracy, átlagos jutalom 0.992188. A legjobb checkpoint step_240 volt.
- Összességében az exact accuracy 25.0%-ról 96.875%-ra emelkedett, azaz 71.875 százalékpontnyi javulás. A maradék hibák közel-találati (off-by-one) számlálási eltérések voltak bizonyos színek esetén, ami célzott adataugmentációt javasol következő lépésként.
A teljes setup-ellenőrzés és egy rövid smoke test általában körülbelül 40 perctől egy óráig tartott a bemutató szerint.
Paper-to-code példa: OAPL implementálása és validáció
A bemutató második komplex példája a "LLMs Can Learn to Reason via Off-Policy RL" című cikk (arXiv:2602.19362) implementálása volt. A módszer, Optimal Advantage-based Policy Optimization with Lagged Inference policy (OAPL), hosszú késleltetésű off-policy megközelítést vezet be, amely a lagged generálási policy-t is a célfüggvény részeként használja.
A Codex lépései az implementáció során:
- PDF beolvasása és algoritmus kinyerése.
- NeMo RL integrációs pontok feltérképezése és megvalósítási terv készítése.
- Kód írása, unit tesztek hozzáadása és dokumentálás.
- Érvényesítési kampány elindítása Qwen3-1.7B modellel a DAPO-math-17K adatkészleten; időkeret: 10 óra.
A demonstrációs futtatások azt mutatták, hogy OAPL kevesebb lépéssel magasabb pontosságot ért el a GRPO variánshoz képest, de több tokent használt, ami további kutatási kérdéseket vet fel a hatékonyság és tömörség optimalizálásáról.
Működési gyakorlatok és kockázatok
A szerzők több, hasznos tanácsot és ismert failure módot is kiemelnek:
- Context drift: hosszú munkameneteknél a kontextus tömörítése után az ügynök elveszítheti a célt vagy a stop-szabályokat; ezért tartós session-memory szükséges.
- Lokális háztartási rend: checkpointok, logok és cache-ek szétszóródhatnak, ha nincs explicit Brev-etiquette.
- Steering drift: közben feltett instrukciók eltéríthetik a kampányt.
- Low-signal loopok: túl rövid, kisbatch-es kísérletek kevés visszajelzést adnak; az emberi kutatónak kell felismernie és korrigálnia.
Ajánlott gyakorlatok:
- Kezeljük az autoresearch készségeket (skills) mint folyamatosan fejlődő munkautasításokat.
- Tartsuk fenn a kutatói ellenőrzést kritikus döntéseknél és ne indítsunk hosszú futtatásokat ellenőrzés nélkül.
- Előzetes tervezés és ötletvalidálás hasznos a hosszú futtatások előtt.
- Határozzunk meg világos költségkereteket (idő, GPU-óra, experiment-szám) a kampányok előtt.
Következtetés
A bemutatott agentvezérelt autoresearch munkafolyamat megkönnyíti az RL kutatók életét azáltal, hogy automatizálja a környezetfelállítást, adat- és kísérletmenedzsmentet, és gyors iterációt tesz lehetővé. A NeMo RL, NeMo Gym, Brev, Codex és néhány jól megírt agent-skill kombinációja lehetővé tette új környezetek létrehozását, modellek gyors profilozását és algoritmusimplementációk validációjának elindítását. A módszer lényege, hogy az ügynök átveszi az operatív terheket, míg a kutató a célok és a stratégiai döntések felett tartja a kontrollt.
Hol kezdhető el
- A NeMo RL Autoresearch Launchable használata Brev-en.
- NVIDIA-verified Agent Skills dokumentációinak és a NVIDIA/skills GitHub repo böngészése (NeMo RL Auto Research skill különösen hasznos).
- NeMo RL és NeMo Gym kipróbálása a saját kísérletekhez.
(A cikk a demonstrációs munkafolyamatot foglalja össze; minden állítás a bemutatott tesztekből és ügynöki riportokból származik.)



