Eszközök

Agentvezérelt autoresearch munkafolyamat NeMo RL-lel és NVIDIA eszközökkel

A cikk bemutatja az autoresearch nyílt forráskódú Python projekt használatát autonóm kutatóügynökökkel megerősítéses tanulási (RL) kutatásokhoz, kiemelve Andrej Karpathy munkáját és az NVIDIA eszközök szerepét.

Agentvezérelt autoresearch munkafolyamat NeMo RL-lel és NVIDIA eszközökkel

Egy gyakorlati, agentvezérelt autoresearch munkafolyamatot mutattak be, amely automatikusan felállítja a környezetet, elindítja és monitorozza a kísérleteket, majd elemzi és összegzi az eredményeket megerősítéses tanulás (RL) kutatásában. A bemutatott rendszer komponensei: NVIDIA NeMo RL, NVIDIA NeMo Gym, egy NVIDIA Brev GPU példány, és egy fejlett kódoló ügynök (Codex with GPT 5.5). A cél nem a kutató kiváltása, hanem az ismétlődő üzemeltetési és iterációs munka átruházása az ügynökre, miközben a kutatók meghatározzák a célokat és felügyelik a döntéseket.

Milyen problémát old meg ez a megközelítés?

A megerősítéses tanulásban a hasznos metrikák gyakran csak akkor válnak elérhetővé, ha a kísérleti infrastruktúra (adatgenerálás, környezet, checkpointok, logolás) működik. Az autoresearch nevű nyílt forráskódú Python projekt célja, hogy autonóm ügynökökkel magas szintű célokat hypózisokra bontson, valós kódon módosítson és teszteljen, megtartsa a javuló ötleteket, és visszaadja az eredményeket a kutatónak.

Használt eszközök és komponensek

  • Codex with GPT 5.5 (frontier coding agent) a kódnavigációhoz, érveléshez és eszközhasználathoz.
  • NVIDIA NeMo RL és NVIDIA NeMo Gym (a NeMo keretrendszer nyílt forrású részei) a modelltréning és a futtatási környezet biztosítására.
  • NVIDIA Brev felhőpéldány, egy L40S 48 GB GPU-val a számítási munkához.
  • Qwen modellek: Qwen3-VL-2B-Instruct és Qwen3-1.7B a példákban.
  • Kiegészítő agent-készségek: Brev-etiquette, session-memory és autoresearch (működési szabályok, tartós munkanapló, kísérleti hurok).

Mire képes az agent a bemutató szerint?

A demonstrált munkafolyamat három fő képességet szemléltet:

  1. Full-stack autonómia: szoftver és hardver konfigurálása, függőségek megoldása, GPU memória és lemezkezelés, checkpointok, kísérletek indítása és hibakeresés.
  2. Célvezérelt autoresearch: baseline profilozás, hipotezisek létrehozása, kísérletek futtatása, metrikák elemzése és iteráció a kutatási cél felé.
  3. Paper-to-code: egy kutatási cikk elolvasása, implementációs terv készítése, algoritmus kódolása, tesztek hozzáadása és validációs futtatás elindítása.

Példa: star_count környezet és SFT kampány

A bemutatóban a Codex először felállította a teljes NeMo RL + NeMo Gym stacket és egy rövid pile-up (smoke test) RL tréninget a Qwen3-VL-2B-Instruct modellel. Ezt követően a kódoló ügynök új, "star count" vizuális számláló NeMo Gym környezetet tervezett és implementált, amely különböző színű csillagok számolására generál képeket több felbontáson.

A kísérleti kampány rövid összefoglalója (Codex jelentése):

  • Kiinduló, kísérleti értékelés egy 64 mintás tartóhalmazon: 25.0% pontos egyezés (exact accuracy), átlagos jutalom 0.705208.
  • Első LoRA SFT smoke run: 78.125% pontos egyezés.
  • Nagyobb adat és lépésszám skálázás: 2048-train/256-val, 160 lépés → 95.3125% exact accuracy.
  • Legjobb eredmény: 4096-train/512-val, 320 lépés → 96.875% exact accuracy, átlagos jutalom 0.992188. A legjobb checkpoint step_240 volt.
  • Összességében az exact accuracy 25.0%-ról 96.875%-ra emelkedett, azaz 71.875 százalékpontnyi javulás. A maradék hibák közel-találati (off-by-one) számlálási eltérések voltak bizonyos színek esetén, ami célzott adataugmentációt javasol következő lépésként.

A teljes setup-ellenőrzés és egy rövid smoke test általában körülbelül 40 perctől egy óráig tartott a bemutató szerint.

Paper-to-code példa: OAPL implementálása és validáció

A bemutató második komplex példája a "LLMs Can Learn to Reason via Off-Policy RL" című cikk (arXiv:2602.19362) implementálása volt. A módszer, Optimal Advantage-based Policy Optimization with Lagged Inference policy (OAPL), hosszú késleltetésű off-policy megközelítést vezet be, amely a lagged generálási policy-t is a célfüggvény részeként használja.

A Codex lépései az implementáció során:

  • PDF beolvasása és algoritmus kinyerése.
  • NeMo RL integrációs pontok feltérképezése és megvalósítási terv készítése.
  • Kód írása, unit tesztek hozzáadása és dokumentálás.
  • Érvényesítési kampány elindítása Qwen3-1.7B modellel a DAPO-math-17K adatkészleten; időkeret: 10 óra.

A demonstrációs futtatások azt mutatták, hogy OAPL kevesebb lépéssel magasabb pontosságot ért el a GRPO variánshoz képest, de több tokent használt, ami további kutatási kérdéseket vet fel a hatékonyság és tömörség optimalizálásáról.

Működési gyakorlatok és kockázatok

A szerzők több, hasznos tanácsot és ismert failure módot is kiemelnek:

  • Context drift: hosszú munkameneteknél a kontextus tömörítése után az ügynök elveszítheti a célt vagy a stop-szabályokat; ezért tartós session-memory szükséges.
  • Lokális háztartási rend: checkpointok, logok és cache-ek szétszóródhatnak, ha nincs explicit Brev-etiquette.
  • Steering drift: közben feltett instrukciók eltéríthetik a kampányt.
  • Low-signal loopok: túl rövid, kisbatch-es kísérletek kevés visszajelzést adnak; az emberi kutatónak kell felismernie és korrigálnia.

Ajánlott gyakorlatok:

  • Kezeljük az autoresearch készségeket (skills) mint folyamatosan fejlődő munkautasításokat.
  • Tartsuk fenn a kutatói ellenőrzést kritikus döntéseknél és ne indítsunk hosszú futtatásokat ellenőrzés nélkül.
  • Előzetes tervezés és ötletvalidálás hasznos a hosszú futtatások előtt.
  • Határozzunk meg világos költségkereteket (idő, GPU-óra, experiment-szám) a kampányok előtt.

Következtetés

A bemutatott agentvezérelt autoresearch munkafolyamat megkönnyíti az RL kutatók életét azáltal, hogy automatizálja a környezetfelállítást, adat- és kísérletmenedzsmentet, és gyors iterációt tesz lehetővé. A NeMo RL, NeMo Gym, Brev, Codex és néhány jól megírt agent-skill kombinációja lehetővé tette új környezetek létrehozását, modellek gyors profilozását és algoritmusimplementációk validációjának elindítását. A módszer lényege, hogy az ügynök átveszi az operatív terheket, míg a kutató a célok és a stratégiai döntések felett tartja a kontrollt.

Hol kezdhető el

  • A NeMo RL Autoresearch Launchable használata Brev-en.
  • NVIDIA-verified Agent Skills dokumentációinak és a NVIDIA/skills GitHub repo böngészése (NeMo RL Auto Research skill különösen hasznos).
  • NeMo RL és NeMo Gym kipróbálása a saját kísérletekhez.

(A cikk a demonstrációs munkafolyamatot foglalja össze; minden állítás a bemutatott tesztekből és ügynöki riportokból származik.)