A NVIDIA kutatói kifejlesztették az ENPIRE nevű szoftvert, amely lehetővé teszi, hogy fizikai robotok hasonló, önálló kísérletezési és végrehajtási ciklust hajtsanak végre, mint az ügynök‑alapú mesterséges intelligenciák. A rendszer egy „harness framework”, amely négy alapmodullal valósítja meg ezt a fizikai visszacsatolási rutint: az Environment modul (EN) automatikus visszaállítást és ellenőrzést végez, a Policy Improvement modul (PI) indítja a politika finomhangolását, a Rollout modul (R) értékeli a politikákat egy vagy több fizikai robot párhuzamos működésében, és az Evolution modul (E) naplókat elemez, irodalmat konzultál, továbbfejleszti a tréning‑infrastruktúrát és az algoritmuskódot a hibamódok kezelése érdekében.
Működés és cél
ENPIRE felépítése hasonlít a kódoló ügynökökhöz: egy felügyeleti keret felügyeli azokat a fizikai robotokat, amelyek meghatározott feladatok elvégzésére kapnak utasítást. A robotok különböző stratégiákat próbálnak ki, hibáznak és tanulnak; a rendszer értékeli a sikert, és szükség esetén visszaállítja a környezetet. A fejlesztők szerint ez a zárt ciklus „átalakítja a valós világban zajló robottanulást egy szabályozható optimalizációs eljárássá, amelyet az ügynökök kezelhetnek, így minimalizálva az emberi beavatkozást, miközben lehetővé teszi a tisztességes összehasonlítást az eltérő tanítási receptek és ügynökvariánsok között.”
Két kulcsfontosságú összetevő teszi lehetővé a rendszert: egy automatikus kiértékelő (ami emberi megítélés nélkül pontozza az egyes próbák kimenetelét) és egy automatikus visszaállító mechanizmus (ami „visszaállítja a jelenetet egy friss kezdeti állapotba a következő próba számára”). A kutatók megjegyzik, hogy bonyolultabb feladatoknál még mindig szükség lehet emberi értékelésre vagy visszaállításra, tehát a támadható feladatok komplexitását részben ezek automatizálhatósága határozza meg.
Hardver és tesztkörnyezet
A bemutatott állomások mindegyike két, I2RT által gyártott YAM (Yet Another Manipulator) kart tartalmaz fix bimanual konfigurációban, több kamerát, és egy munkaállomást, amely futtatja a FastAPI szervert, a politika inferenciát és az állomás ügynökét. Minden munkaállomáson egy NVIDIA RTX 5090 GPU működik.
Eredmények a valós feladatokon
A kutatók szerint a rendszer jól teljesít bizonyos egyszerűbb, de kifinomult manipulációs feladatokban: „Frontier coding agents can autonomously develop a policy to achieve a 99% success rate on challenging, dexterous manipulation tasks in the real world, such as PushT, organizing pins into a pin box, and using a cutter to cut a zip tie.” Egy további vizsgált feladat az volt, hogy a robot mennyire képes GPU‑kat beilleszteni egy alaplapba.
Az összehasonlítások során különböző nyelvi‑ és kódolómodellek versengtek: a GPT‑5.5 (Codex keretében) és az Opus 4.7 (Claude Code keretében) váltakozva voltak a legjobbak, míg a Kimi‑2.6 elmaradt. A skálázás előnyei is kiemelhetők: nagyobb számú ügynök (például nyolc) gyorsabban talált magasabb pontszámú megoldásokat, és egyes többugynökös konfigurációk abszolút magasabb eredményt értek el, valószínűleg mert több megoldási irányt feltérképeztek.
Skálázási és infrastruktúra kihívások
A szerzők rávilágítanak arra, hogy még vannak megoldatlan gyakorlati problémák a robotflották instrumentálásában. A kódoló ügynökök nem használják ki teljes mértékben a robot erőforrásait, amikor naplókat olvasnak, kódot írnak, hibákat keresnek vagy a nyelvi modellre várnak. Ahogy a robotok száma nő, a robot‑erőforrás kihasználtság (MRU) csökken, miközben a GPU aktív kihasználtság emelkedik. Más szóval az erőforrások párhuzamosítása és a hatékony skálázás infrastrukturális kihívás marad.
Összegzés
ENPIRE bemutat egy módszert, amellyel fizikai robotok önállóan finomíthatják politikáikat zárt kísérleti ciklusokban automatikus kiértékeléssel és visszaállítással. A bemutatott hardverkonfigurációk mellett a kutatás 99%-os sikerességet mutat bizonyos manipulációs feladatokban, ugyanakkor hangsúlyozza a skálázás és az erőforrás‑kezelés gyakorlati korlátait. A megközelítés ízelítőt ad abból, hogyan nézhetne ki, ha fejlett ügynökök megpróbálnák a fizikai világban is önfejlesztésre használni a robotokat, de a jelenlegi példák inkább ígéretesek, mint meghatározó áttörések.



