Az NVIDIA Labs bemutatta a NOOA (NVIDIA Labs Object-Oriented Agents) nevű, nyílt forráskódú kutatási előnézetet, amely azt a megközelítést képviseli, hogy az ügynökök elsődleges reprezentációja Python-objektum legyen. A keretrendszer célja, hogy a modellt körülvevő „hámot” — kontextuskezelés, műveletvégrehajtás, állapotkezelés és a feladat befejezésének döntése — szabványos, típusos, kódközpontú felületté tegye. A NOOA referenciaimplementációt, memóriarendszert, képességteszteket és mérőeszközöket tett közzé, hogy a közösség reprodukálhassa és továbbfejleszthesse az eredményeket.
Az alapötlet: az ügynök mint Python-objektum
A NOOA megközelítése egyszerűsíti az ügynökfejlesztést: egy ügynök egyetlen Python-osztály. Az osztálymezők az ügynök állapotát jelentik, a metódusok a képességeit, a docstringek szolgálnak promptként, a típusannotációk pedig szerződésként érvényesülnek. Olyan metódusok, amelyek törzse helyén három pont (…) áll, futásidőben egy LLM által vezérelt hurkkal töltődnek ki; a normál Python-metódusok determinisztikusak.
Ez a modell lehetővé teszi, hogy az ügynökök hagyományos szoftverfejlesztési eszközökkel kezelhetők legyenek: diffelhetők, kódreview-zhatók, unit-tesztelhetők, nyomkövethetők, verziózhatók és refaktorálhatók—egyszerre emberi és AI kódoló ügynökök által.
Hat meghatározó interfész-ötlet
A NOOA architektúrája hat, a modell felé néző tervezési elvet azonosít, amelyek mérhetően befolyásolják a teljesítményt:
- Típusos bemenet/kimenet: a hívások típusos argumentumokat és validált visszatérési értékeket használnak, nem szabad szöveget.
- Pass by reference: a modell élő Python-objektumokon dolgozik, korlátos, típusos előnézetet látva ahelyett, hogy szövegként kapná vissza az eszközeredményeket.
- Kód akcióként: a modell Python-kód írásával hajt végre műveleteket, kontrollfolyammal és inline metódushívásokkal.
- Programozható hurkú mérnökség: az orchestration hurkok sima Python-ként írhatók és módosíthatók fejlesztők vagy maga a modell által.
- Explicit objektumállapot: a tartós, típusos állapot az ügynök objektumán él, nem csupán a beszélgetéstörténetben.
- Modell által hívható hám-API-k: kontextusblokkok és eseménytörténetek olyan API-ként léteznek, amelyeket a modell lekérdezhet és kezelhet.
Memória: az ügynök maga kurátora
A NOOA tartalmaz egy hosszú távú memóriaalrendszert, ahol a memóriát maga az ügynök kezeli modellel hívható eszközökön keresztül: tudatosan ír, lekérdez és javít rekordokat munkája során. Emellett a futó fordulathoz kapcsolódó spontán releváns emlékek automatikusan bekerülnek a kontextusba. A rekordok típusokat, fontossági jelzést és címkéket viselnek; típusos kapcsolatok (például "támogatja", "ellentmond", "származik") hálózatot alkotnak a sík napló helyett. Egy háttér-reflexiós folyamat duplikátumokat egyesít, kapcsolódó rekordokat összekapcsol, epizódokat összegző megállapításokká tömörít, és eltávolítja a már irreleváns információkat.
Minden tartós adat egy ember által olvasható SQLite fájlban tárolódik, amelyet csapatok ellenőrizhetnek, biztonsági menthetnek és áttekinthetnek. A tárolt emlékek hivatkozhatnak élő ügynökállapotra, így a tudás friss maradhat; többszörös ügynökök is megoszthatják ugyanazt a tárolót, miközben külön tulajdonjogot tartanak fenn. Az ARC-AGI-3 értékelésben a NOOA memóriaalrendszere +11.8 pont javulást hozott RHAE-ben a fájlalapú jegyzetekhez képest.
Több képesség ugyanazzal a modellel
A NOOA hatékonysága és pontossága több területen is mérhető:
-
Szoftvermérnökség: SWE-bench Verifieden a NOOA 82.2%-ot ért el GPT-5.5 használatával, ami a benyújtáskor meghaladta a közzétett leaderboard SOTA-t (79.2%). Opus 4.6-tal 79.8%-ot ért el egy általános célú, 253 soros ügynökkel, amely nem tartalmazott benchmark-specifikus promptokat.
-
Kiberbiztonság: CyberGym L1-en a NOOA 86.8%-ot oldott meg GPT-5.5-tel; ez az egyik legjobb nyílt forráskódú eredmény, és úgy érték el, hogy hálózati hozzáférés blokkolva volt és minden pályán szabályalapú ellenőrzés futott, tehát az eredmény a kódon való gondolkodásból származik, nem külső keresésből.
-
Általános érvelés: ARC-AGI-3-on egyetlen NOOA ügynök GPT-5.5-tel 50.2% átlagos RHAE-t ért el (a világmodellezés +8.5 pontot javított a hipotézis-alapú alapvonalon; a memória +11.8 pontot a fájlalapú jegyzetekhez képest). A GPT-5.6-sol flottával 85.1%-ot értek el, mindezt felhasználási költség alatt, nagyjából $13.3–$17.85 játékonként, és 19 játékot oldottak meg teljesen a 25-ből.
Hatékonyság: kevesebb token, hasonló vagy jobb teljesítmény
A NOOA nemcsak pontosságot, hanem költséghatékonyságot is nyújt. GPT-5.5-tel a SWE-bench Verifieden 82.2%-ot ért el körülbelül 29 LLM-hívással és ~1.1M tokennel feladatonként. Összehasonlító hámok 66 hívást és 2.2M tokent igényeltek 78.2% eléréséhez, illetve 29 hívást és 1.3M tokent 78.6%-hoz. Tehát közel fele annyi token mellett elérhető paritás vagy jobb eredmény.
Ezt két fő tényező magyarázza:
- Pass by reference: az eszközök eredményei élő Python-változókként kerülnek be a feldolgozásba, nem a kontextusablakba visszaírt szövegként. A modell típusos, korlátos előnézetet lát, miközben a teljes érték az exekúciós környezetben marad élőként.
- Mivel az eredmények referencia szerint áramlanak, NOOA-nak nincs szüksége kontextuskompaktálásra a frontier modellekkel való SWE-Bench megoldáshoz: a medián munkamenetek csúcstokenjei 22–72k között vannak, még ha a modellek 200–400k tokenes ablakokkal dolgoznak is. A transzkriptek hozzáfűződnek és cache-érvényesek maradnak a teljes munkamenet során, tehát nincs szükség összegző passzra.
ARC-AGI-3 részletek és biztonság
Az ARC-AGI-3 egy ismeretlen rácsos játékban helyezi próbára az ügynököt: a szabályokat, célokat és kontrollokat cselekvéssel kell felfedezni. A NOOA példája egyetlen ügynökbe sűríti a DreamTeam társkapcsolatos architektúrát; a világmodell 45 soros képességként él. A játék külön folyamatban fut, az állapotokat és akciókat hozzáfűzhető fájlok cseréjével kezelik.
Versenykörnyezetben, kétórás korláttal a GPT-5.5 flott 50.2% átlag RHAE-t ért el (a világmodellezés +8.5, a memória +11.8 javulást adott). A GPT-5.6-sol flottnál 85.1%-os eredmény és ~ $13.3/játék költség született; mindkét flott maradt $20/játék alatt. A futtatások több rétegű sandboxolással zajlottak: in-process cell guard, per-futtatás OS jogosultságcsökkentés, játékazonosítók anonimizálása és kernel által érvényesített per-cell sandbox. Red-team auditok (18 passz a GPT-5.5 futáson és kilenc-scanner a GPT-5.6-sol futáson) nem találtak szabálysértést az átvizsgált logokban (13,335 és 10,107 vizsgált naplóbejegyzés).
A termelési telepítéshez a NOOA javasolt futtatási környezete az NVIDIA OpenShell biztonságos runtime.
Kiberbiztonsági alkalmazás: sérülékenység-felfedezés
A sérülékenységkeresés különösen kemény próba: a találati munkafolyamat akkor értékes, ha a modell nem csak jelzi, hanem reprodukálható bemenettel bizonyítja a hibát. NOOA-ban a validációs csővezeték megvalósítható egyetlen objektumban: a modell Python-t ír és futtat, amely az ügynök típusos metódusait hívja, így a felfedezés ellenőrzése determinisztikus kapukon megy keresztül (összefoglaló „crash-or-no-crash”, egyezésellenőrzés, reprodukciós futás). CyberGym L1-en a NOOA-vel kiegészített kutatási hám 86.8%-ot oldott meg hálózat nélkül és szabályalapú ellenőrzéssel.
Nyílt kutatási felület a közösség számára
A NOOA célja nem meglévő házak helyettesítése, hanem nyílt, kísérleti felület biztosítása. A keretrendszer, képességtesztek, benchmark-ügynökök és értékelési módszertan közzétételével az NVIDIA lehetővé teszi, hogy csapatok átvizsgálják az ötleteket, leutánozzák az eredményeket, vagy saját projektjeikben adaptálják és továbbfejlesszék azokat. A nyílt implementációk fontosak a biztonsági felülvizsgálat, hozzáférés-ellenőrzés és megfigyelhetőség standard gyakorlataihoz való illeszkedés miatt.
Hol kezdje a közösség
- Olvassa el a technikai jelentést.
- Szerezze be a kódot: keretrendszer, képességtesztek és benchmark-ügynökök elérhetők.
- Futtassa az examples/arc_agi_3 példát a világmodell-megoldóval és a flottakezelővel.
- Biztonságos telepítéshez használja az NVIDIA OpenShellt.
A NOOA tehát egy objektumorientált ügynökhámként mutat alternatívát a modellezés körüli infrastruktúra standardizálására, mérhető előnyöket nyújtva teljesítmény és költséghatékonyság terén több benchmarkon is.



