Eszközök

Orchard: nyílt, skálázható keretrendszer ügynökalapú mesterséges intelligenciához

A Microsoft Research bemutatta az Orchard nevű nyílt forráskódú keretrendszert, amely az Orchard Env környezet-szolgáltatásra épül és célja az ügynökalapú mesterséges intelligencia skálázható és költséghatékony kutatása.

Orchard: nyílt, skálázható keretrendszer ügynökalapú mesterséges intelligenciához

Az Orchard egy nyílt forráskódú keretrendszer, amelynek középpontjában az Orchard Env áll: egy könnyű, Kubernetes-alapú környezet-szolgáltatás, amely újrafelhasználható, izolált komponenseket biztosít ügynökök tanításához és értékeléséhez különböző feladatkörnyezetekben. A rendszer célja, hogy megkönnyítse az ügynökalapú kutatást skálázhatóan és költséghatékonyan, úgy, hogy a kutatók és fejlesztők ugyanazokat a környezeteket, adatszállítmányokat és értékelési munkafolyamatokat használhassák több feladatra és ügynökrendszerre.

Miért van szükség erre?

A korszerű ügynökalapú rendszerek többnyire zárt, egyedi infrastruktúrát igényelnek: speciális homokozókat, zárt tréningcsöveket és kizárólagos adatkészleteket, amelyekhez sok kutató nem fér hozzá, és amelyeket nehéz reprodukálni. Az Orchard ezt a hiátust próbálja áthidalni azzal, hogy a futtatókörnyezetet külön, újrafelhasználható szolgáltatásként kezeli, nem pedig egyetlen tréningkeretrendszerbe ágyazott komponensként.

Orchard Env — a környezetréteg

Az Orchard Env Kubernetes-re épül, és képes párhuzamosan létrehozni, kezelni és eltávolítani ezreket izolált komponenseket. A szolgáltatás terve lehetővé teszi, hogy ugyanaz az infrastruktúra különböző feladattípusokat támogasson (például kódolás, webböngészés, eszközhasználat) és különböző ügynökrendszereket, valamint az edzés és értékelés különböző szakaszait (adatdestillációtól a megerősítéses tanulási rolloutokig).

Fontos előny, hogy Orchard képes ügynököket közvetlenül valós telepítési "harness"-ekben tanítani: a rendszer könnyű proxyja rögzíti a harness saját modellhívásait tanítóadatként, miközben minden rollout külön konténerben fut. Így az ügynököt end-to-end lehet képezni abban a környezetben (például Codex, OpenClaw, ZeroClaw vagy más harness), amelyben végül üzemelni fog, csökkentve a tréning és a valós futtatás közötti eltérést.

Három domainre szabott recept és az eredmények

A projekt három domain-specifikus tréningreceptet mutat be és tesz közzé, továbbá a hozzájuk tartozó tréningadatokat és értékelési módszereket: Orchard-SWE (software engineering), Orchard-GUI (browser agent) és Orchard-Claw (personal assistant).

Orchard-SWE — szoftvermérnöki ügynökök

A szoftvermérnöki feladatok összetettek: többlépéses következtetést, eszközhasználatot és hibakezelést igényelnek valós kódbázisokon. Az Orchard-SWE a Mini-SWE-Agent keretrendszerre épül, és a széles körben használt SWE-bench Verified benchmarkon értékelik, amely a modellek kódnavigációs, diagnosztikai és javítási képességeit méri.

A tréninghez 107 000 ügynökinterakciót desztilláltak két fejlett, nyílt súlyú modellből (MiniMax-M2.5 és Qwen3.5-397B), GitHub Issues széles körét lefedve. A finomhangolásnál kredit-hozzárendeléses felügyelt finomhangolást alkalmaztak: a részben sikeres próbálkozások produktív részeit is megtartják, nem dobják ki azokat, így növelve a hasznos tanítóadathalmazt.

A megerősítéses tanulás fázisa ritka sikervisszajelzésekre támaszkodik (általában csak a végső patch sikerességét látja a rendszer). Először Balanced Adaptive Rolloutot alkalmaztak a ritka jelzések hatékony felhasználására, majd két "dense reward" technikát vezettek be: on-policy distillációt, ahol egy erősebb tanármodell lépésenként értékeli a döntéseket, és egy process reward modellt, amely a jó problémamegoldási folyamatot (például tesztek írása, javítás ellenőrzése, meglévő viselkedés validálása) díjazza a végső teszteredménytől függetlenül.

Végül egy értékmodellt (value model) tanítottak korábbi rolloutok alapján a jelöltek újrarangsorolására. A 20 korábbi kísérletből származó pályákból egy kompakt, körülbelül 4 milliárd paraméteres értékmodellt képeztek, amely több megoldási javaslatot pontoz és a legjobbat választja.

Ezekkel a technikákkal az Orchard-SWE a 61,4%-ról 69,1%-ra emelkedett SWE-bench Verifieden a Balanced Adaptive Rollouttal, és 69,7%-ra a dense-reward módszerekkel — ez új állásfoglalást jelent a hasonló méretű (nagyjából 3 milliárd aktív paraméter) nyílt modellek között. Az értékmodell újrarangsorolással 73,0%-ot ér el, közelítve a több mint tízszer nagyobb, csúcskategóriás rendszerek teljesítményéhez.

Orchard-GUI — webböngésző ügynök

A webböngés külön kihívásokat hoz: vizuális elrendezések értelmezése, dinamikus interfészekkel való interakció és nyitott feladatok megoldása természetes nyelvi utasítások alapján. Az Orchard-GUI egy 4 milliárd paraméteres vision-language modellt tanít böngészőügynökké, viszonylag kis felügyelt adatmennyiséggel: 400 desztillált demonstráció és 2 200 nyitott végű tréningfeladat kombinációjával.

Ennek ellenére a modell erős eredményeket ért el több web-navigációs benchmarkon: 74,1% a WebVoyageren, 67,0% az Online-Mind2Weben és 64,0% a DeepShopon, átlagosan 68,4% teljesítményt mutatva. Ez az eredmény az egyik legerősebb open-source GUI ügynökké helyezi az Orchard-GUI-t, miközben versenyképes a nagyobb, zárt rendszerekkel.

Orchard-Claw — személyi asszisztens ügynökök

A termelékenységi feladatok (e-mailek olvasása és megfogalmazása, naptárkezelés, információkeresés, eszközök összehangolása) gyakori alkalmazási területei az ügynökalapú AI-nak. Az Orchard-Claw mindössze 200 szintetikus feladattal képez egy személyi asszisztens ügynököt. A Claw-Eval benchmarkon, amely valós termelékenységi munkafolyamatokat fed le, az ügynök 59,6%-os sikerességet ért el legfeljebb három próbálkozás esetén; ez az arány 73,9%-ra nő, ha erősebb ZeroClaw harness-szel párosítják.

Mivel az Orchard képes az ügynököket valódi telepítési harness-ekben képezni, az Orchard-Claw több harness-ben (ReACT, ZeroClaw, OpenClaw, Codex) tanult egyszerre. A valódi harness-ben történő tréning jelentősen növeli a megbízhatóságot: például a Codex harness alatt a tréning előtti, betanítatlan modell 18,6%-os sikeressége 51,5%-ra nő az Orchard tréning után.

Következmények és további irányok

Az Orchard eredményei hangsúlyozzák, hogy az environment réteg számít. Az infrastruktúra nyitottsága, könnyűsége és újrafelhasználhatósága csökkenti az ügynökalapú kutatás költségét és a belépési korlátokat: csapatoknak nem kell minden alkalommal nulláról új felületeket építeniük vagy zárt felhőszolgáltatásoktól függniük.

A jövőben ígéretesnek látnak egy olyan irányt, amely a tréning során szerzett tapasztalatok újrafelhasználását támogatja, így az ügynökök „tapasztalata” felhalmozódhat és minden újabb generáció tovább tud építeni a korábbiak tudására (például értékmodellekbe desztillálva). Az Orchard-GUI adat-hatékonysága azt sugallja, hogy nagyobb méretű webügynökök is kiképezhetők lehetnek kézi adatkészletek nagy mennyisége nélkül.

A teljes Orchard-stack — az environment szolgáltatás, tréningcsövek és adatbázisok — közzétételével a készítők azt remélik, hogy szélesebb kutatói közösség gyorsabban építhet és tanulmányozhat nyílt ügynökalapú rendszereket.

Elismerések

Köszönetet mondanak a Microsoft Research és a közreműködő intézmények csapatainak, valamint az open-source közösségnek, amelyek benchmarkjai és eszközei hozzájárultak a kutatáshoz.