Kutatás

OSWORLD 2.0: hosszú távú számítógép‑használatra képes AI‑rendszereket mérő új benchmark

OSWORLD 2.0 egy nemzetközi kutatócsoport által fejlesztett benchmark, amely azt méri, mennyire képesek az AI‑rendszerek többórás, többlépéses számítógépes feladatokat elvégezni.

OSWORLD 2.0: hosszú távú számítógép‑használatra képes AI‑rendszereket mérő új benchmark

Több egyetem és ipari szereplő közreműködésével megjelent az OSWORLD 2.0, egy új teljesítmény‑mérőeszköz, amely azt vizsgálja, mennyire képesek az AI‑rendszerek több lépéses, többprogramos feladatokat elvégezni valódi számítógépes környezetben. A projektben részt vettek többek között a University of Hong Kong, a University of California at San Diego, a Columbia University, a University of California at Santa Barbara, Mila, Snorkel AI, a University of Wisconsin, Alibaba Qwen, The Ohio State University, Simular és NeoCognition.

Mit mér az OSWORLD 2.0?

Az OSWORLD 2.0 összesen 108 hosszú horizontú feladatot tartalmaz, köztük 31 önállóan üzemeltetett weboldalt. A kutatók szerint minden feladat „egy önálló, end‑to‑end munkafolyamatként” van definiálva: egy ügynöknek magas szintű felhasználói céllal, reális bemenetekkel, állapotot megtartó számítógépes környezettel és pontozható végső állapottal kell azt teljesítenie. A szerzők kiemelik a kiválasztási kritériumot is: a feladatok 69,6%-át egy jártas ember többet mint egy óra alatt tudja elvégezni.

A 2.0 változat jelentősen összetettebb, mint az OSWORLD 1.0: míg az 1.0 medián feladatideje körülbelül 2 perc volt, az OSWORLD 2.0 medián feladata egy ember számára nagyjából 1,6 órát vesz igénybe — ez közel 48‑szoros növekedés.

Bővített szoftverkészlet és feladattípusok

Az OSWORLD 1.0‑hoz képest a 2.0 jóval nagyobb, valódi alkalmazásokat és szolgáltatásokat kínáló környezettel érkezik. Az alapban rendelkezésre álló szoftverek köre kiterjed többek között a Slackre, LinkedInre, Shortcutra, REAPERre, MuseScore‑ra, WPS‑re, GitLabre, Overleafre, LabPlotra, Zotero‑ra és AWS‑szolgáltatásokra, valamint olyan webes felületekre, amelyek szakmai szolgáltatásokat — például kárigény, vízumkérelem vagy konferencia‑adminisztráció — modelleznek. Korábban az 1.0‑ban voltak olyan beépített programok is, mint a LibreOffice, GIMP, VLC, Thunderbird, VS Code és Chrome.

A feladatkategóriák a következők köré csoportosulnak: dokumentum‑előkészítés, szoftver‑ és adatbázismunka, pénzügyi/operációs elemzés, adminisztratív támogatás, értékesítés és ügyfélszolgálat, grafikai prezentációk és más, többprogramos munkafolyamatok.

Jelenlegi teljesítmény — gyenge eredmények

A kutatók mérései szerint a jelenlegi ügynökök megbízható számítógép‑használatban még messze elmaradnak az emberi szinttől. A legjobb beállítással (Claude Opus 4.8 maximális gondolkodással és kötegelt eszközhívásokkal) a bináris pontosság csak 20,6%, a részleges pontszám alapú pontosság pedig 54,8% volt. A teljesítmény élesen romlik, ahogy a feladatok hosszabbakká válnak; különösen nehézséget okoz az ügynököknek a rejtett állapot visszaállítása, sok tétel követése, ellentmondó információk feloldása és változó követelményekhez való alkalmazkodás.

A szerzők emlékeztetnek arra, hogy az OSWORLD 1.0 esetében is jelentős javulás következett be az időben: 2025 júliusában a legjobb modellek körülbelül 30%-ot értek el, míg 2026 júniusában a MiniMax M3 modell már körülbelül 75%-ot ért el. Hasonló felívelésre számítanak az OSWORLD 2.0 esetén is.

Miért számít ez?

A számítógép‑használat alapvető készség ahhoz, hogy AI‑rendszerek gazdasági értéket teremtsenek és többféle tudományos feladatot végezzenek el. Sok valós feladat nem oldható meg pusztán szöveg vagy egyetlen kódrészlet előállításával: gyakran többféle szoftveren és formátumon keresztül kell láncolni műveleteket, vagy hálózaton át továbbítani eredményeket, hogy más programok azt felhasználhassák. Az ilyen benchmarkok, mint az OSWORLD 2.0, jó proxy‑ként szolgálnak arra, hogy felmérjük: az AI‑rendszerek mennyire képesek összetett, sokféle szoftvert igénylő, emberek által órákig végzett munkafolyamatok elvégzésére. A jelenlegi eredmények azt mutatják, hogy a rendszerek már versenyképesek olyan feladatokban, amelyek szűk eszközkészletet és emberi perceket igényelnek, de még ki kell derülnie, milyen gyorsan válhatnak megbízhatóvá több órás, sokrétű munkában.

Hivatkozások

A kutatók az OSWorld 2.0: Benchmarking Computer‑Use Agents on Long‑Horizon Real‑World Tasks című dokumentumban részletezik az adatbázist és az eredményeket.