A DiG-bench (Discovery in Games) egy új, 70 játékot tartalmazó benchmark, amelynek célja felmérni, mennyire képesek mesterséges intelligenciák felfedezni a környezetükben rejlő, ki nem mondott szabályokat saját felfedezőkészség és kíváncsiság révén. Minden játék önálló, kis, szabályrendszerrel rendelkező világ: a szabályok és a célok rejtve vannak, és csak az interakciók során deríthetők fel — hasonló megközelítést alkalmaz a vizuális ARC játékcsalád is.
A projekt hivatalos oldala (digbench.ai) több játékot elérhetővé tesz kipróbálásra.
Mi mérhető a DiG-bench segítségével?
A benchmark központi kérdése, hogy a játékos (ember vagy modell) mennyire képes észrevenni azokat a meghatározó mechanikákat, amelyek sikert vagy kudarct okoznak. A játékok kipróbálása során a szereplő megfigyeli, hogyan változtatják meg a cselekvések a környezetet, és ezen keresztül tárja fel a győzelemhez szükséges szabályszerűségeket. A szerzők feltevése szerint, aki ezekben a játékokban jó, az képes fontos információt kiszűrni ismeretlen helyzetekben és ennek megfelelően frissíteni a feltételezéseit (priors).
Kik készítették?
A benchmark szerzői között olyan intézmények kutatói szerepelnek, mint Thinking About Thinking, University of Oxford, Princeton University, King Abdullah University of Science and Technology, Swiss AI Lab, Inria és MIT. Az egyik szerző Juergen Schmidhuber, akit a terület korai, kreatív szereplőjeiként emlegetnek.
Fontos jellemzők és tervezési döntések
- Szövegalapú: a játékok natív módon támogatják a nyelvi modelleket, és jellemzően elég rövidek ahhoz, hogy a legtöbb nyom megtalálható legyen a mai csúcsmodellek kontextusablakában.
- Kézzel készítettek és részben privátak: a játékokat emberi szakértők tervezték, és a 70-ből a többség privát marad, hogy ne legyenek tréningadatok a rendszerek számára.
- Legyőzhetők, de nehezek: minden játékot legalább egy emberi játékos megoldott, ugyanakkor a beszámolók szerint sok játék jelentősen nehéznek bizonyult.
- Sokféle készség: a teljes készlet megoldása különböző stratégiákat és kompetenciákat igényel.
- Kísérleti mód: opcionális kísérletezési mód áll rendelkezésre, amely csökkenti az akciók lépésszámára vonatkozó korlátok szigorát.
- Megnyugtatóan nehéz: a játékok elég kihívást jelentenek ahhoz, hogy ma elérhető csúcsmodellek ne tudják egységesen megoldani őket.
Hogyan teljesítenek az AI rendszerek?
A DiG-bench hét nehézségi szintre oszlik (Tier 1 a legkönnyebb, Tier 7 a legnehezebb). A 70 játékból 21 játékot tettek közzé nyilvánosan, a többit visszatartják.
A játékok többszintűek, és az egyes lépésekben elérhető akciók száma 2-től 34-ig terjed.
A tesztet futtató modellek teljesítménye a következő megfigyeléseket hozta:
- Opus 5 és Fable 5 (Claude Code használatával) teljesítettek a legjobban összességében.
- Csak az Opus 5 és a Fable 5 volt képes győzelmet elérni Tier 7-ben (jegyzet a forrásban: 0.2 pont/eredmény erre a szintre).
- Opus 5, GPT-5.5 és Kimi K3 bizonyos Tier 6 feladatokat is meg tudtak oldani, különösen ha kiegészítő eszközhöz vagy „harness”-hez fértek hozzá (például Claude Code).
- GLM-5.2 és Gemini 3.1 Pro képesek voltak néhány szintet teljesíteni Tier 4-ben.
A szerzők megjegyzik, hogy a benchmark jelenleg komoly kihívás marad a legfejlettebb modellek számára.
Miért számít ez?
A DiG-bench olyan képességet próbál izolálni és mérni, amely előfeltétele lehet a kreativitásnak: az autonóm felfedezést — vagyis azt, hogy a modell önállóan, dokumentálatlan szabályszerűségeket tárjon fel új helyzetekben. A bemutatott eredmények szerint egyes élvonalbeli modellek már képesek látványos felfedező teljesítményekre, ugyanakkor még lemaradnak az emberi játékosok mögött (a forrás például említ egy 20%-os sikerességi rátát Tier 7-ben, szemben az egyes emberek 100%-os megoldásaival bizonyos játékokon).
A forrás szerzője megelőlegezi, hogy a DiG-bench szerinti emberi szintű teljesítményt 2027 közepére érhetjük el; szerinte ezen a ponton a rekurszív önjavulás mechanizmusai valószínűleg erőteljesebben aktiválódhatnak. Ez a jóslat szerzői vélemény, nem a benchmark mérése.
Hol találhatóak a részletek és a játékok?
A projekt dokumentációja, a GitHub és a részletes PDF elérhetők a DiG-bench anyagai között. A játékok kipróbálhatók és a ranglista megtekinthető a hivatalos weboldalon: digbench.ai.
Összegzés
A DiG-bench egy strukturált, kézzel tervezett próbapad a felfedezés és kreatív intuíció mérésére szöveges, interaktív környezetekben. Bár néhány csúcstechnológiás modell már mutat teljesítményt a könnyebb szinteken, a benchmark jelenleg még tartogat kihívásokat, és segít feltérképezni, hol tartanak a rendszerek abban, hogy autonóm módon fedezzenek fel ismeretlen szabályokat.



