OpenAI mérnökei azt találták, hogy két, a ChatGPT‑ben és a Codexben használt Responses API‑beállítás — a privát (retained) érvelés megtartása és a kontextus tömörítése (compaction) — jelentősen javította a GPT‑5.6 Sol teljesítményét az ARC‑AGI‑3 benchmarkon. A modell az ARC‑AGI‑3 nyilvános feladatsorán az eredeti, hivatalos harnesssel 13.3%-os Relative Human Action Efficiency (RHAE) értéket ért el; ugyanazon feladatsoron a retained reasoning és compaction engedélyezésével ez az érték 38.3%-ra emelkedett. Ugyanakkor az output tokenek száma nagyjából hatszoros csökkenést mutatott.
Mi az ARC‑AGI‑3 és mi mérhető vele?
Az ARC‑AGI‑3 egy olyan benchmark, amely 2D-s puzzle játékokon keresztül vizsgálja, hogyan tanulnak és következtetnek az ügynökök ismeretlen környezetben. A játékos ügynöknek fel kell fedeznie a játékszabályokat és működést explicit utasítás nélkül; a publikus demók közül 25 kipróbálható az arcprize.org/tasks oldalon. A benchmark metrika, a Relative Human Action Efficiency (RHAE), a modell teljesítményét egy emberi alaphoz viszonyítja; a hivatalos játékmenet‑naplók alapján a cikk becslése szerint az átlagos emberi tesztelő körülbelül 48%-ot ért el.
Mi volt a probléma az eredeti harnesssel?
Az ARC szervezői szándékosan egyszerű, eszközöktől és különleges funkcióktól mentes harness-t használnak, hogy jobban láthatóvá tegyék a modellek hiányosságait és igazságosabb összehasonlítást biztosítsanak. Az OpenAI csapata azonban két technikai döntést azonosított a hivatalos harnessben, amelyek nagyban rontották a GPT‑5.6 Sol teljesítményét:
- A modell minden lépés után elveszítette a „privát érvelést”: a belső gondolatok, tervek és köztes következtetések nem maradtak meg, így minden akció előtt a modellnek újra kellett értelmeznie a játékot.
- A harness gördülő trimmelést (rolling truncation) alkalmazott: amikor a kontextus hossza meghaladta a küszöböt (az ARC megvalósítása 175 000 karakterre tett korlátot), a legrégebbi üzeneteket törölték. Így a modell nem csak a gondolatait veszítette el, hanem a korábbi akciókra és megfigyelésekre vonatkozó emlékeit is.
Ezek a tényezők együtt megmagyarázzák, miért tűnt úgy, hogy GPT‑5.6 Sol „lassan gondolkodik” és nem tanul hatékonyan játék közben.
Hogyan változtattak a beállításokon?
OpenAI a Responses API‑t használva módosította az ARC‑AGI‑3 harness megvalósítását, hogy jobban tükrözze a ChatGPT és a Codex üzembe helyezési környezetét. Két fontos beállítást alkalmaztak:
-
Retained reasoning: a korábbi, privát érvelés (a modellek belső gondolatai, mielőtt választ adnak) megtartása a párbeszéd történetében, ha a hívásoknál a korábbi response ID átadásra kerül. Ennek eredményeként a modell nem volt kénytelen minden lépésnél újra felépíteni a teljes értelmezést.
-
Compaction: a rolling truncation helyett tömörítés alkalmazása, amely a hosszú kontextusokat sűríti úgy, hogy megőrizze a lényegesebb információkat ahelyett, hogy egyszerűen törölné a legrégebbi részeket. Az ARC harness eredetileg 175 000 karakteres limit mellett törölte a legrégebbi üzeneteket; a Responses API‑ban a compaction tokenalapú (és a tesztekben 175 000 tokenes limitet említettek, ami a szóközök miatt közel áll az eredeti karakterkorláthoz a játékszövegek esetén).
Milyen hatásai voltak a változtatásoknak?
A retained reasoning és a compaction együtt két látható hatást eredményezett:
- A GPT‑5.6 Sol kevesebb időt töltött „gondolkodással” akciónként, mert nem kellett minden körben nulláról értelmeznie a játék állapotát.
- A modell hatékonyabban tanult hosszabb játékok során, mert meg tudta őrizni korábbi terveit és következtetéseit, és így koherens stratégiákat tudott végrehajtani.
Mindezek következtében a GPT‑5.6 Sol (max) körülbelül háromszorosára növelte az RHAE pontszámát, miközben a kimeneti tokenek száma hatszoros csökkenést mutatott a publikus feladatsoron.
Mi a tanulság az értékelésekhez és fejlesztéshez?
A kísérlet arra emlékeztet, hogy az evalok ritkán mérik a modelleket teljesen izoláltan: az eredmények erősen függenek a kevésbé látható döntésektől, mint az API‑beállítások, a harness‑dizájn vagy a promptolás. OpenAI tapasztalata szerint többször előfordultak alacsony publikus eredmények, amelyek mögött végül a generikus, érvelés‑üzeneteket eldobó harness állt.
OpenAI javaslata API‑fejlesztők számára, hogy a saját rendszereikben maximalizálják a teljesítményt, azonos beállításokat használjanak, mint amelyeket a ChatGPT és a Codex esetén alkalmaznak: megtartott belső érvelés és kontextus‑tömörítés. Amennyiben modelleket hasonlítunk, érdemes olyan evalokat választani, amelyek hasonló beállításokkal futnak, mert ezek jobban tükrözik a valós alkalmazási környezetet.
Köszönet és kipróbálás
OpenAI megköszönte az ARC‑nak az évek óta végzett munkát az AGI értékelésében, és azt, hogy ARC elemzése inspirálta ezt a vizsgálatot. Aki szeretné kipróbálni, maga is megpróbálhatja a modelleket az arcprize.org/tasks oldalon található publikus játékokban.
Lényeges számok: GPT‑5.6 Sol RHAE a publikus ARC‑AGI‑3 feladatsoron: 13.3% (hivatalos harness) vs. 38.3% (retained reasoning + compaction). Emberi átlag becsült RHAE: ~48%. Kontextuskorlát a tesztben: 175 000 (eredetileg karakter, OpenAI megvalósításában token). Output tokencsökkenés: kb. 6x.



