OpenAI legnagyobb GPT-5.6 változata, a Sol 7,8%-os eredményt ért el az ARC-AGI-3 nevű benchmarkon. A szám először szembetűnően alacsonynak tűnik, különösen annak fényében, hogy emberek általában több mint 90%-ot érnek el ezen a teszten. Ugyanakkor a 7,8% relatív előrelépés is: három hónappal korábban a GPT-5.5 csupán 0,43%-ot ért el, míg korábban az Opus 4.8 modell 1,5%-ot szerzett.
Mi az ARC-AGI-3 és miért számít
Az ARC-AGI-3 egy olyan feladatsor, amely elsőre emberi szemmel egyszerűnek látszik, de a létrehozója, François Chollet szavaival „fluid, not crystallized” jellegű intelligenciát igényel — vagyis a tanult rutinok helyett a kontextusból, ismeretlen helyzetekből gyorsan kiolvasható, alkalmi problémamegoldást. A benchmark célja olyan feladatokat adni, amelyek „out of distribution” helyzetek: a megoldáshoz nem elég a korábbi, nyelven alapuló tanulás vagy egyszerű memorizálás.
Mit mutat Sol eredménye?
A csapat hangsúlyozta, hogy nem csak a pontszám vagy az energiahatékonyság érdekes (az értékelés maximális „reasoning effort” beállításon közel 20 000 dollárba került), hanem a modell problémamegoldó jellegzetességei. Kulcspontok:
- Sol elsőként igazoltan megoldott egy ARC-AGI-3 feladatot a frontier modellek közül; a siker oka nem az általános végrehajtás javulása, hanem hogy a modell képes először helyesen orientálódni egy új környezetben.
- A Sol erőssége a jelenetértés: gyakran felfedezi a játék alapmechanikáját ott, ahol más modellek tévednek.
- Amikor Sol hibázik, a hiba jellemzően a tervezésben vagy a végrehajtásban jelenik meg, nem a percepcióban; azaz a „észlelés” sokszor megvan, de a hosszabb következtetések összeállítása hiányzik.
Egy konkrét példa: Sol felfedezett egy bonyolult mechanikát az LP85 jelzésű pályán, ahol a játékelemeket „parkolni” kell, amíg szükség van rájuk. A riportban szereplő leírás: “The horizontal tracks are independent. Park the lower color-11 tile one step right, then the vertical loop can move the upper tile without disturbing it. ACTION6 48 37”.
Miért képez ez paradox helyzetet?
A paradoxon három részből áll:
- A 7,8% emberi mércével alacsony: egy átlagos ember viszonylag könnyen kiismeri a szabályokat és >90%-ot ér el.
- A 7,8% AI-viszonylatban jelentős ugrás: a GPT-5.6 húszszor jobb, mint a GPT-5.5 (0,43%), és mérföldkőként értékelhető az ARC-AGI vonalon, miközben GPT-5.6 kiemelkedően jól teljesít az ARC-AGI-1 és ARC-AGI-2 teszteken (90%+), és alacsony feladatköltséggel jár.
- A benchmark maga különösen informatív: ha a legjobb modellek egyszerre tűnnek jól teljesítőnek más feladatokban, de ilyen alacsony abszolút értéket hoznak egy emberhez képest egyszerűnek tűnő játékban, akkor felmerül, hogy mi az, ami konkrétan nehéz az AI számára a „fluid intelligence” kategóriában.
Következtetések és nyitott kérdések
A Sol eredménye arra utal, hogy a jelenlegi nagy nyelvi modellek — még ha képesek is saját további tanítására és nagyon összetett matematikai problémák kipróbálására — másfajta nehézségekkel küzdenek, amikor előre nem definiált, új szituációkban kell gyorsan és hatékonyan orientálódniuk. A szerző rámutat: a további fejlődés inkább a „scaffolding”, azaz a tervezés és memória támogatása által érhető el, nem pusztán magasabb „intelligencia” mértékével.
Az ARC-AGI fejlesztői már dolgoznak az ARC-AGI-4-en, ami kérdéseket vet fel: hány iteráción keresztül lehet új, emberi számára könnyű, AI számára nehéz feladatokat tervezni? Milyen további mérőszámok szükségesek az AGI (általános mesterséges intelligencia) valódi megítéléséhez? Amíg ezekre nincs válasz, a GPT-5.6 Sol eredménye egyszerre jelent előrelépést és emlékeztetője annak, hogy még messze vagyunk az emberi szintű, széleskörű „fluid” intelligenciától.
A szerző személyes megjegyzése szerint bár nem tartja az AGI-t mostani állapotában megvalósultnak, örömtelinek találja, hogy a Sol elkezd „kutatni át a ködön” az ő kedvenc, fluid-intelligenciát vizsgáló feladatán.



