OpenAI ma bemutatta a GPT-6 Astra modellt. A cég állítása szerint az Astra sok mértékben jobban teljesít, és a korai összehasonlítások szerint egyes nehéz benchmarkokon tisztán megelőzte a Fable 5.1-et: például a FrontierMath legnehezebb verzióin 97,6%-os pontszámot, az ARC-AGI-3-on pedig 99,9%-ot ér el.
Mit állítanak a korai tesztelők?
Egy csapat, amely korai hozzáférést kapott és több mint 20 milliárd tokent futtatott az Astrával, azt írja, hogy a modell egy újfajta, „AI Engineer” képességű osztályba tartozik. A tesztelők szerint az Astra képes:
- modellek kiválasztására és betanítására,
- adatok címkézésére, beleértve aktív tanulási ciklusok támogatását,
- feldolgozó csővezetékek (pipelines) megtöltésére és fenntartására,
- naplózás instrumentálására és értelmezésére,
- rendszerek telepítésére és hibakeresésére egyetlen futtatásból,
- alügynökök (subagents) indítására, értékelésére és koordinálására, ideértve más modelleket futtató ügynököket is,
- többmilliárd tokenen át tartó koherencia megtartására egyetlen ügynök szálban.
A beszámoló szerint a tesztelők számos gyakorlati feladaton próbálták ki az Astrát: belső eszközfejlesztésen, személyes weboldal újratervezésén, GitHub+Vercel helyettesítők részleges megvalósításán, játék-AI képzésén, pénzügyi takarításokon és egyéb projektekben.
Költség és teljesítmény: hogyan jött ki a 6 dollár/óra szám?
A tesztelők mérése szerint Astra 33 token/s feldolgozási sebességet ér el egy feltételezett maximális 50 USD / millió token árazás mellett, ami a számításuk szerint körülbelül 6 USD/óra üzemeltetési költséget jelentett bizonyos, nem párhuzamosított használati forgatókönyvekben. A csapat megjegyzi, hogy az Astra tokenhatékonyabbnak bizonyult, mint a Sol és a Fable, amit az Artificial Analysis csapat is függetlenül megerősített.
Ugyanakkor a beszámoló hangsúlyozza: ha az Astrát magasabb párhuzamosítással (Ultra mód) futtatják, a költségek jóval meghaladhatják a 6 USD/órát, mivel a modell nagyon hatékonyan képes több feladatot párhuzamosan végezni. A tesztelők például körülbelül 100 USD-t költöttek két nap alatt a kísérletek futtatására.
Benchmarkok, demonstrációk és nyilatkozatok
A bemutató és sok demo tipikus felhasználási esetekre koncentrál: számítógép-használat, játékok (például Pokémon), Blender-munkafolyamatok, valamint tudományos és kiberbiztonsági benchmarkok. A publikusan idézett személyek közül Greg („AGI is here”) és Jakub („finally the Automated AI Research Intern”) lelkes megjegyzései is szerepelnek a közleményben; a tesztelők azonban óvatosan jelzik, hogy ők maguk nem kívánnak AGI-következtetéseket megfogalmazni.
Általános következtetések és további megjegyzések
A korai beszámoló szerint az OpenAI olyan modellt készített, amely képes jelentős részben automatizálni az AI-mérnöki munkát. A szerzők arra biztatnak, hogy a fejlesztők és csapatok tanulják meg kihasználni az Astra- és Fable-osztályú modellek képességeit, ugyanakkor figyelmeztetnek a költségek párhuzamos futtatásból adódó növekedésére.
A cikk megemlíti továbbá, hogy hasonló vizsgálatokat végeznek más nagy modellekkel, például Grokkal és Fable-lal, és feltételezik, hogy az itt leírt ügynöki kódolási minták a késői 2026-os frontier modellekre általánosan érvényesek lehetnek. A szerzők jelzik, hogy a tesztelési jegyzet folytatásra vár, és később részletesebb eredményeket közölnek.
Jegyzetek:
- A cikk forrása szerint a mérések és tapasztalatok a tesztelők előzetes vizsgálatain alapulnak; a bemutató hivatalos rendszerkártyája további részleteket tartalmazhat.
- Minden név az eredeti formában szerepel: GPT-6 Astra, OpenAI, Fable 5.1, FrontierMath, ARC-AGI-3, SAM, Sol, Artificial Analysis, Spark 1.3, Grok.



