Modellbevezetés

Mesterséges intelligenciával generált szöveg

OpenAI GPT-6 Astra: automatizált AI-mérnök, amely állítás szerint kevesebb mint 6 dollár/óra költséggel működik

A főszereplő az OpenAI által bemutatott GPT-6 Astra, amelyet a cikk szerint ma dobtak piacra és amely a Stargate és lightly looped architektúrákra épül.

OpenAI GPT-6 Astra: automatizált AI-mérnök, amely állítás szerint kevesebb mint 6 dollár/óra költséggel működik

OpenAI ma bemutatta a GPT-6 Astra modellt. A cég állítása szerint az Astra sok mértékben jobban teljesít, és a korai összehasonlítások szerint egyes nehéz benchmarkokon tisztán megelőzte a Fable 5.1-et: például a FrontierMath legnehezebb verzióin 97,6%-os pontszámot, az ARC-AGI-3-on pedig 99,9%-ot ér el.

Mit állítanak a korai tesztelők?

Egy csapat, amely korai hozzáférést kapott és több mint 20 milliárd tokent futtatott az Astrával, azt írja, hogy a modell egy újfajta, „AI Engineer” képességű osztályba tartozik. A tesztelők szerint az Astra képes:

  • modellek kiválasztására és betanítására,
  • adatok címkézésére, beleértve aktív tanulási ciklusok támogatását,
  • feldolgozó csővezetékek (pipelines) megtöltésére és fenntartására,
  • naplózás instrumentálására és értelmezésére,
  • rendszerek telepítésére és hibakeresésére egyetlen futtatásból,
  • alügynökök (subagents) indítására, értékelésére és koordinálására, ideértve más modelleket futtató ügynököket is,
  • többmilliárd tokenen át tartó koherencia megtartására egyetlen ügynök szálban.

A beszámoló szerint a tesztelők számos gyakorlati feladaton próbálták ki az Astrát: belső eszközfejlesztésen, személyes weboldal újratervezésén, GitHub+Vercel helyettesítők részleges megvalósításán, játék-AI képzésén, pénzügyi takarításokon és egyéb projektekben.

Költség és teljesítmény: hogyan jött ki a 6 dollár/óra szám?

A tesztelők mérése szerint Astra 33 token/s feldolgozási sebességet ér el egy feltételezett maximális 50 USD / millió token árazás mellett, ami a számításuk szerint körülbelül 6 USD/óra üzemeltetési költséget jelentett bizonyos, nem párhuzamosított használati forgatókönyvekben. A csapat megjegyzi, hogy az Astra tokenhatékonyabbnak bizonyult, mint a Sol és a Fable, amit az Artificial Analysis csapat is függetlenül megerősített.

Ugyanakkor a beszámoló hangsúlyozza: ha az Astrát magasabb párhuzamosítással (Ultra mód) futtatják, a költségek jóval meghaladhatják a 6 USD/órát, mivel a modell nagyon hatékonyan képes több feladatot párhuzamosan végezni. A tesztelők például körülbelül 100 USD-t költöttek két nap alatt a kísérletek futtatására.

Benchmarkok, demonstrációk és nyilatkozatok

A bemutató és sok demo tipikus felhasználási esetekre koncentrál: számítógép-használat, játékok (például Pokémon), Blender-munkafolyamatok, valamint tudományos és kiberbiztonsági benchmarkok. A publikusan idézett személyek közül Greg („AGI is here”) és Jakub („finally the Automated AI Research Intern”) lelkes megjegyzései is szerepelnek a közleményben; a tesztelők azonban óvatosan jelzik, hogy ők maguk nem kívánnak AGI-következtetéseket megfogalmazni.

Általános következtetések és további megjegyzések

A korai beszámoló szerint az OpenAI olyan modellt készített, amely képes jelentős részben automatizálni az AI-mérnöki munkát. A szerzők arra biztatnak, hogy a fejlesztők és csapatok tanulják meg kihasználni az Astra- és Fable-osztályú modellek képességeit, ugyanakkor figyelmeztetnek a költségek párhuzamos futtatásból adódó növekedésére.

A cikk megemlíti továbbá, hogy hasonló vizsgálatokat végeznek más nagy modellekkel, például Grokkal és Fable-lal, és feltételezik, hogy az itt leírt ügynöki kódolási minták a késői 2026-os frontier modellekre általánosan érvényesek lehetnek. A szerzők jelzik, hogy a tesztelési jegyzet folytatásra vár, és később részletesebb eredményeket közölnek.


Jegyzetek:

  • A cikk forrása szerint a mérések és tapasztalatok a tesztelők előzetes vizsgálatain alapulnak; a bemutató hivatalos rendszerkártyája további részleteket tartalmazhat.
  • Minden név az eredeti formában szerepel: GPT-6 Astra, OpenAI, Fable 5.1, FrontierMath, ARC-AGI-3, SAM, Sol, Artificial Analysis, Spark 1.3, Grok.