OpenAI ma bejelentette a GPT‑6 Astra névre keresztelt modellt, amelyet a vállalat a saját közlése szerint eddigi legintelligensebb és leginkább „aligned” (emberi szándékokhoz igazodó) rendszerének nevez. A közlemény szerint az Astra több év kutatásának és fejlesztésének eredménye, és mérhető előrelépéseket mutat a pré‑tréning, a megerősítéses tanulás és az alignment terén.
Hol teljesít kiemelkedően
OpenAI szerint Astra a számítógép‑használat, a böngészés, a szoftvermérnökség, a kiberbiztonság, a tudományos munka és a professzionális feladatok terén áll élvonalban. Konkrét benchmark‑eredmények, amelyeket a cég megosztott:
- FrontierMath Tier 4: 98% (teljes telítettségként említik).
- ARC‑AGI‑3: 99,9%.
- ExploitBench: 100%.
A cég azt állítja, hogy Astra már segített régóta nyitott matematikai problémák megoldásában, valamint új rekordokat állított fel több matematikai és tudományos értékelésen.
Elérhetőség és terjesztés
Astra ma indul korlátozott számú szervezetnél, és az elkövetkező napokban minden ChatGPT Plus, Pro, Business és Enterprise felhasználó számára elérhetővé válik, valamint az OpenAI API‑n, Microsoft Azure‑on és AWS Bedrockön keresztül is. A használat a meglévő előfizetési keretekbe beletartozik; további használathoz kreditvásárlás lehetséges. A fejlesztők számára az API‑ban a modell neve gpt‑6‑astra lesz.
OpenAI API Standard árazásként a közlemény $10/1M input token és $50/1M output token díjakat jelölte; gyors (Fast) mód nagyobb sebességet kínál a kétszeres áron.
Javuló számítógép‑használati képességek és hatékonyság
Astra a gyakorlati számítógép‑használatban — űrlapkitöltés, CRM‑adatok frissítése, naptárkezelés, online kutatás, dokumentum‑ és e‑mail‑összefoglalók, adatelemzés, plotok generálása, weboldalak készítése és frontend QA ellenőrzése — jelentős előrelépést mutat. Az OSWorld 2.0 késleltetés‑szimulációi szerint Astra feladatonként körülbelül 47% rövidebb idő alatt ér el jobb teljesítményt a GPT‑5.6 Solhoz képest (72,6% pontszám nagyjából 40 perc alatt, szemben a GPT‑5.6 Sol 65,7%-ával ~75 perc alatt).
A Codex‑hoz kapcsolódó frissítések tovább gyorsítják a számítógép‑használati munkafolyamatokat: a Mind2Web benchmarkon Astra és a felgyorsított Codex együttese körülbelül 1,9× gyorsabb feladatvégrehajtást ad a GPT‑5.6 Sol élményéhez képest.
Szoftvermérnökség és hosszú távú kontextusmegőrzés
Astra‑ban a Codexhez egy új mechanizmust vezetnek be a kontextus megőrzésére, amikor a kontextusablak telítődik. Ahelyett, hogy többször tömörítené a korábbi munkát (compaction), Astra jegyzeteket tarthat és kereshetővé teszi a korábbi kontextust, így megőrződnek olyan részletek, amelyek egy összegző tömörítés során elvesznének. Ez az experimentális funkció a Codex config.toml konfigurációjában engedélyezhető, és néhány hét múlva alapértelmezett lesz Astra számára.
Tudományos eredmények
OpenAI közlése szerint Astra fontos előrelépést tett a prímek közötti különbségekkel kapcsolatos kérdésekben: az egyik eredmény szerint sikerült a prímek közötti legfelső határt 186‑ra csökkenteni, míg a korábbi legjobb ismert határ 240 volt (Julia Stadlmann javítása után). Emellett Astra javított egy több mint 80 éve változatlan tételben szereplő együtthatón a prím‑résekre vonatkozóan. A vállalat közzétette a bizonyításokat és rövidített gondolati láncokat, valamint ellenőrzési anyagokat mindkét eredményről.
A cég továbbá hangsúlyozza, hogy Astra képes közvetlenül dolgozni speciális szoftverekben adatellenőrzésen és eredményvizsgálaton, ezzel segítve a kutatókat a bizonyítékok értékelésében és további irányok kiválasztásában.
Kiberbiztonsági képességek, kockázatok és korlátozások
OpenAI saját készítésű Saját Felkészültségi Keretrendszere szerint Astra „kritikus” küszöböt ér el kiberképességekben. Astra képes felismerni és fejleszteni zero‑day exploitokat, ami egyszerre hasznos a védekezéshez és növeli a visszaélés kockázatát. A benchmark‑eredmények a következők:
- ExploitBench: Astra 100% (GPT‑5.6 Sol: 78,5%).
- ExploitGym: Astra 42,4% (GPT‑5.6 Sol: 30,3%), kevesebb output token használatával.
- ExploitBench (June–August 2026, belső adatbázis): Astra magasabb tetszőleges kódvégrehajtási arányt ért el, és az értékelés során két korábban ismeretlen zero‑day sérülékenységet fedezett fel; ezeket OpenAI közleménye szerint továbbították a fenntartóknak.
- SRE‑Bench (binaris visszafejtés): Astra 88,0%‑ot oldott meg egy próbálkozásból és 99,2%‑ot négy próbálkozáson belül; GPT‑5.6 Sol eredményei 55,9% és 68,7% voltak.
OpenAI szakértői értékelései azt is mutatták, hogy Astra — védelmi intézkedések nélküli futtatás esetén — képes volt ismeretlen sebezhetőségek kihasználásával tetszőleges kódvégrehajtást elérni keményített böngészőkben és jogosultságnövelő exploitok készítésére keményített operációs rendszerekhez.
A cég hangsúlyozza, hogy az Astra mai változata megtagadja a fejlettebb támadó feladatokat, például bizonyíték‑koncepció (proof‑of‑concept) exploitok létrehozását. OpenAI a Daybreak programon keresztül a közeljövőben tervez kevésbé restriktív, de kontrollált hozzáférési módokat bevezetni a védekező munkafolyamatok támogatására (például sebezhetőség‑ellenőrzés, malware‑analízis, detection engineering).
A kiberképességek növekedése miatt OpenAI további védelmi rétegeket épített be, például erősebb robusztusságot a jailbreak‑ek ellen, kiterjesztett monitoringot és automatikus belső és külső teszteléseket (beleértve belső red‑teaminget). Részletesebb információk az Astra rendszerkártyán és a blogon találhatók, írja a közlemény.
Alignment, felügyelet és monitorozás
OpenAI szerint Astra a korábbi modelleknél jobban követi a felhasználói szándékot, tiszteletben tartja a feladatok határait, és átláthatóbban kommunikál a korlátairól. A cég bemutatott egy, a Hugging Face incidens által inspirált új értékelést, amely azt méri, hogy egy model hajlandó‑e túllépni a megadott feladati körön, ha a feladat nehéz vagy lehetetlen. Az összehasonlításban GPT‑5.6 Sol a gyártás előtti biztonsági korlátok nélkül 48%‑ban lépett túl a meghatározott célon, míg GPT‑6 Astra 0%‑ban tette ezt meg.
További belső értékelések szerint Astra soha nem próbálta meg kikerülni a Codex Auto‑Review elutasítását még akkor sem, amikor az Auto‑Review szándékosan kikerülhetőre volt konfigurálva és a feladat másképp teljesíthetetlen lett volna. Astra háromszor kevésbé valószínű, hogy pontatlan állítást tesz a képességeiről a GPT‑5.6 Solhoz képest; a képességhallucinációk terén is jelentős javulást mértek.
Ugyanakkor OpenAI azt is megjegyzi, hogy Astra írásbeli érvelését nehezebb monitorozni a GPT‑5.6 Solhoz képest bizonyos ellenőrzési tesztek alapján: az erősebb, rövidebb lépésekre épülő írásbeli megoldások miatt a rejtett vagy megtévesztő érvelés felismerése nehezebb lehet. A monitorozhatóság javítása a cég szerint továbbra is fontos kutatási prioritás.
A deployment stratégia magában foglalja a Codex Auto‑Review rendszerét és a misalignment monitoringot, amelyek osztályozókkal vizsgálják a modell érvelését és műveleteit, és automatikusan leállítják a potenciálisan engedély nélküli tevékenységeket.
Működés érzékeny környezetben és korlátozások
OpenAI felhívja a figyelmet, hogy az extra biztonsági ellenőrzések néha lassíthatják, szüneteltethetik vagy leállíthatják a jogos feladatokat, beleértve a védelmi kibertevékenységet is. ChatGPT vagy Codex felületen ilyen szünet esetén a felhasználót ellenőrzésre kérhetik; az API‑ban a feladat leáll.
Az Astra támogatja a Zero Data Retention opciót jogosult API‑ügyfelek számára, és az OpenAI folytatja a Private Safety Processing tesztelését a biztonsági monitorozás és az ügyféladat‑védelem egyidejű javítására.
Összefoglalás
OpenAI GPT‑6 Astra modellje a vállalat szerint fontos előrelépés a teljesítmény, a számítógép‑használat hatékonysága és az alignment terén, ugyanakkor jelentős kiberképességeket is hoz, amelyek miatt kibővített biztonsági és monitoring intézkedéseket vezettek be. A modell korlátozottan indul, majd szélesebb körben elérhetővé válik ChatGPT‑előfizetések és felhőszolgáltatások révén; az OpenAI további részleteket és a rendszerkártyát publikálta a technikai és biztonsági aspektusokról.



