Modellbevezetés

OpenAI bemutatja a GPT-5.6 családot (Sol, Terra, Luna) korlátozott előnézettel

A főszereplő az OpenAI, amely 2026 júniusában bejelentette a GPT-5.6 családot három változattal: Sol, Terra és Luna.

OpenAI bemutatja a GPT-5.6 családot (Sol, Terra, Luna) korlátozott előnézettel

Az OpenAI bejelentette a GPT‑5.6 család korlátozott előnézetét, amely három változatból áll: Sol, Terra és Luna. A cég szerint a kiadásot megelőzően megosztotta a modelleket és a kiadási terveket az Egyesült Államok kormányával, és ezért a kezdeti előnézetet nagyjából 20 kiválasztott szervezet számára teszi elérhetővé; a szélesebb, nyilvános megjelenés „a következő hetekben” várható.

A korlátozott, lépcsőzetes kiadás összefüggésben áll azzal az elnöki rendelettel, amelyet Donald J. Trump elnök adott ki 2026. június 2‑án. A rendelet különböző szövetségi ügynökségeket kért fel arra, hogy 30 napon belül összehangolt benchmark‑ és képességértékelési eljárást dolgozzanak ki az új AI‑modellek biztonságos, széles körű kiadásának biztosítására (a rendelet által jelzett 30 nap kimenetele július 2.). OpenAI blogbejegyzése szerint a kormány kérésére előre bemutatták terveiket és a modellek képességeit, és emiatt indítják el a szűk körű előnézetet megbízható partnerek számára.

A család tagjai: Sol, Terra és Luna

  • Sol: a legmagasabb képességű változat, a legösszetettebb feladatokra, például bonyolult kódolásra, hosszú futamidejű agent‑feladatokra és biztonsági kutatásra. Ár: 5,00 USD/millió input token és 30,00 USD/millió output token (ugyanaz a tarifa, mint a GPT‑5.5‑nél). OpenAI szerint jelentős teljesítménynövekedést ad hosszú kódolási, kiberbiztonsági és agentikus feladatoknál.
  • Terra: középső réteg, az erős teljesítményt hatékonysággal egyensúlyozza, nagy volumenű üzleti munkafolyamatokra például ügyfélszolgálatra vagy dokumentumelemzésre. Ár: 2,50 USD/15,00 USD per 1M token.
  • Luna: a legkönnyebb és legolcsóbb változat, sebességre és rutinfeladatokra optimalizált (összegzés, vázlatkészítés, rutin automatizálás). Ár: 1,00 USD/6,00 USD per 1M token.

OpenAI szerint az új névhasználat — a generációt számmal, a képesség‑rétegeket pedig Sol, Terra és Luna megjelöléssel — tisztább választást kínál a teljesítmény, sebesség és költség mentén. Források szerint a névválasztás a kozmikus hangulat keltésére is törekedett.

Teljesítmény és benchmarkok

A GPT‑5.6 sorozat több mércében javulást mutat a korábbi generációkhoz képest, különösen komplex következtetési és hosszú távú feladatoknál. A TerminalBench 2.1 parancssori automatizálási benchmarkon Sol rekorderedményt ért el: ultra üzemmódban 91,91%‑os pontszámot, míg a max üzemmód 88,76%‑ot adott; ez meghaladja a GPT‑5.5 83,4%‑át és az Anthropic Claude Mythos 5 88% körüli eredményét.

Agent‑stílusú munkafolyamatokban (Agent's Last Exam) Sol egyedül érte el a 50,9%‑os teljesítést "code mode" módban, míg a Luna is szűken felülmúlta az előző generáció zászlóshajóját. Kvantitatív biológiai és genomikai tesztekben Sol és Terra jobban teljesítettek a GPT‑5.5‑nél és GPT‑5.4‑nél, miközben Sol kevesebb tokent használt.

Kiberbiztonsági értékelésekben a modellek magasabb szándékolt exploit‑arányokat értek el, Sol különösen jól skálázódott nagyobb érvelési időnél, és lényegesen kevesebb output tokennel érte el ezeket az eredményeket. OpenAI szerint ExploitBench‑en Sol a Mythos Preview közelében teljesített, miközben nagyjából egyharmadannyival kevesebb output tokent generált.

Műszaki újítások: hosszabb érvelés és subagentek

A GPT‑5.6 fő technikai változása, hogy a modellek több időt és struktúrát kapnak a nehéz feladatok megoldására az inferencia alatt. Bevezették a max reasoning beállítást Sol számára, amely hosszabb deliberációra szánt problémákhoz készült. Az ultra mód pedig subagenteket hoz be, amelyek fel tudják bontani és felgyorsítani a komplex projektek végrehajtását ahelyett, hogy egyetlen agent folyamán belül maradna a munka. A bejelentés szerint ez javítja az agent‑típusú feladatok eredményességét.

Token‑cache és teljesítmény‑hardver

A GPT‑5.6 API új, előre kiszámítható prompt‑cache protokollt vezet be: fejlesztők explicit cache‑töréspontokat alkalmazhatnak, és garantált minimum 30 perces cache‑élettartamot kínálnak. Az inicializáló cache írások 1,25×‑be kerülnek a modell alap uncached input díjához képest, míg a későbbi cache olvasások 90% kedvezményt kapnak. Ez a modell ismétlődő vagy hasonló műveletek költségét előre kiszámíthatóvá teszi.

A késleltetés csökkentése érdekében az OpenAI júliusban Sol‑t a Cerebras hardveren indítja el: ez a partnerség legfeljebb 750 token/másodperc feldolgozási sebességet ígér, célzottan valós idejű, frontier‑szintű érvelést igénylő vállalati alkalmazásokhoz.

Biztonság, red‑teaming és működési korlátok

Az OpenAI állítása szerint a GPT‑5.6 red‑teamingjére körülbelül 700,000 A100e GPU‑óra teljesítményt fordítottak, elsősorban „univerzális jailbreakek” felkutatására, azaz széles körben alkalmazható támadási vektorok felfedezésére. A vállalat több rétegű védelmi veremet épített ki, amely valós időben működik és szándékosan operációs súrlódásokat helyez el az ügyfelek biztonsági csapata számára.

A főbb védelmi elemek:

  • Model‑szintű elutasítások: a GPT‑5.6 megtanították elutasítani tiltott kibersegítséget és a maszkolt rosszindulatú kéréseket.
  • Élő visszaélés‑szűrés: külön cyber és biológiai detektorok vizsgálják a generációt folyamat közben.
  • Aktiváció‑alapú szűrés: Sol és Terra esetén aktivációs osztályozók figyelik a belső jelzéseket inferencia közben; kockázat esetén az output streaming leállhat további ellenőrzésig. Luna nem kapja meg ugyanazt az aktivációs réteget, de más monitorozó rendszerek alá tartozik.
  • Érvelés‑ellenőrzési szünetek: ha a kockázat növekszik, a generálás megáll, amíg egy nagyobb érvelési rendszer átvizsgálja a kontextust; ha tiltott kimenetet azonosít, az választ blokkolják.

A rendszer hibapozitív gyakorisága miatt a legitim védelmi munkák (kódáttekintés, sebezhetőség‑feltárás, patch‑fejlesztés) gyakran kiválthatják a figyelmeztetéseket. A rendszerkártya szerint a monitoringstack 94,8%‑os recall‑t produkált a biológiai értékelési halmazon és 81,6%‑ot a kiberbiztonsági értékelésen — ami kvantitatív betekintést ad, de jelzi a tökéletlenséget is.

Rendszeres jelzés esetén automatikus fiókszintű vizsgálatok indulhatnak a korábbi beszélgetések átvizsgálására. OpenAI tárgyal hosszabb távú vállalati biztonsági szabályozásokról, beleértve az ügyfél‑vezérelt biztonsági felülírásokat és az adatvédelmet szolgáló detektálási mechanizmusokat.

A belső tesztek szerint Sol inkább védekező izolálásra van optimalizálva, nem automatikus, teljes láncot megvalósító támadásokra: Chromium és Firefox kódbázisokon futtatott értékelések során a modell izolálta a hibákat és exploit‑primitíveket, de nem tudott önállóan működő, teljes exploit‑láncot megalkotni. Ugyanakkor mindhárom modell átlépte OpenAI belső „High” cyber küszöbét: Sol 96,7%‑kal, Terra 91,84%‑kal és Luna 85,19%‑kal.

OpenAI hangsúlyozza, hogy ez a státusz azt jelenti, hogy a modellek képesek lehetnek automatizálni a sebezhetőség‑kutatás és exploit elemzés egyes részeit, de nem tekinthetők olyan rendszereknek, amelyek megbízhatóan végre tudnak hajtani egy teljes fejlett támadást emberi irányítás nélkül a cég tesztfeltételei szerint.

Üzleti és geopolitikai következmények

A GPT‑5.6 korlátozott előnézete és a kiadási folyamat koordinációja a Fehér Házzal rávilágít a korszerű AI‑laborok és a nemzetbiztonsági protokollok fokozódó összefonódására. Az OpenAI nyíltan kritikusan nyilatkozott arról az eljárásról, amely kormányzati hozzáférést igényel a kezdeti körben, és azt állítja: nem helyes, hogy ez váljon tartós alapértelmezett folyamattá, mert ezzel a legjobb eszközök egyes felhasználók és védekező szakértők elől is elzárhatók.

A kiadási rend a vállalati vásárlók számára új terepet teremt: valós idejű biztonsági beavatkozások, kötelező megfelelési paraméterek és strukturált token‑cache mechanikák között kell eligazodniuk. Emellett a lépés összefüggésben áll az Egyesült Államok kormányának Anthropic elleni exportkorlátozási döntésével, amely az Anthropic által nyilvánosan elérhetőre bocsátott Claude Fable 5 modellel kapcsolatos jailbreak‑problémák miatt született, és amely eredményeként Anthropic korlátozta a modellekhez való hozzáférést.

Összefoglalva, a GPT‑5.6 család technikailag előrelépést hoz hosszabb érvelésben, subagent‑alapú munkamegosztásban és vállalati szintű költségkezelhetőségben, de a kezdeti hozzáférés, a biztonsági korlátok és a kormányzati koordináció új működési és szabályozási követelményeket támasztanak a felhasználók és a vállalatok számára.