OpenAI általános elérhetőségre hozta a GPT‑5.6 modellek családját a korábbi korlátozott előzetes után. A család három tagból áll: a zászlóshajó GPT‑5.6 Sol, a mindennapi munkához optimalizált GPT‑5.6 Terra, és a költséghatékony GPT‑5.6 Luna. A vállalat az új kiadást elsősorban a tokenenkénti hasznosság növekedésével, jobb teljesítmény/ár aránnyal és megrendelésre skálázható képességekkel indokolja.
Mire képesek a modellek és hogyan mérik a javulást
OpenAI szerint a GPT‑5.6 Sol új mércét állít a hatékonyság és intelligencia terén: állításuk szerint jobb eredményeket ér el kódolásban, tudásmunkában, kiberbiztonságban és tudományos feladatokban, miközben kevesebb tokennel és alacsonyabb becsült költséggel dolgozik. Bemutatták az „ultra” üzemmódot is, amely alapértelmezetten több, párhuzamosan dolgozó ügynök koordinálását használja a komplex feladatok gyorsabb befejezéséhez.
Az értékelésekből idézve: az Agents’ Last Exam (55 szakmai területre kiterjedő, hosszú lefutású munkafolyamatokat mérő teszt) esetében a GPT‑5.6 Sol 53,6 pontot ér el, ami 13,1 ponttal meghaladja a Claude Fable 5 (adaptive reasoning) eredményét. Közepes érvelési beállításon Sol még mindig 11,4 ponttal jobb Fable 5‑nél, nagyjából negyed akkora becsült költségen. A hatékonysági előny a kisebb modellekre is kiterjed: Terra és Luna állításuk szerint Fable 5‑öt felülmúlják körülbelül tizenhatodnyi költségen.
A szélesebb mesterséges intelligencia-mérőszám, az Artificial Analysis Intelligence Index szerint GPT‑5.6 Sol maximális érvelés mellett egy ponttal marad el Fable 5‑től, miközben a feladatokat 61%-kal rövidebb idő alatt teljesíti és körülbelül fele annyi becsült költséggel jár.
Kódolás, parancssori munkafolyamatok és eszközhasználat
A GPT‑5.6 Sol a vállalat szerint a legjobb kódolási modelljük: az Artificial Analysis Coding Agent Indexen 80 pontot ér el (2,8 ponttal Fable 5 felett), miközben kevesebb mint a felét használja az output‑tokeneknek, kevesebb mint a felét az időnek, és hozzávetőleg egyharmaddal olcsóbb. Terra és Luna is előnyöket mutatnak: Terra kissé a Fable 5 fölött teljesít, Luna pedig felülmúlja az Opus 4.8‑at; mindkettő kevesebb időt és output‑tokent igényel, és alacsonyabb becsült költségen működik.
Sol továbbá új csúcseredményeket mutat a Terminal‑Bench 2.1 és DeepSWE benchmarkokon, amelyek bonyolult parancssori munkafolyamatokat és hosszú távú mérnöki feladatokat vizsgálnak valós kódbázisokban.
Technikailag a GPT‑5.6 képes könnyű programokat írni és futtatni, amelyek eszközöket koordinálnak, köztes eredményeket dolgoznak fel, nyomon követik a haladást és a helyzethez igazítják a következő lépést. A Responses API Programmatic Tool Calling funkciója lehetővé teszi nagy mennyiségű köztes adat kiszűrését és csak a releváns információk megtartását, csökkentve a token‑használatot és a modell‑körök számát.
Több idő és több ügynök: max, xhigh és ultra módok
A modell több érvelési beállítással rendelkezik: az alap hatékonyságot meghaladó feladatokhoz a max több időt ad a modellnek ellenőrzésekre és alternatívák vizsgálatára. Az ultra üzemmód alapértelmezésként négy párhuzamos ügynököt koordinál, többlet tokenfelhasználásért cserébe gyorsabb és erősebb eredményt nyújtva összetett problémákon. OpenAI bemutatott összehasonlító elemzései szerint a párhuzamos ügynökök növelik a pontszám/latencia hatékonyságot több benchmarkon.
Tudásmunka, dokumentumok és prezentációk
A GPT‑5.6 a természetes nyelvű kéréseket át tudja alakítani kész, interaktív magyarázatokká és vizualizációkká a ChatGPT Work felületén. A modell jobban kezeli a rendezetlen kontextust — például Slack, Notion, Microsoft 365 és Google Drive tartalmakból — és ebből megosztható, szakmai szintű anyagokat készít.
BrowseComp teszten GPT‑5.6 Sol 92,2%-os eredményt ért el, OSWorld 2.0‑on pedig 62,6%-ot; OSWorldon Sol túlszárnyalja az Opus 4.8‑at, miközben 85%-kal kevesebb output‑tokent használ. A családon belül Luna gyakorlatilag megközelíti a GPT‑5.5 csúcsát félannyi becsült költségen, Terra pedig meghaladja azt alacsonyabb költségen.
A modellek javítják prezentációk, dokumentumok és táblázatok minőségét: képesek szerkeszthető prezentációkat létrehozni, követni egy referencia diavetítési rendszert (layout, tipográfia, térköz, színek) és pontosabban kezelni egyenleteket, pénzügyi modelleket, valamint elrendezési szabályokat.
Kiberbiztonság és védelem
OpenAI szerint a GPT‑5.6 a legjobb cyber‑képességgel rendelkező modelljük: ExploitBench 1‑en 73,5%-os pontszámot adnak meg összehasonlítva a GPT‑5.5 47,9%-ával hasonló output‑token költség mellett. ExploitGym 2‑ben a kétórás korláthoz mért passzrást 15,1%-ról 24,9%-ra növeli, és hat órára kiterjesztve 33,7%-ot ér el. SEC‑Bench Pro‑n 71,2%-ot mérnek Szemben a GPT‑5.5 45,8%-ával, javult latenciával.
Ugyanakkor OpenAI hangsúlyozza, hogy ezek a képességek dual‑use jellegűek: ugyanazok a funkciók segíthetik a védekezést (sebezhetőségek feltárása, patch‑tesztelés, malware‑elemzés), mint ahogy visszaélésre is alkalmasak. Ennek megfelelően a vállalat Trusted Access for Cyber programot működtet, amely hitelesített szakemberek és szervezetek számára pontosabb védelmi hozzáférést tesz lehetővé ellenőrzött környezetben. Egyéni felhasználók identitás igazolásával kérhetnek Trusted Access‑t, szervezetek pedig jelentkezhetnek csapataik számára. Az egyes felhasználóknak az Advanced Account Security engedélyezésével tartható meg ez a magasabb hozzáférés.
Tudományos kutatás és belső használat
A GPT‑5.6 szerint Pareto‑javulást mutat az előző generációhoz képest az élettudományok és kémiában, hosszú távú genomikai és kvantitatív biológiai feladatokban (GeneBench Pro). OpenAI belső mérései alapján a kutatók napi aktív output‑token használata a GPT‑5.6 belső tesztelése során több mint kétszerese volt a GPT‑5.5 csúcsának. Egy belső, AI‑kutatási feladatokra épülő értékelőcsomag alapján a GPT‑5.6 Sol az úgynevezett RSI (recursive self‑improvement) képességben 16,2 ponttal múlta felül a GPT‑5.5‑öt.
Biztonsági intézkedések és előzetes tesztelés
OpenAI hangsúlyozza, hogy a GPT‑5.6-hoz eddigi legrobosztusabb védelmi rétegeket fejlesztették ki: emberi red teaming, nagyarányú automatizált tesztelés és külső szakértőkkel végzett próbák szerepeltek az előzetes vizsgálatokban. Az indítás előtti időszakban körülbelül 700,000 A100e GPU‑órányi fekete dobozos automatizált red teaminget hajtottak végre. A védelmi rendszer több rétegből áll: a modellbe épített protekciók, valós idejű ellenőrzések, monitoring és hozzáférés‑szabályozás, továbbá egy érvelési monitor, amely a beszélgetést vizsgálja a potenciális kockázatok azonosítására.
OpenAI azt állítja, hogy a GPT‑5.6 Sol kiberbiztonsági védelmei körülbelül tízszer több potenciálisan veszélyes tevékenységet blokkolnak, mint korábbi modelleknél. Ugyanakkor a vállalat lehetőséget biztosít a felhasználóknak arra, hogy könnyen újrapróbálják kéréseiket alacsonyabb képességű modelleken, ha a védelmi intézkedések akadályt jelentenének legitim munkához.
Elérhetőség, árképzés és technikai újdonságok
A GPT‑5.6 a cég közlése szerint "ma" elérhetővé vált a ChatGPT, Codex és az OpenAI API felületeken; a globális bevezetés megkezdődött és a teljes elérhetőségig fokozatosan zajlik a következő 24 órában.
Árképzés 1 millió tokenre vetítve:
- GPT‑5.6 Sol: 5 USD input / 30 USD output
- GPT‑5.6 Terra: 2,50 USD input / 15 USD output
- GPT‑5.6 Luna: 1 USD input / 6 USD output
További technikai változtatásként a GPT‑5.6 kiszámíthatóbb prompt‑cachinget vezet be, explicit cache breakpoints támogatásával és 30 perces minimális cache‑élettartammal. A cache‑írások elszámolása a modell uncached input díjának 1,25‑szöröse lesz, míg a cache‑olvasások továbbra is 90% kedvezménnyel számolt cached‑input díjat kapnak.
Összegzés
A GPT‑5.6 család célja a tokenenkénti hasznosság növelése, jobb teljesítmény/ár arány biztosítása és a professionális, hosszú lefutású munkafolyamatok hatékonyabb kiszolgálása. OpenAI egyidejűleg nagy hangsúlyt fektetett a védelmi rétegek megerősítésére és az előzetes, széles körű red‑teamingre. A modellek ma váltak elérhetővé, árképzésük és technikai részleteik nyilvánosak, a magasabb kockázatú képességekhez pedig Trusted Access mechanizmusokat kínálnak.



