OpenAI ma reggel általános elérhetőségre tette a GPT‑5.6 modellcsaládot, amely három méretben érhető el: Luna (a legkisebb), Terra és Sol (a legnagyobb). A vállalat a modelleket token‑alapú árazással kínálja: 1 millió input/output tokenre vetítve a Luna ára $1/$6, a Terra $2.50/$15, a Sol pedig $5/$30.
Összehasonlításképp a cikk megemlíti, hogy az Anthropic Claude Opus sorozata $5/$25, míg a Claude Fable 5 $10/$50 per 1 millió input/output token, de a szerző felhívja a figyelmet, hogy a tokenenkénti ár önmagában nem sokat mond, mert ugyanazon feladathoz a modellek között jelentősen eltérhet a szükséges „reasoning” tokenek száma.
Teljesítmény‑ és benchmarkállítások
OpenAI legnagyobb teljesítmény‑állítása a hosszú lefolyású, ügynökalapú (agentic) munkafolyamatokra vonatkozik. Az Agents’ Last Exam nevű benchmarkon, amely 55 szakmai terület hosszabb munkafolyamatait értékeli, a GPT‑5.6 Sol új csúcsot ért el 53.6 ponttal, ami 13.1 ponttal több, mint a Claude Fable 5 (adaptive reasoning) eredménye. A közepes reasoning beállításon a GPT‑5.6 Sol 11.4 ponttal előzi meg Fable 5‑öt, állítólag hozzávetőlegesen negyed akkora költséggel. OpenAI szerint a kisebb modellekre is kiterjed ez a hatékonyság: a Terra és Luna körülbelül tizenhatod költségen felülmúlják a Fable 5‑öt.
Érdekességként egy, az OpenAI által önként idézett benchmarkon, a SWE‑Bench Pro‑n a Claude Fable 5 jobb eredményt ért el: Fable 5 80%-ot teljesített, míg a GPT‑5.6 Sol 64.6%-ot. OpenAI a benchmark auditálása során problémákat azonosított: becslésük szerint körülbelül 30%‑a a SWE‑Bench Pro feladatoknak hibás, és ezért azt javasolják, hogy a modellfejlesztők óvatosan vizsgálják át az eredményeket.
A szerző saját, korai hozzáférésen alapuló tapasztalata szerint a GPT‑5.6 Sol nagyon kompetens, de a komplex kódolási feladatok terén eddig nem tűnt jobbnek a Claude Fable 5‑nél, amelyet ő Anthropic modelljével használt.
Új API‑funkciók és útmutatók
A GPT‑5.6‑hoz közzétett modellhasználati útmutatóban több új API‑funkció szerepel, amelyek közül a cikk kiemel néhány jelentőset:
- Programmatic Tool Calling: a modellek képesek "JavaScript összeállítására és futtatására, amely eszközhívásokat szervez" — ez potencialisan segíthet abban, hogy a modellek összefűzzék a különböző eszközöket és parancssori műveleteket egyetlen, összetett munkamenetté.
- Multi‑agent: a modell képes al‑ügynököket indítani párhuzamos, fókuszált munkára; ez a sub‑agent minta mostantól a mag API részét képezi.
- Prompt cache breakpoints: az OpenAI bevezeti a prompt gyorsítótár megtörési pontjainak explicit megadását, hasonlóan az Anthropicnál megszokott prompt caching mechanikához. Az automatikus detektálás továbbra is elérhető, de az explicit breakpointok optimalizációs előnyöket hozhatnak azoknak, akik befektetnek a beállításukba.
- Képkéréseknél a detail: original opcióval megakadályozható, hogy az API a képet átméretezze feldolgozás előtt.
Pelikánpéldák és költség‑illusztrációk
A kiadott anyagban szerepel egy oldal, amely 18 különböző pelikán‑példát mutat be: a három modellre és a reasoning erősség négy‑öt szintjére (none, low, medium, high, xhigh, max) vonatkozóan. A lista token‑ és becsült költségadatokat is tartalmaz: a legolcsóbb konfiguráció a gpt‑5.6‑luna effort none volt 0.71 centtel, míg a legdrágább a gpt‑5.6‑sol max reasoning beállítással 48.55 cent volt.
További, könnyedebb részlet: a reggeli livestream 17:50‑es részén az OpenAI demózott 3D pelikánokat, amelyek triciklin, biciklin, póni hátán és egy másik pelikán hátán ültek.
Összegzés
Az OpenAI a GPT‑5.6 családdal többméretű, token‑áras opciót és új API‑képességeket vezet be, és benchmarkon javulást állít a hosszú lefolyású ügynökfeladatokban az Anthropic Claude Fable 5‑höz képest. Ugyanakkor a SWE‑Bench Pro eredmények és a szerző korai tapasztalatai arra utalnak, hogy a különböző modellösszehasonlításokat óvatosan kell értelmezni: a benchmarkok validitása és a feladatra szükséges reasoning tokenek eltérései befolyásolják a képet.



