Modellbevezetés

OpenAI bemutatja a GPT-5.6 családot: Luna, Terra és Sol modellek és új API funkciók

OpenAI ma reggel tette általánosan elérhetővé új csúcsmodell-családját, a GPT-5.6 sorozatot, amely három méretben érhető el: GPT-5.6 Luna (kisebb), GPT-5.6 Terra (közepes) és GPT-5.6 Sol (nagyobb).

OpenAI bemutatja a GPT-5.6 családot: Luna, Terra és Sol modellek és új API funkciók

OpenAI ma reggel általános elérhetőségre tette a GPT‑5.6 modellcsaládot, amely három méretben érhető el: Luna (a legkisebb), Terra és Sol (a legnagyobb). A vállalat a modelleket token‑alapú árazással kínálja: 1 millió input/output tokenre vetítve a Luna ára $1/$6, a Terra $2.50/$15, a Sol pedig $5/$30.

Összehasonlításképp a cikk megemlíti, hogy az Anthropic Claude Opus sorozata $5/$25, míg a Claude Fable 5 $10/$50 per 1 millió input/output token, de a szerző felhívja a figyelmet, hogy a tokenenkénti ár önmagában nem sokat mond, mert ugyanazon feladathoz a modellek között jelentősen eltérhet a szükséges „reasoning” tokenek száma.

Teljesítmény‑ és benchmarkállítások

OpenAI legnagyobb teljesítmény‑állítása a hosszú lefolyású, ügynökalapú (agentic) munkafolyamatokra vonatkozik. Az Agents’ Last Exam nevű benchmarkon, amely 55 szakmai terület hosszabb munkafolyamatait értékeli, a GPT‑5.6 Sol új csúcsot ért el 53.6 ponttal, ami 13.1 ponttal több, mint a Claude Fable 5 (adaptive reasoning) eredménye. A közepes reasoning beállításon a GPT‑5.6 Sol 11.4 ponttal előzi meg Fable 5‑öt, állítólag hozzávetőlegesen negyed akkora költséggel. OpenAI szerint a kisebb modellekre is kiterjed ez a hatékonyság: a Terra és Luna körülbelül tizenhatod költségen felülmúlják a Fable 5‑öt.

Érdekességként egy, az OpenAI által önként idézett benchmarkon, a SWE‑Bench Pro‑n a Claude Fable 5 jobb eredményt ért el: Fable 5 80%-ot teljesített, míg a GPT‑5.6 Sol 64.6%-ot. OpenAI a benchmark auditálása során problémákat azonosított: becslésük szerint körülbelül 30%‑a a SWE‑Bench Pro feladatoknak hibás, és ezért azt javasolják, hogy a modellfejlesztők óvatosan vizsgálják át az eredményeket.

A szerző saját, korai hozzáférésen alapuló tapasztalata szerint a GPT‑5.6 Sol nagyon kompetens, de a komplex kódolási feladatok terén eddig nem tűnt jobbnek a Claude Fable 5‑nél, amelyet ő Anthropic modelljével használt.

Új API‑funkciók és útmutatók

A GPT‑5.6‑hoz közzétett modellhasználati útmutatóban több új API‑funkció szerepel, amelyek közül a cikk kiemel néhány jelentőset:

  • Programmatic Tool Calling: a modellek képesek "JavaScript összeállítására és futtatására, amely eszközhívásokat szervez" — ez potencialisan segíthet abban, hogy a modellek összefűzzék a különböző eszközöket és parancssori műveleteket egyetlen, összetett munkamenetté.
  • Multi‑agent: a modell képes al‑ügynököket indítani párhuzamos, fókuszált munkára; ez a sub‑agent minta mostantól a mag API részét képezi.
  • Prompt cache breakpoints: az OpenAI bevezeti a prompt gyorsítótár megtörési pontjainak explicit megadását, hasonlóan az Anthropicnál megszokott prompt caching mechanikához. Az automatikus detektálás továbbra is elérhető, de az explicit breakpointok optimalizációs előnyöket hozhatnak azoknak, akik befektetnek a beállításukba.
  • Képkéréseknél a detail: original opcióval megakadályozható, hogy az API a képet átméretezze feldolgozás előtt.

Pelikánpéldák és költség‑illusztrációk

A kiadott anyagban szerepel egy oldal, amely 18 különböző pelikán‑példát mutat be: a három modellre és a reasoning erősség négy‑öt szintjére (none, low, medium, high, xhigh, max) vonatkozóan. A lista token‑ és becsült költségadatokat is tartalmaz: a legolcsóbb konfiguráció a gpt‑5.6‑luna effort none volt 0.71 centtel, míg a legdrágább a gpt‑5.6‑sol max reasoning beállítással 48.55 cent volt.

További, könnyedebb részlet: a reggeli livestream 17:50‑es részén az OpenAI demózott 3D pelikánokat, amelyek triciklin, biciklin, póni hátán és egy másik pelikán hátán ültek.

Összegzés

Az OpenAI a GPT‑5.6 családdal többméretű, token‑áras opciót és új API‑képességeket vezet be, és benchmarkon javulást állít a hosszú lefolyású ügynökfeladatokban az Anthropic Claude Fable 5‑höz képest. Ugyanakkor a SWE‑Bench Pro eredmények és a szerző korai tapasztalatai arra utalnak, hogy a különböző modellösszehasonlításokat óvatosan kell értelmezni: a benchmarkok validitása és a feladatra szükséges reasoning tokenek eltérései befolyásolják a képet.