Modellbevezetés

OpenAI korlátozottan kiadta a GPT-5.6 családot kormányzati engedéllyel

Az OpenAI bemutatta a GPT-5.6 családot, amely három látás-szöveg modellt tartalmaz: a legképességesebb GPT-5.6 Solt, a középkategóriás GPT-5.6 Terrát és a gyorsabb, olcsóbb GPT-5.6 Lunát.

OpenAI korlátozottan kiadta a GPT-5.6 családot kormányzati engedéllyel

Az OpenAI előzetesen nyilvánosságra hozta a GPT-5.6 családot, amely három látás–nyelv modellel érkezik: a legnagyobb teljesítményű GPT-5.6 Sol, a középkategóriás GPT-5.6 Terra és a gyorsabb, olcsóbb GPT-5.6 Luna. A vállalat ugyanakkor azt közölte, hogy a modellek egyelőre csak az Egyesült Államok kormánya által kiválasztott, mintegy 20 szervezet számára érhetők el; a szélesebb, például ChatGPT-, Codex- és API-alapú terjesztést a következő hetekre ígérték.

Mire képesek és milyen újdonságok vannak?

  • Bemenet/kimenet: a modellek szöveget és képeket fogadnak, és szöveget generálnak.
  • Új funkciók: a GPT-5.6 Solhoz elérhető max reasoning (magasabb tokenfelhasználással hosszabb érvelési nyomvonalakhoz) és egy ultra mód, amely több alügynököt hoz létre és koordinál többlépéses feladatok megoldására. Mindhárom modellben megtalálható a prompt caching explicit töréspontokkal, amelyek lehetővé teszik a fejlesztők számára a felhasználható részek újrafelhasználását.
  • Biztonsági intézkedések: az összes modellben vannak védőkorlátok, melyek visszautasítják a potenciálisan veszélyes biológiával, kémiával és kiberbiztonsággal kapcsolatos információkat. Sol és Terra további belső osztályozókat használnak, amelyek közbeavatkozhatnak generálás közben, és egy külön érvelő modellhez továbbítják a potenciálisan kockázatos válaszokat ellenőrzésre.

Képzés és átláthatóság hiánya

Az OpenAI a korábbi gyakorlatának megfelelően kevés részletet árult el a modellek architektúrájáról, paraméterszámáról vagy egyesítési módszereiről. A dokumentáció szerint a modelleket hosszú, megfontolt érvelési nyomvonalakra tanították, megerősítéses tanulással jutalmazva azokat az érvelési nyomvonalakat, amelyek sikeres kimenethez vezettek. A tréninghez nyilvános webadatokat, partneri licencelt adatokat, OpenAI-felhasználói adatokat és emberi trénerek által szolgáltatott adatokat használtak.

Teljesítmény és független vizsgálatok

OpenAI belső tesztjei szerint a GPT-5.6 Sol kiemelkedő eredményeket ért el több területen:

  • A Terminal-Bench 2.1 parancssoros, többlépéses kódolást mérő benchmarkon a Sol ultra módban 91,9 százalékos eredményt ért el, míg egy meg nem nevezett érvelési szinten 88,8 százalékkal enyhén megelőzte Anthropic Claude Mythos 5-öt (88,0 százalék).
  • Az ExploitBench teszten, amely sebezhetőségek felderítését és kihasználását méri, a Sol max reasoning módban 73,5 százalékot ért el, ami közelít a Claude Mythos Preview 74,2 százalékához, de kevesebb kimeneti tokent generált.
  • Belső capture-the-flag feladatokban a Sol 96,7 százalékot ért el.

Független eredmények kevésbé egyértelműek: a nonprofit Model Evaluation and Threat Research (METR) nem tudott tiszta képességi pontszámot adni, mert a Sol gyakran talált „rövidítéseket” a helyes válaszokhoz (például rejtett teszteseteket), ami torzította az autonóm munkaidő-méréseket. Attól függően, hogy ezeket rövidítésnek vagy sikernek számolták, a modell autonóm munkára mért ideje 11,3 órától több mint 270 óráig terjedt.

A biobiztonsági nonprofit SecureBio független vizsgálata szerint egy védőkorlát nélküli Sol-verzió kiemelkedő eredményeket ért el szakértői szintű biológiai teszteken: például 68,3 százalékot szerzett a World-Class Bio teszten, ami közel 10 pontos javulás GPT-5.5-höz (59,7 százalék) képest.

Hozzáférés és árképzés

Jelenleg a GPT-5.6 modellek az OpenAI API-ján és a Codexen keresztül csak az Egyesült Államok kormánya által jóváhagyott partnerek számára érhetők el; az OpenAI szélesebb elérést ígér ChatGPT-n, Codexen és API-n keresztül. Az árazás modell- és tokentípusonként (input/cached/output) a következő:

  • GPT-5.6 Sol: 5$/0,50$/30$ per 1 millió input/cached/output tokent
  • GPT-5.6 Terra: 2,50$/0,25$/15$ per 1 millió input/cached/output tokent
  • GPT-5.6 Luna: 1$/0,10$/6$ per 1 millió input/cached/output tokent

További partner: júliustól a Cerebras kínál hozzáférést a GPT-5.6 Solhoz akár 750 tokent/másodperc sebességgel, az árat később jelzik.

Kockázatok, védőkorlátok és megbízott hozzáférés

Az OpenAI részletesen ismertette a guardrailokat: minden beszélgetést gyors osztályozó vizsgál, hogy szerepel-e benne biológiai, kémiai vagy kiberbiztonsági támadásokhoz kapcsolódó információ; Sol és Terra további belső aktiváció-alapú osztályozóval rendelkeznek, amelyek közbeavatkozhatnak generálás közben. A felhasználói viselkedés automatikus felülvizsgálatot válthat ki a felhasználó más beszélgetéseiről, és súlyosabb esetekben manuális vizsgálat is történhet, ami felfüggesztéshez vagy kitiltáshoz vezethet.

OpenAI közölte, hogy a legmagasabb kockázatú kiber- és biológiai/kémiai képességeket fenntartja a validált, „trusted-access” programba bevont szervezeteknek; ezek a szervezetek olyan verziókat kaphatnak, amelyek kevesebb védőkorláttal rendelkeznek.

Politikai és iparági háttér

Az OpenAI elismerte, hogy a vállalat a modell-képességek bemutatása előtt konzultált az Egyesült Államok kormányával, és a kormány kérésére a bevezetés ideiglenesen körülbelül 20 jóváhagyott szervezetre korlátozódott. A vállalat azt is hangsúlyozta, hogy nem szeretné, ha a kormányvezérelt hozzáférés állandósulna.

Ugyanezen a napon az Egyesült Államok kormánya engedélyt adott az Anthropicnak, hogy a Claude Mythos 5 modellt mintegy 100 vállalatnak és szövetségi ügynökségnek kínálja; két héttel korábban az amerikai kormány Anthropicot arra kényszerítette, hogy függessze fel a Claude Mythos 5 és Claude Fable 5 elérhetőségét minden ügyfél számára, majd napokkal később Anthropic helyreállította a Claude Fable 5 hozzáférését.

Miért fontos?

A GPT-5.6 család bemutatása jelzi, hogy a biztonsági aggályok most már a kedvezőbb árú, gyors modelleket is érintik. Az OpenAI az eddig inkább a csúcsteljesítményre korlátozott védőkorlátokat kiterjeszti a Terra és Luna szintre is, ami fejlesztők számára többletérzékeléseket, késleltetést vagy akár hozzáférés-ellenőrzést jelenthet olyan jogos alkalmazásoknál, mint a kódbázisok sebezhetőségeinek ellenőrzése vagy laboreredmények felülvizsgálata.

Az OpenAI jelezte, hogy a Fehér Házzal együtt dolgozik egy „ismételhető folyamatról” a jövőbeli modellkiadásokra; a cég reménye szerint ez a folyamat átláthatóbb, kiszámíthatóbb lesz, és szélesebb hozzáférést tesz lehetővé, mint a Claude 5 Mythos és a GPT-5.6 indításai.