Biztonság

OpenAI belső 'szuper-hackerrel' (GPT-Red) erősítette meg GPT-5.6 védelmét

A főszereplő az OpenAI által fejlesztett GPT-Red, egy nagy nyelvi modell alapú (LLM) „szuper-hacker”, amelyet a cég a többi modellje biztonsági megerősítésére használ.

OpenAI belső 'szuper-hackerrel' (GPT-Red) erősítette meg GPT-5.6 védelmét

Az OpenAI létrehozott egy belső, red-teaming feladatokra szánt nagy nyelvi modellt, GPT-Red néven, amelyet arra használnak, hogy más modelleiket kibertámadásokra tesztelje és ezzel javítsák a védekezést. A cég a hírek szerint a múlt héten tette közzé zászlóshajó LLM-jének legújabb verzióját, GPT-5.6-ot; az OpenAI szerint a GPT-Red ellen végzett képzés tette ezt a kiadást a legellenállóbbá.

Mi az a GPT-Red és miért készült?

A GPT-Red automatizálja a szoftverek red-teaming elnevezésű biztonsági értékelését, amelyet hagyományosan emberi tesztelők végeznek. A cél minél többféle módszert megtalálni arra, hogy miként lehet feltörni vagy eltéríteni egy rendszert, hogy a feltárt gyenge pontokat a végleges kiadás előtt javítani lehessen.

A nagy nyelvi modellek összetettebbé válásával és ügynök-szerű alkalmazásukkal — amelyek képesek fájlokat, weboldalakat, harmadik féltől származó kódot és más ügynököket is kezelni — az emberi csapatok egyedül nehezen tudnak lépést tartani a potenciális támadási módokkal. "A kockázati felület növekszik, és a robbanási sugár is nő" — mondja Nikhil Kandpal, az OpenAI kutatója, aki a GPT-Red társalapítója.

Hogyan képezték a modellt?

A kutatók egy nem kifejezetten hackernek kiképzett LLM-et állítottak be egy önjátékon (self-play) alapuló környezetbe, több más modellel együtt. Az egyik oldal célja az volt, hogy megtámadja a többi modellt; a másiké, hogy megvédje magát. Sok kör után a GPT-Red egyre hatékonyabbá vált a támadásokban, míg a célpont modellek egyre jobbá váltak a védekezésben.

A képzés egy, az OpenAI által tervezett „dojo”-szerű környezetben zajlott, amely több valós használati forgatókönyvet modellezett: webböngészést, e-mailek és naptáralkalmazások olvasását, valamint kód szerkesztését.

Amikor GPT-Red új támadást talált, több variánsát is kipróbálta, hogy megtalálja a leghatékonyabbat adott helyzetekre. Dylan Hunn, a projekt másik társalapítója szerint a modell "rendkívül kitartó" abban, hogy beleássa magát egy felfedezett támadás részleteibe.

Új típusú prompt-injekció: a "fake chain of thought"

Az OpenAI különös figyelmet fordított a prompt-injekciós támadásokra, amelyekben a rosszindulatú szereplő olyan utasítást csempész az LLM-nek, hogy az a fejlesztők vagy a felhasználók szándékával ellentétesen cselekedjen (például bizalmas adatok másolása, kód szabotálása vagy káros tartalom előállítása). Elméletileg ilyen utasítás rejtve lehet bármilyen szövegben, például kódban vagy weboldalakon.

A kutatók szerint a GPT-Red felfedezett egy korábban nem látott prompt-injekciós módszert, amelyet „fake chain of thought”-nak (hamis gondolatmenet-láncnak) neveztek el. A chain of thought olyan belső jegyzetelés az LLM részéről, amelyben részleges eredményeket tart nyilván a feladat megoldása közben. GPT-Red talált egy módszert, amellyel hamis bejegyzést lehetett becsempészni egy másik modell gondolatmenetébe, és ezzel rábírni a modellt, hogy a hamisított információra alapozva cselekedjen.

Chris Choquette-Choo, a csapat további kutatója ezt példázva azt mondta: „Olyasmi, mintha azt mondanám, hogy 1+1=3, és te már ellenőrizted ezt — a modell így reagál, és egyszerűen kiadja a 3-at.”

Tesztek és eredmények

A független szakértők, köztük Jessica Ji, a Georgetown University Center for Security and Emerging Technology (CSET) kutatója, ígéretesnek tartják a self-play alapú megközelítést. Az OpenAI egy 2025-ös kísérletet ismételt meg: abban emberi red-teamerek próbáltak biztonsági réseket találni egy korábbi GPT-5 verzióban. Amikor ugyanerre a feladatra GPT-Redet állították, hatékonyabbnak bizonyult a támadások megtalálásában, mint a korábbi emberi csapat.

A GPT-Redet továbbá Vendy ellen is kipróbálták — egy árukezelő (vending machine) ügynök ellen, amelyet az Andon Labs fejlesztett, és amely a valós feladatokban való teljesítményt vizsgálja. GPT-Red sikeresen meg tudta változtatni a termékek árait és törölni vevői rendeléseket.

Védelmi oldalról az OpenAI azt közölte, hogy a GPT-Red által feltárt legerősebb támadások több mint 90%-a működött a tavaly augusztusban kiadott GPT-5 ellen, míg a legújabb GPT-5.6 esetében ezeknek kevesebb mint 23%-a volt sikeres.

Korlátok és emberi együttműködés

A GPT-Red nem tökéletes: gyengébb a párbeszédes jellegű, oda-vissza történő támadások felderítésében, amelyekben egy emberi támadó könnyebben boldogulna. Szintén kevésbé hatékony képek használatában, pedig a képek szövegátadási csatornaként használhatók prompt-injekciókban.

Az OpenAI hangsúlyozza, hogy GPT-Red kiegészíti az emberi red-team munkáját: az emberek találhatnak olyan támadásokat, amelyeket a modell nem, és fordítva. Egy stratégia, amelyet alkalmaznak, az, hogy az emberi csapatok által talált támadásokat adják át GPT-Rednek, hogy az megtalálja az összes variánst.

Jessica Ji szerint az emberi szakértelem továbbra is fontos lesz: „Hasznos lenne meghatározni, hogy hol van leginkább szükség emberi tesztelésre.”

Nem lesz publikus kiadás

Az OpenAI nem tervezi a GPT-Red nyilvános kiadását. A cég szerint a modellt nehéz lenne másoknak lemásolni: a fejlesztés több mint egy éve zajlik, és a világ egyik leggazdagabb vállalatának számítási kapacitására támaszkodott. „Nem triviális dolog, hogy valaki csak úgy elmenjen és könnyen legyártson egy ilyen szuper-támadót ezen az ötleten alapulva” — mondta Choquette-Choo.

Összefoglalva: a GPT-Red egy automatikus, önjátékon alapuló red-teamer, amely új típusú támadásokat tár fel és hozzájárul a GPT-5.6 védelmének javításához, de nem helyettesíti teljesen az emberi szakértelmet, és nem kerül nyilvános forgalmazásra.