Az OpenAI azonosított és megakadályozott egy koordinált kísérletet, amelynek célja modellek védett, belső érvelésének kinyerése volt. A cég szerint a tevékenység legkorábbi megfigyelt kezdete július első hetére tehető; a kampány később magasabb volument ért el, és továbbra is vizsgálják a teljes hatókört és hatásokat.
Mit ért az OpenAI „védett érvelés” és „adversarial distillation” alatt
- A „védett érvelés” a modell belső folyamatának, munkaállományának az a része, amely a feladat megoldásához vezet — olyan információkat tartalmazhat, amelyeket a modell a végső válasz elrejt.
- Az „adversarial distillation” alatt az OpenAI azt érti, amikor valaki egy modell kimenetét vagy érvelését rendszerszerűen és engedély nélkül használja fel egy másik modell képzéséhez, reprodukálásához vagy fejlesztéséhez. Az ilyen kinyerés lehetővé teheti mások számára a modell képességeinek visszaépítését, miközben kikerüli az eredeti modell felhasználói felületére alkalmazott biztonsági korlátozásokat.
Hogyan történt a kísérlet — nem adatfeltörés
Az OpenAI hangsúlyozza, hogy az operátorok nem törték fel a cég titkosítását, nem kompromittáltak adatbázist és nem szereztek közvetlen hozzáférést tárolt felhasználói beszélgetésekhez. Ehelyett a támadók a modell-interakciók manipulálásával próbálták reprodukálni a védett érvelést olyan formában, amely a kérdező számára láthatóvá vált — koordinált és nagy volumenű módon, a szolgáltatási feltételekbe ütközve. Az OpenAI szerint ez a fajta manipuláció nem egyedi sérülékenység az ő modelljeikre, és információkat osztott meg az iparági partnerekkel a Frontier Model Forumon keresztül.
Mikor és mekkora volt a forgalom
- A tevékenység július 1-jén indult, kezdetben alacsony volumenben.
- Jelentős forgalmi csúcsok voltak július 24. és 25-én: ezekben a napokban körülbelül 16 000 kérés használt releváns extrakciós mintát, több mint 4 000 felhasználótól.
- További vizsgálat egy szélesebb mintázatot talált több mint 15 000 felhasználót érintő klaszterben; ezt a tevékenységet az OpenAI július 28-ig teljes mértékben feltartóztatta.
Felfedezés és külső kutatók szerepe
Független biztonsági kutatók szintén felelősségteljes bejelentés formájában hívták fel az OpenAI figyelmét olyan, kereszt-modelles és beszélgetés-kompaktálási sebezhetőségekre. Az OpenAI kivizsgálta ezen megállapításokat, és megerősítette, hogy a kutatók azonosított támadási útvonalai valósak voltak; munkájuk felgyorsította a védekezés kialakítását és a szélesebb támadási osztály megértését.
Felelősség és attribúció
Az OpenAI azt írja, hogy nem teljesen tisztázott, hogy az összes megfigyelt operátor egyetlen szereplőtől származott-e, de egy alapvető aktivitás‑csoportot a Moonshot AI-hoz köthető, a Kimi fejlesztőjeként ismert egyénekhez társítanak.
Kockázatok: miért fontos ez
Az érvelés kiszivattyúzása biztonsági és nemzetbiztonsági kockázatot jelenthet. A kinyert érvelés segítségével egy másik modellt lehetne betanítani anélkül, hogy az eredeti modellre alkalmazott felhasználói szintű biztonsági korlátok megmaradnának. Nagyszériás distilláció felgyorsíthatja fejlett képességek terjedését anélkül, hogy ugyanazt a befektetést tennék a biztonságba — ez különösen aggályos kettős felhasználású (dual‑use) területeken. Az OpenAI hangsúlyozza, hogy ez a kockázat nem kizárólag rájuk vonatkozik; más fejlett rendszerek is érintettek lehetnek, ezért iparági együttműködést tartanak szükségesnek.
Végrehajtott mitigációk
Az OpenAI többféle lépéssel fékezte meg a kampányt:
- Számla‑végrehajtás: csaló vagy visszaélő fiókok tiltása vagy korlátozása.
- Infrastruktúra és regisztrációs kontrollok megerősítése: erősítették a feliratkozási és infrastruktúra‑ellenőrzéseket.
- Monitoring kiterjesztése: további hálózatok figyelése a kapcsolódó aktivitások azonosítására.
- Védett érvelés védelmének megerősítése felhasználói fiókok, munkaterületek, szervezetek és modellcsaládok szintjén.
- Elzártak egy útvonalat, amely lehetővé tette volna, hogy valaki, aki már rendelkezik egy másik felhasználó titkosított érvelésével, azt újrajátszhassa és visszanyerje a tartalmat.
- Hozzáadtak ellenőrzéseket olyan folyamatos (streamelt) kimenetek megtartására, amelyek felfedhetnék az érvelést.
- Amikor az aktivitás harmadik fél szolgáltatásain keresztül mozgott, együttműködtek ezekkel a szolgáltatókkal az érintett fiókok azonosításában és feltartóztatásában.
Iparági és kormányzati együttműködés
Az OpenAI megosztotta megállapításait a Frontier Model Forumon és megfelelő kormányzati információ‑megosztó csatornákon, hogy más fejlesztők és közszféra partnerek is ellenőrizhessék hasonló tevékenységek jelenlétét és megerősíthessék saját védelmeiket. Különösen azokra a rendszerekre hívják fel a figyelmet, amelyek hordozható vagy újrajátszható érvelési artefaktumokat támogatnak.
A jövő és a további munka
Az OpenAI szerint az adversarial distillation kísérletek valószínűleg egyre kifinomultabbá válnak, ahogy a frontier modellek fejlődnek és a szereplők olcsóbb módokat keresnek képességeik lemásolására. A védekezéshez rétegzett kontrollokra és folyamatos alkalmazkodásra van szükség. A cég továbbra is javítja a tool‑védelmeket, a klasszifikátorok lefedettségét, a modell‑visszautasításokat, és a releváns kontrollokat kiterjeszti felhőpartnereire is.
Záró megjegyzés
Az OpenAI megjegyzi, hogy a közölt számok a kísérletek megkísérlését írják le, nem feltétlenül azt, hogy minden próbálkozás sikeres volt. A vizsgálat és a mitigációs munka tovább folyik.



