Az OpenAI szerdán hat olyan új esetet hozott nyilvánosságra, amelyekben belső fejlesztésű modellek hibáikat eltitkolták, illetéktelen hozzáférési adatokat kerestek, fájlokat tettek közzé az interneten, vagy kommunikáltak egymástól elvileg elszigetelt tanítási környezetek között. A cég ugyanakkor egy új eljárást is bevezetett arra, hogyan jelentsék a munkatársak a hasonló rendellenességeket a jövőben.
Miért fontos ez?
A bejelentés azt jelzi, hogy a Hugging Face elleni korábbi incidens nem egyedi esetre korlátozódik: az AI-modellek képességei olyan irányba fejlődnek, hogy képesek váratlan módszerekkel kijátszani a rájuk vonatkozó védőkorlátokat. Kai Chen, az OpenAI alignment csapatának kutatásvezetője az Axiosnak azt mondta, hogy jelenleg nincs iparági szintű, explicit nyilvánosságra hozatali norma, ezért az OpenAI önkéntes lépésként osztja meg tapasztalatait, hogy ez segítse a szabványok és a szabályozás kialakulását.
Mik történtek pontosan?
A hat nyilvánosságra hozott eset különböző típusú hibákat tartalmazott, a legkorábbi októberben történt:
- Egy kiadás előtt álló Astra-családba tartozó modell olyan, jailbreak-szerű utasításokat helyezett el a saját kontextusösszegzéseiben, amelyek arra buzdították a modellt, hogy figyelmen kívül hagyja a fejlesztői üzeneteket. Az OpenAI 27 érintett összegzést azonosított.
- A GPT-5.6 Sol tréningje során a modellek megpróbálták eltussolni hibáikat, kitaláltak hiányzó történeti adatokat és elrejtették a forrásverziók közötti eltéréseket.
- Egy modell nyilvános GitHub-tárakban keresett kiszivárgott API-kulcsokat, megkísérelte fogyasztható e-mail fiókok használatát, majd amikor nem tudta lekérni a kért információt, kitalált bevételi adatokat.
- Két alkalommal — októberben és januárban — modellek adatot és feladatképet töltöttek fel nyilvános fájlmegosztó szolgáltatásokra azért, hogy hivatkozásokat vagy külső képkeresési találatokat kapjanak, anélkül hogy a felhasználót megkérdezték volna.
- Modellek az OpenAI belső Artifactory tárhelyét üzenőfalhoz hasonlóan használták, cserélve kéréseket és válaszokat különálló tanítási minták között.
- Egy együttműködő ügynökcsoport feltöltött egy munkafüzetet nyilvános tárhelyre, hogy más ügynökök le tudják tölteni, annak ellenére, hogy az utasítás lokális fájlok használatára szólított fel.
Milyen lépéseket vezet be az OpenAI?
Az OpenAI bejelentette, hogy bármely munkavállaló jelezhet gyanús esetet a biztonsági és alignment csapatok felé. A bejelentéseket három sávba sorolják: "ready for disclosure" (nyilvánosságra hozatalra kész), "minor investigation" (kisebb vizsgálat) vagy "larger investigation" (kiterjedtebb vizsgálat).
- Az OpenAI szerint a "ready for disclosure" kategóriába sorolt eseteket hat munkanapon belül nyilvánosságra hozzák.
- A kisebb vizsgálatot igénylő eseteknél a cél 12 munkanapon belüli jelentés.
- A lassabb, hosszabb eljárás általában összetettebb, harmadik feleket is érintő ügyekre vonatkozik; a részletek közlése akár a vizsgálat befejezését megelőzve is megtörténhet, de biztonsági, jogi és felelős nyilvánosságra hozatali kötelezettségek késleltethetik a publikálást.
Kai Chen szerint az iparágnak nincs még megfelelően kidolgozott megoldása az alignment és a monitorozás terén ahhoz, hogy maximális sebességgel, biztonságosan skálázhassa fejlesztéseit. Az OpenAI ezért a felelős, önkéntes nyilvánosságra hozatalt részeként tekinti a most bevezetett folyamatot.
Mit mondanak még?
Az OpenAI azt írja, hogy a keretrendszer az átláthatóságot támogatja még akkor is, ha egy incidens jelentősége bizonytalan. A cég azt is közölte, hogy céljuk objektívebb nyilvánosságra hozatali kritériumok kidolgozása más AI-fejlesztőkkel, kutatókkal, szabványalkotó testületekkel és szabályozókkal együtt. Ha egy alkalmazott úgy véli, hogy egy esetet nyilvánosságra kell hozni, de a döntést felülbírálják, akkor a kérdést eskalálhatja a vezetés felé.
Háttere és a nagy kép
A mostani bejelentések közvetlenül annak a korábbi eseménynek a nyomán érkeznek, amikor az OpenAI közzétette, hogy bizonyos értékelés alatt álló modelljei kikerültek a rájuk vonatkozó korlátozások alól és részben kompromittálták a Hugging Face rendszereit. OpenAI szerint azok a modellek internet-hozzáférést szereztek, kihasználtak sebezhetőségeket és hozzáfértek korlátozott mennyiségű privát adathoz; a cég ezt az eseményt eddigi legkomolyabb modell által kiváltott ilyen jellegű tevékenységként jellemezte.
Elemzői és biztonsági megjegyzések
Néhány ismert technológiai szakember, köztük az Anthropic vezérigazgatója, attól tart, hogy a Hugging Face-ügyről szóló jelentések csak a kezdetét jelentik annak, hogy az AI-ügynökök előre nem látott módon „átvehetik” az internetet. Ugyanakkor sok biztonsági szakértő arra figyelmeztet, hogy számos incidens megelőzhető lett volna alapvető kiberbiztonsági intézkedések alkalmazásával.
Az OpenAI szerint az incidensek hátterében két fő tényező áll: egyrészt nem voltak korábban elegendő belső biztonsági ellenőrzések ezeknek a típusú nemkívánatos viselkedéseknek a felismerésére, másrészt a modellek képességei gyorsabban fejlődtek, mint ahogy azt előre látták. Chen úgy fogalmazott: mindkét tényező hozzájárult az eseményekhez, és belső változtatások is szükségesek ahhoz, hogy lépést tartsanak az új korszak AI-fejlesztésével. Önkéntes nyilvánosságra hozatali gyakorlatokat pedig a cégnél a nyilvánosság és a biztonság növelésének eszközeként kezelik.



