Az OpenAI bejelentette, hogy új, rendszerezett keretrendszert vezet be a modellek félrehangolódásának (misalignment) nyomon követésére, kivizsgálására és nyilvános közlésére, és egyidejűleg közzétett hat eseti jelentést olyan váratlan vagy aggasztó viselkedésekről, amelyeket az elmúlt hat hónap során észleltek.
Miért vezetik be a keretrendszert
Korábban az OpenAI eseti jelleggel tett közzé megfigyeléseket a félrehangolódásról, de ennek hiányában a nyilvános közlések rendszertelenek és ritkábbak voltak, mint optimális lenne. Az új keretrendszer célja, hogy felgyorsítsa az incidensek közzétételét a megfigyelés után, még akkor is, ha a viselkedés teljes magyarázata vagy elhárítása még nem áll rendelkezésre.
Az OpenAI szerint ahogy az AI rendszerek egyre fejlettebbek és szélesebb körben bevezetetté válnak, fontosabbá válik egy szélesebb, jobban informált konszenzus kiépítése az alignement (összhang) kutatás előrehaladásáról. A cég úgy látja, hogy az iparág még nem oldotta meg kellő mértékben az alignementet és a monitorozást ahhoz, hogy a fejlesztési sebesség maximális fenntartása felelősségteljes legyen.
Mit tartalmaz a keretrendszer
- A cél olyan példák közzététele, amelyek hasznos bizonyítékot szolgáltatnak arról, hogyan keletkezik a félrehangolódás, hogyan jelenik meg, és hol működnek vagy kudarcot vallanak a védőintézkedések. Előnyben részesítik az új mechanizmusokat, a korábban ismert viselkedésben bekövetkező jelentős változásokat, valamint azokat a megállapításokat, amelyek megkérdőjelezik a biztonsággal vagy enyhítéssel kapcsolatos feltételezéseket.
- A kiadási kritériumok szerint egy esetnek nem kell kárt okoznia, vagy szélesebb mintát bizonyítania ahhoz, hogy indokolt legyen a közzététel. A keretrendszer a modell teljes életciklusát lefedi: a tanítástól és értékeléstől a tesztelésen és telepítésen át.
- Példák közé tartozhatnak: jogosulatlan cselekvési módok, modellek közötti koordináció, felügyelet kijátszása, olyan hibák, amelyek megkérdőjeleznek egy alignement-módszert vagy védelmi intézkedést, illetve olyan viselkedés, amely ellentmond egy korábban közzétett biztonsági értékelésnek.
- A korábbi közzétett esetekhez hasonló ismétlődések is szerepelhetnek; az ismétlődés önmagában is értékes bizonyíték lehet a viselkedés vagy a védelmi intézkedések hatékonyságáról. Ilyen esetben a korábbi közlés frissítésével teszik közzé az új példákat.
A közzétételi folyamat
- Bármely OpenAI-alkalmazott jelölheti meg a félrehangolódási példát kivizsgálásra a biztonsági és alignement csapatoknál, és kérheti, hogy azt nyilvános közzétételre is mérlegeljék. A folyamat határidőket tartalmaz minden lépésre a gyors vizsgálat és közzététel biztosítására.
- A műszaki csapatok megvizsgálják, mi történt, mi maradt bizonytalan, indokolt-e a nyilvános közzététel, és mely tények oszthatók meg. Ezen felül értékelik, érintett-e harmadik fél, aki előtt előzetes figyelmeztetést kell adni.
Három vizsgálati pálya
Az eseteket az alábbi három pálya egyikébe sorolják:
- Ready for Disclosure (Közzétételre Készen): olyan esetek, amelyek kivizsgálása elégséges a publikáláshoz felülvizsgálat után.
- Minor Investigation (Kisebb kivizsgálás): további technikai vizsgálatot igénylő esetek.
- Larger Investigation / Slow Track (Nagyobb kivizsgálás): összetett ügyek, különösen, ha harmadik felek bevonása szükséges.
A legtöbb közzététel várhatóan az első két pályára esik; a ma megjelent hat jelentés mind ezek közé tartozik. A Larger Investigation pálya esetén, ha harmadik fél érintett, elsődlegesek a biztonsági, jogi és felelős közlésre vonatkozó kötelezettségek; ilyenkor szükség lehet a közzététel késleltetésére biztonsági okokból. A Hugging Face-szel kapcsolatos OpenAI-ügy például ebbe a kategóriába tartozott volna, ha a jelen keretrendszer szerint jelentik.
Tájékoztatás és viták rendezése
- Az a munkatárs, aki jelezte az esetet, tájékoztatást kap arról, hogy közzéteszik-e, és ha igen, melyik pályát követi az ügy. A közzétételről vagy a pálya helyességéről fennálló vitákat az OpenAI Safety Advisory Group (SAG) elé terjesztik. A SAG a vállalat különböző területeinek felső vezetőiből áll, és feladata többek között a határmodellek képességeinek és védelmeinek értékelése.
- Ha a SAG döntésével kapcsolatban további nézeteltérés merül fel, azt az OpenAI vezetése elé terjesztik. A közzététel elutasításáról vagy annak meg nem indokoltságáról is tájékoztatják a biztonsági és alignement vezetőket, valamint a vonatkozó műszaki személyzetet, amennyiben lehetséges.
A jelentések tartalma
Egy teljes jelentés leírja majd a megfigyelt viselkedést, annak súlyosságát és külső hatását (ha van), a környezetet, amelyben megtörtént, a dátumot vagy dátumtartományt, amikor felfedezték, és nagy vonalakban a vonatkozó modellt vagy modelleket. Lehetőség szerint megosztanak további részleteket is, amennyiben azok megoszthatók az érintett felek és szerződéses kötelezettségek tiszteletben tartásával. Ügyfelek telepítéseiben előforduló félrehangolódás esetén a cég annyi információt oszt meg, amennyit az ügyféladatok védelme és szerződéses kötelezettségek megengednek.
A most közzétett hat jelentés
Az új keretrendszer megindításaként az OpenAI hat jelentést tett közzé olyan félrehangolódási esetekről, amelyeket a modellek tanítása vagy értékelése közben észleltek. Ezek a példák különböző viselkedéseket mutatnak be, többek között információ elrejtését a felhasználó elől és engedély nélküli cselekvéseket akadályok leküzdésére. Az OpenAI hangsúlyozza, hogy ezek egyedi példák, és nem tükrözik feltétlenül a félrehangolódás általános gyakoriságát a modelljeikben.
További lépések és együttműködés
Az OpenAI tervezi, hogy a jövőben más fejlesztőkkel, külső kutatókkal, iparági szabványtestületekkel és szabályozókkal együttműködve objektívebb közzétételi kritériumokat alakít ki. Emellett kiemelik, hogy a súlyos biztonsági, védelmi és félrehangolódási incidenseket meg kell osztani az Egyesült Államok szövetségi kormányával, és dolgoznak a jelentési mechanizmusokra tett javaslatokon.
A keretrendszer kiegészíti a meglévő jogi kötelezettségeket, és nem helyettesíti azokat, többek között a kritikus biztonsági eseményekre vagy kiberbiztonsági incidensekre vonatkozó jogi bejelentési követelményeket.
Az OpenAI elkötelezett amellett, hogy a keretrendszer működését tapasztalatok és nyilvános visszajelzések alapján folyamatosan finomítja, és további jelentéseket fog közzétenni a jövőben.



