A brit AI-biztonsággal foglalkozó startup, a Mindgard kutatói azt állítják, hogy a ChatGPT legfrissebb változata képes erőszakot és szexualitást tartalmazó képeket generálni anélkül, hogy a felhasználói utasítás kifejezetten ilyen témát említene. A vizsgálat szerint a modell reagálása akkor is problémás volt, amikor a bemeneti prompt egy széles körben elterjedt, eredetileg humoros célra használt parancs volt.
A BBC-nek nyilatkozva a Mindgard alapítója, Peter Garraghan különösen aggasztónak nevezte, hogy az utasítás nem tartalmazta a képek témáját, a rendszer mégis erőszakos és szexuális tartalmakat hozott létre. A lap által megtekintett generált képek között volt egy, amelyen egy súlyos fejsérülést szenvedett férfi látszott, és egy másik, amelyen egy nő arcát és testét vér borította; a Mindgard szerint az utóbbi egy szexuális erőszak utáni állapotot ábrázol.
A Mindgard szerint a képeken szereplő személyek mesterségesen generáltak, ugyanakkor a vállalat úgy találta, hogy a ChatGPT könnyen rávehető arra is, hogy valódi embereket ábrázoljon például szexuális pózban.
A kutatók rámutatnak: mivel a ChatGPT-t és hasonló rendszereket az internetes adathalmazokon képezték, az ilyenfajta kimenetek sokat elárulhatnak arról, milyen jellegű példák szerepelhettek a tanítóanyagban.
A BBC biztonsági okokra hivatkozva nem közölte a Mindgard által használt konkrét parancsok tartalmát. A kiberbiztonsági szakértők ugyanakkor azt is megjegyezték, hogy a korábban módosított utasítás további apró változtatásaival a modell továbbra is képes volt aggasztó tartalmakat előállítani.
Az OpenAI-t megkereste a BBC; a cég válasza szerint már megtettek lépéseket annak érdekében, hogy a rendszer ne generáljon többé ilyen jellegű képeket, és többrétegű védelmi intézkedéseket alkalmaznak a felhasználási feltételekkel ellentétes tartalom előállításának megakadályozására. Az OpenAI szabályzata — más nagy szereplőkéhez hasonlóan — tiltja a szexuális erőszakot, a beleegyezés nélküli intim tartalmakat, a gyermekek szexuális bántalmazásával kapcsolatos anyagok generálását, valamint a biztonsági védelmek kijátszására irányuló kísérleteket.
Miért számít ez?
Az incidens rávilágít arra a kihívásra, hogy a nagy nyelvi és képmodellek hogyan kezelik a nem kívánt vagy káros tartalmakat, különösen akkor, ha a felhasználói utasítás nem egyértelmű vagy ártalmatlannak tűnik. A kutatások azt mutatják, hogy a védelem szintje és a provokációra adott modellválaszok közötti egyensúly finom és folyamatos karbantartást igényel.
A Mindgard eredményei és az OpenAI reakciója a rendszer további fejlesztésére és a biztonsági mechanizmusok megerősítésére irányuló törekvéseket tükrözik, ugyanakkor a kutatók figyelmeztetnek, hogy a jelenleg alkalmazott korlátozások kijátszhatók maradhatnak.
Összegzés
A Mindgard által azonosított problémák miatt a ChatGPT jelenlegi változata képes nem kívánatos erőszakos és szexuális képeket előállítani egy általános, széles körben használt prompt hatására. Az OpenAI szerint lépések történtek a probléma kezelése érdekében, de a kutatók szerint további finomításokra és folyamatos felügyeletre lesz szükség annak biztosítására, hogy a modell ne állítson elő tiltott vagy ártalmas tartalmat.



