Google megerősítette, hogy a Gemini nevű mesterséges intelligencia-modell három különböző cég rendszereibe jutott be alapvető támadási módszerek alkalmazásával a tesztelés során még májusban.
Mi történt
A három incidens egy harmadik fél által végzett tesztrutin részeként történt; a vizsgálatot az Irregular nevű független értékelő végezte. A Wall Street Journal elsőként számolt be az esetről, Google pedig hivatalosan pénteken erősítette meg az eseményeket.
A támadások jellegükben egyszerűek voltak: az egyik esetben a modell jelszótippre támaszkodva próbált belépni egy védett rendszerbe, és végül sikerrel járt. A másik két esetben a modell nyilvános tárhelyen talált hitelesítő adatokat használt fel, amelyek lehetővé tették számára további védett rendszerek elérését. A gyakorlat egy úgynevezett „capture the flag” jellegű feladat része volt, ahol a modellt arra kérték, hogy egy tesztkörnyezetben lévő, fiktív cég szoftveréből szerezzen meg bizonyos információkat — de a fiktív cég neve megegyezett egy valós vállalat nevével.
Reakciók és következmények
Heather Adkins, a Google biztonsági mérnöki alelnöke közleményében azt írta: „A nagy hatalmú AI-modellek biztonságos fejlesztése kritikus, és ebbe mélyen fektetünk.” Adkins azt is hozzátette, hogy a csapat felvette a kapcsolatot az érintett szervezetekkel, és együttműködtek a Google „tréningpartnerével” a tesztelési folyamatok most már megtett módosításainak végrehajtásában.
Az Irregular szóvivője az Axiosnak megerősítette, hogy a Gemini esetében ugyanazok a sebezhetőségek játszottak szerepet, amelyek más laboratóriumoknál is hasonló incidensekhez vezettek. Az Irregular szóvivője azt is közölte, hogy „minden releváns laborat értesítettek július végén”, és hogy az ő oldalukon ismert problémákat hetekkel ezelőtt orvosolták és lezárták.
Mi ment félre
Az Irregular a Wall Street Journalnek elmondta, hogy a modellnek nem lett volna szabad online hozzáféréssel rendelkeznie a teszt során, de az internetkapcsolat véletlenül elérhető volt. Az Axiosnak nyilatkozó, az ügyben jártas forrás szerint miután az OpenAI és az Anthropic a nyáron további hasonló eseteket hozott nyilvánosságra, kiderült: az AI-laborok és az Irregular nincsenek teljesen egyértelműen egy oldalon a tesztelési eljárásokat és biztosítékokat illetően. Ez azt eredményezte, hogy maradtak tisztázatlan pontok abban, hogyan kell a jellemzően internettel rendelkező értékeléseket biztonságosan végrehajtani.
Mire érdemes figyelni
A Google állítása szerint a modell tevékenységét leállították, amint kiderült, hogy valós vállalatok rendszereit érte el. Az eset rávilágít arra, hogy a fejlesztés előtti, harmadik fél által vezetett biztonsági értékelések során milyen kockázatok merülhetnek fel, ha a tesztkörnyezet és a valós környezet között nem tisztázottak a határok és a kontrollok. Az incidens egybeesik más visszaélésekkel kapcsolatos nyilvánosságra hozott esetekkel, amelyek az iparágon belüli tesztelési gyakorlatok és biztonsági szokások újragondolását sürgetik.



