Biztonság

Mesterséges intelligenciával generált szöveg

Anthropic tapasztalatai a red teaming módszereiről és ajánlott irányelvek a szabványosításhoz

A cikk főszereplője az Anthropic, amely 2024.

Anthropic tapasztalatai a red teaming módszereiről és ajánlott irányelvek a szabványosításhoz
  1. június 12-én Anthropic részletezte tapasztalatait a saját AI rendszerein alkalmazott red teaming módszerekről, és javaslatokat tett a gyakorlatok iparági szabványosításához. A bejegyzés célja, hogy támpontot adjon más cégeknek, döntéshozóknak és szervezeteknek, amelyek red teamelni szeretnék az AI-technológiákat.

Mi a red teaming?

A red teaming ellenséges, támadásszerű tesztelés; célja, hogy feltárja egy technológiai rendszer gyenge pontjait és kockázatait. A gyakorlatban számos módszer létezik, amelyek különböző előnyökkel és kihívásokkal járnak. Anthropic hangsúlyozza, hogy a red teaming jelenlegi gyakorlata megosztott és nem egységesített, ami megnehezíti az eltérő rendszerek objektív összehasonlítását.

A cég szerint ezért fontos most dolgozni bevált eljárások és szabványok kialakításán, hogy kezelni lehessen a jelenlegi kockázatokat és felkészülni a jövőbeli, képességben nagyobb modellek által hozott veszélyekre.

A bemutatott red teaming módszerek (áttekintés)

  • Domain-specifikus, szakértői red teaming
  • Trust & Safety: Policy Vulnerability Testing (PVT)
  • Nemzetbiztonsági: frontier threats red teaming
  • Regionális: többnyelvű és multikulturális red teaming
  • Nyelvi modellek alkalmazása red teamingre
  • Automatizált red teaming
  • Új modalitások red teamelése
  • Multimodális red teaming
  • Nyílt végű, általános red teaming
  • Tömeges (crowdsourced) red teaming általános károk feltárásához
  • Közösségi alapú red teaming általános kockázatok és rendszerkorlátok feltérképezéséhez

A következő szakaszok részletesen tárgyalják ezeket a módszereket, kiemelve egyenként előnyöket és korlátokat.

Domain‑specifikus, szakértői red teaming

Ez a megközelítés tárgyi szakértelemmel rendelkező külső szereplők bevonását jelenti, akik mélyebben értik az adott kontextust és a komplex problémákat. Az ilyen együttműködés segít feltárni a specifikus, kontextusfüggő sérülékenységeket.

Trust & Safety: Policy Vulnerability Testing (PVT)

Magas kockázatú fenyegetések – amelyek súlyos károkat okozhatnak személyeknek vagy társadalmi hatással járnak – kifinomult red teaminget és külső szakértők bevonását igénylik. Anthropic PVT néven nevezett, mélyreható, kvalitatív tesztelést végez külső szakértőkkel együtt a Usage Policy által lefedett témákban. A cég említ néhány partner szervezetet: Thorn (gyermekvédelem), Institute for Strategic Dialogue (választási integritás) és Global Project Against Hate and Extremism (radikalizáció).

Nemzetbiztonsági „frontier” fenyegetések red teamingje

Anthropic folytatja a nemzetbiztonsági kockázatokra fókuszáló red teaming technikák fejlesztését, különösen a Chemical, Biological, Radiological, and Nuclear (CBRN), a kiberbiztonság és az autonóm AI-kockázatok területén. Külső szakértőkkel dolgoznak együtt mind a rendszerek tesztelésében, mind új értékelési módszerek közös kidolgozásában. Attól függően, hogy milyen a threat model, a red teamerek vagy a nyilvánosan használt, telepített Claude verziókat tesztelik „valós” környezetekben, vagy nem-kereskedelmi verziókat, amelyek eltérő kockázatcsökkentéseket alkalmaznak.

Többnyelvű és multikulturális red teaming

A legtöbb red teaming munka angol nyelven, jellemzően amerikai perspektívából zajlik. A hiányzó reprezentáció csökkentése érdekében Anthropic többnyelvű és lokális kontextusokra kiterjedő red teaminget is végez. Példaként együttműködtek Singapore Infocomm Media Development Authority (IMDA) és AI Verify Foundation szervezetekkel egy négy nyelvű (angol, tamil, mandarin és maláj) projektben, amely Szingapúrra releváns témákat tesztelt.

Nyelvi modellek használata red teamingre

Nyelvi modelleket lehet használni arra, hogy automatizáltan generáljanak ellenpéldákat és támadó bemeneteket más modellek ellen, kiegészítve ezzel a manuális tesztelést, és gyorsabb, szélesebb körű lefedettséget biztosítva.

Automatizált red teaming és a red team/blue team dinamika

Ahogy a modellek képességei növekednek, Anthropic azt vizsgálja, miként lehet a modelleket magukat bevonni automatizált red teamingbe. A gyakorlatban egy red team/blue team ciklust alkalmaznak: egy modell (red team) támadásokat generál, amelyek kiválthatják a célviselkedést, majd egy másik modell finomhangolása (blue team) következik ezekre az outputokra, hogy kevésbé legyen sebezhető hasonló támadásokkal szemben. Ezt a folyamatot ismételve új támadási vektorok fedezhetők fel és a rendszerek ellenállóbbá tehetők.

Red teaming új modalitásokban és multimodális rendszerekben

Új modalitások (például képek vagy hang) bevonása új típusú kockázatokat és hibamódokat hozhat felszínre. A Claude 3 modellek multimodálisak: bár nem generálnak képeket, vizuális információt tudnak fogadni (fotók, vázlatok, diagramok) és szöveges választ adni. A multimodális képességek speciális kockázatokat jelentenek (például csalások, gyermekvédelmi kockázatok, erőszakos szélsőségesség), ezért Anthropic előtelepítési red team munkát végzett Trust & Safety csapattal és külső red teamerekkel, hogy felmérjék a rendszer visszautasítási és kockázatkezelési viselkedését képi és szöveges inputok esetén.

Nyílt végű és közösségi, tömegbázisú red teaming

Anthropic 2022 közepén kezdte kutatási jelleggel a red teaminget, kezdetben kontrollált környezetben crowdworker-ekkel dolgozva. Azóta nyilvános események és kihívások, mint a DEF CON AI Village és a Generative Red Teaming (GRT) Challenge, szélesebb résztvevői réteget, köztük nem technikai hátterű személyeket is bevontak. A cég pozitívan értékelte a sokszínűség és kreativitás hozzájárulását a red teaming erőfeszítésekhez.

Kvalitatív red teamingből kvantitatív értékelésekig

Anthropic bemutatja, hogyan lehet a kvalitatív, emberi red teaming eredményeit automatizált, mennyiségi értékelésekké alakítani. A folyamat: a szakértők definiálnak egy fenyegetési modellt és ad hoc módon próbálják kiváltani a kockázatot; a red teamerek standardizálják a módszertant, finomítják a bemeneteket; ezek alapján nyelvi modellekkel nagy mennyiségű variációt generálnak a nagyobb lefedettség érdekében. Anthropic ezt az iteratív módszert alkalmazta a nemzetbiztonsági frontier threats munkában és az election integrity Policy Vulnerability Testingben, és tervezi további területeken is alkalmazni.

Ajánlott intézkedések döntéshozók számára

Anthropic a következő, konkrét lépéseket javasolja a red teaming elterjesztésének és szabványosításának elősegítésére:

  • Támogatni olyan szervezeteket, mint a National Institute of Standards and Technology (NIST), hogy technikai szabványokat és közös gyakorlatokat dolgozzanak ki az AI red teamingjére vonatkozóan.
  • Finanszírozni független kormányzati és nonprofit szervezetek létrehozását és működtetését, amelyek a fejlesztőkkel együttműködve red teamelhetik a rendszereket különböző doménekben; például a nemzetbiztonsági kockázatokhoz gyakran kormányzati szakértelemre lesz szükség.
  • Elősegíteni egy professzionális AI red teaming szolgáltatások piacának kialakulását, és létrehozni egy tanúsítási folyamatot azok számára, akik közös technikai szabványok szerint végeznek red teaminget.
  • Bátorítani az AI-vállalatokat, hogy engedjék és támogassák a hitelesített, kívülről érkező csoportok általi független red teaminget; dolgozzanak ki átláthatósági és modellhozzáférési szabványokat ennek biztonságos lebonyolítására.
  • Ösztönözni, hogy az AI cégek kössék red teaming gyakorlatukat világos belső politikákhoz, amelyek feltételeket szabnak a modellek további skálázásához és kiadásához (például Responsible Scaling Policy jellegű elköteleződések).

Záró gondolatok

Anthropic szerint a red teaming fontos eszköz az AI-rendszerek kockázatainak feltárására és mérséklésére. A bemutatott módszerek különböző felhasználási esetekhez és fenyegetési modellekhez kínálnak megoldásokat. A cég várja a további együttműködést más szereplőkkel, hogy ismételjék és szabványosítsák ezeket a módszereket, és hangsúlyozza, hogy a red teaming egy a sok eszköz közül, amelyek segítenek felelős és biztonságos AI fejlesztésében.