Dario Amodei, az Anthropic vezérigazgatója az AI Safety Summiton tartott előre elkészített beszédében ismertette a vállalat Felelős Skálázás Politikáját (Responsible Scaling Policy, RSP) és az RSP részeként bevezetett AI safety levels (ASL) rendszert. A beszéd szövegét az Anthropic 2023. november 1-jei közzététel szerint nyilvánosságra hozták. A cég RSP-jét először szeptemberben publikálták; Anthropic így az első jelentősebb AI-cégek közé tartozik, amely ilyen nyilvános politikát vezetett be.
Miért van szükség RSP-re?
Amodei kiemelte, hogy az AI fejlesztése rendkívül gyorsan halad: néhány év alatt a rendszerek egyszerű mondatok összefűzésétől odáig jutottak, hogy orvosi vizsgákat le tudnak tenni vagy kreatív munkákat végeznek. Ezt a gyors előrehaladást részben a rendelkezésre álló számítási kapacitás növekedése hajtja, amely szerinte körülbelül évente nyolcszorosára növekszik. Ugyanakkor nehéz megjósolni, hogy mikor jelennek meg bizonyos specifikus képességek — köztük veszélyes képességek, például biológiai fegyverek létrehozásához használható tudás.
A RSP célja kettős: gyakori, rendszeres tesztelést biztosítani a skálázódás során megjelenő veszélyes képességek felderítésére, és egy előre meghatározott protokollt a reagálásra, ha ilyen képességek felbukkannak. Az RSP ötleteit részben az Alignment Research Center javaslata ihlette.
Az AI Safety Levels (ASL) rendszere
Az ASL rendszert részben a biológiai biztonsági szintek (BSL) mintájára alkották meg. Minden ASL-szint „ha–akkor" (if–then) szerkezetű előírásokat tartalmaz: ha az adott modell bizonyos veszélyes képességeket mutat, akkor a további képzést vagy üzembe állítást csak meghatározott biztonsági intézkedések megléte esetén engedélyezik.
- ASL-1: Alacsony vagy elhanyagolható kockázatú modellek, például szűk feladatra tervezett sakkjátékoló AI.
- ASL-2: A jelenlegi állapotot írja le — modellek, amelyeknél számos mai kockázat jelen van, de még nem rendelkeznek olyan súlyos képességekkel, amelyek katasztrofális következményekhez vezetnének biológia vagy kémia terén. Az Anthropic RSP-je előírja az ASL-2 szintnél a mai legjobb gyakorlatokat, mint például model cardok, külső red-teaming és erős biztonsági intézkedések.
- ASL-3: Az a pont, amikor a modellek működésileg alkalmasak lehetnek katasztrofális visszaélésekre CBRN (vegyi, biológiai, radiológiai és nukleáris) területeken, a szakértők megítélése és a meglévő bizonyítékok összevetése alapján. ASL-3 elérésekor az Anthropic követelményei közé tartozik:
- Rendkívül erős biztonsági intézkedések, hogy a nem állami szereplők ne tudják ellopni a modell súlyait, és az állami szereplőknek jelentős erőfeszítést kelljen tenniük az hozzáféréshez.
- A telepített ASL-3 modellek soha nem adhatnak olyan információt, amely működésben növelné a CBRN kockázatokat, még akkor sem, ha világelső szakértők red-teamelik őket együtt AI mérnökökkel. Amodei szerint ennek elérése kutatási áttördést igényel, de elengedhetetlen feltétele a biztonságnak.
- ASL-4-nek pontosan definiáltnak kell lennie, mire az ASL-3 bekövetkezik.
- ASL-4: Az ASL-3-hoz képest fokozott katasztrofális visszaélési kockázatot jelent, és új kockázatként megjelenik az autonóm rendszerek emberi irányítástól való elszakadásának lehetősége. Nagyjából akkor válik érvényessé, ha a rendszerek közel emberi szintű autonómiára válnak képessé, vagy ha a világ egyik fő forrásává válnak legalább egy súlyos globális biztonsági fenyegetésnek (például biológiai fegyverek). Az ASL-4 elérésekor várhatóan részletes, precíz belső megértést kérnek a modellről annak érdekében, hogy pozitív, alátámasztott állítást ("affirmative case") tegyenek a modell biztonságosságáról.
Gyakorlati tapasztalatok és belső követelmények
Amodei hangsúlyozta, hogy a vezetés erős elköteleződése elengedhetetlen: a saját bevallása szerint 3 hónapon át heti munkaidejének 10–20%-át fordította az RSP kidolgozására, több vázlatot is ő maga írva. Egyik társalapító pedig ugyanennyi ideig 50%-os munkaidő-befektetést végzett az RSP fejlesztésére. Ez a vezetői ráfordítás világos jele volt annak, hogy a cég felső vezetése komolyan veszi az AI-biztonságot.
A RSP-protokollokból termék- és kutatási követelményeket kell csinálni, hogy ezek beépüljenek a tervezésbe és a csapatok ütemterveibe. Anthropicnál például a biztonsági, trust and safety, red teaming és interpretability csapatok felvételi ütemét jelentősen fokozni kellett, hogy reális esély legyen az ASL-3 biztonsági intézkedések teljesítésére, amikor ASL-3 modellek megjelennek.
Felelősségre vonhatóság is szükséges: az Anthropic RSP-je a menedzsment testület formális irányelve, amely végső soron a Long Term Benefit Trustnak felelős — ez egy külső szakértői panel, amelynek nincs pénzügyi érdekeltsége az Anthropicban. Működési oldalon a vállalat be fog vezetni egy whistleblower (bejelentő) politikát még az ASL-3 előtt, és már kinevezett egy tisztviselőt, aki az RSP-nek való megfelelésért felel, és jelent a Long Term Benefit Trustnak. Amint a kockázatok növekednek, az Anthropic további, erősebb felelőségi formákat vár el.
RSP és szabályozás viszonya
Amodei egyértelművé tette, hogy az RSP-k nem helyettesítik a jogszabályokat, hanem prototípusként szolgálhatnak a szabályozás számára. Nem céljuk, hogy szó szerint törvénybe foglalják az Anthropic policy-ját; az RSP egy első próbálkozás egy komplex probléma kezelésére, amely vélhetően sok ponton tökéletlen. Ahogy a cégek végrehajtják és finomítják ezeket a politikákat, értékes tapasztalatokat fognak gyűjteni arról, hogyan lehet ésszerűen operacionalizálni a kötelezettségvállalásokat. Anthropic reménye szerint az RSP-hez hasonló keretrendszerek „versenyképes emelkedése" (race to the top) alakulhat ki, amelyben cégek és országok egymás ötleteire építve javítják a tesztelési és auditálási rendszereket elszámoltathatósággal és felügyelettel.
Összegzés
Az Anthropic RSP-je és az ASL-rendszer célja, hogy a gyorsan fejlődő AI-képességek megjelenésekor időben és rendszeresen észleljék a veszélyes képességeket, és egyértelmű, végrehajtható követelményeket állítsanak fel a további fejlesztésre vagy telepítésre. A vállalat belső szervezeti változtatásokat és külső elszámoltathatósági mechanizmusokat helyezett kilátásba annak érdekében, hogy az RSP-ben foglaltakat érdemben betarthatóvá tegye, miközben azt reméli, hogy a politika más cégeknél és kormányoknál is fejlődni fog és beépül a szabályozási keretekbe.



