- szeptember 19-én az Anthropic nyilvánosságra hozta a Responsible Scaling Policy (RSP) nevű belső irányelvét, amely műszaki és szervezeti protokollokat foglal össze az egyre képességesebb mesterséges intelligencia rendszerek fejlesztésével járó kockázatok kezelésére.
Miért vezetik be az RSP-t
Az Anthropic szerint a nagyobb képességű modellek jelentős gazdasági és társadalmi értéket teremthetnek, ugyanakkor súlyosabb kockázatokat is hordoznak. Az RSP elsősorban a katasztrofális kockázatokra fókuszál — olyan eseményekre, ahol egy AI modell közvetlenül nagy léptékű pusztítást okozhat. Az ilyen kockázatok forrása lehet a modellek szándékos visszaélésszerű felhasználása (például terrorista vagy állami szereplők biológiai fegyver előállításában), vagy autonóm működés miatti, a tervezők szándékával ellentétes cselekedet.
Az AI Safety Levels (ASL) keretrendszer
Az RSP egy AI Safety Levels (ASL) nevű rendszert vezet be, amelyet lazán a biosafety level (BSL) szabványok mintájára modelleztek. Az elv: egy modell potenciális katasztrofális kockázatának megfelelő biztonsági, biztonság- és üzemeltetési követelményeket támasztani; a magasabb ASL szintek szigorúbb biztonsági igazolásokat követelnek meg.
A rövidített ASL-összefoglaló a következő:
- ASL-1: rendszerek, amelyek nem jelentenek érdemi katasztrofális kockázatot (például egy 2018-as nagy nyelvi modell vagy egy sakkjátszó AI).
- ASL-2: rendszerek, amelyek már mutatnak a veszélyes képességek korai jeleit — például útmutatót adhatnak biológiai fegyver előállításához — de az információ még nem elég használható a megbízhatóság hiánya vagy azért, mert egy keresőmotor sem adna hasznosabbat. A jelenlegi LLM-ek, köztük a Claude, az Anthropic szerint ASL-2 szintűek.
- ASL-3: olyan rendszerek, amelyek jelentősen növelik a katasztrofális visszaélés kockázatát a nem-AI alapokhoz (például keresők vagy tankönyvek) képest, VAGY alacsony szintű autonóm képességeket mutatnak.
- ASL-4 és azt követő szintek (ASL-5+): egyelőre nincsenek részletezve, mivel jelen rendszerektől távolinak tartják őket; várhatóan minőségi ugrást jelentenek a visszaélés potenciáljában és autonómiában.
Az egyes szintek definícióit, kritériumait és biztonsági intézkedéseit a teljes dokumentum részletesen tárgyalja. Magas szinten az ASL-2 jelenlegi biztonsági és védelmi standardokat jelenti, amelyek jelentős átfedést mutatnak az Anthropic által korábban tett White House commitments vállalásokkal. Az ASL-3 követelményei ennél szigorúbbak: például nagyon erős biztonsági feltételek és az a vállalás, hogy nem telepítenek ASL-3 modellt, ha az világklasszis red-teamerek elleni támadási tesztelése során bármilyen érdemi katasztrofális visszaélési kockázatot mutat — ez túlmutat a pusztán red-teaming elvégzésére tett kötelezettségen.
Az ASL-4 intézkedéseit még nem írták le (az Anthropic elkötelezett amellett, hogy megalkotja azokat mielőtt ASL-3 szintre lépnének), és ezek valószínűleg olyan, napjainkban megoldatlan kutatási problémákhoz köthetők, mint az interpretálhatósági módszerek használata a mechanisztikus bizonyításra arról, hogy egy modell valószínűtlenül fog bizonyos katasztrofális viselkedéseket tanúsítani.
Gyakorlati hatás és üzleti megfontolások
Az Anthropic hangsúlyozza, hogy az RSP nem fogja megváltoztatni a Claude jelenlegi felhasználását vagy megzavarni termékei elérhetőségét. A politikát az autó- vagy repülőgépipar előzetes piaci teszteléséhez és biztonsági tervezéséhez hasonlítják: a cél a termék biztonságának szigorú bizonyítása a piacra kerülés előtt, ami végső soron az ügyfelek javát szolgálja.
A rendszer úgy lett kialakítva, hogy egyensúlyt teremtsen a katasztrofális kockázatok hatékony célzása és a hasznos alkalmazások, illetve a biztonsági előrelépés ösztönzése között. Ennek része az a mechanizmus is, hogy ha a skálázódás megelőzi a szükséges biztonsági eljárások betartását, ideiglenesen leállíthatják nagyobb modellek betanítását; ugyanakkor a megközelítés arra ösztönöz, hogy a biztonsági problémák megoldása oldja fel a további skálázódás korlátait. Emellett a korábbi ASL-szint legerősebb modelljeit felhasználhatják a következő szint biztonsági fejlesztéseinek kidolgozásához.
Kormányzati és iparági hatás
Az Anthropic reménye szerint, ha a keretrendszert a „frontvonalbeli” laborok között szabvánnyá fogadják el, az egyfajta „verseny a csúcsért” dinamikát teremthet, ahol a verseny ösztönzői közvetlenül a biztonsági problémák megoldására irányulnak.
Döntéshozatal és külső szakértelem
Az RSP-t az Anthropic igazgatótanácsa formálisan jóváhagyta, és a szabályzat módosításai is az igazgatótanács jóváhagyásától függenek, a Long Term Benefit Trust konzultációját követően. A teljes dokumentumban több eljárási biztosítékot írnak le az értékelési folyamat integritásának megőrzésére.
Az Anthropic köszönetét fejezte ki az ARC Evals szervezetnek, amely kulcsfontosságú szakértelmet és betekintést nyújtott az RSP kialakításához, különösen az autonóm képességek értékelése terén. Az Anthropic elismerte az ARC Evals vezető szerepét az általuk kidolgozott szélesebb ARC Responsible Scaling Policy keretrendszer eredetében és népszerűsítésében, amely inspirálta az Anthropic megközelítését.
Záró megjegyzés
Az Anthropic hangsúlyozza, hogy az RSP jelenlegi kötelezettségvállalások egy első iterációt képviselnek — a gyorsan változó AI-kutatási környezet miatt a dokumentum várhatóan fejlődni fog és szükség lehet további korrekciókra. A teljes Responsible Scaling Policy dokumentum részletes szövege az Anthropic által publikált anyagban érhető el.



