- június 13-án az Anthropic benyújtotta válaszát a National Telecommunications and Information Administration (NTIA) „Request for Comment on AI Accountability” felhívására, és nyilvánosságra hozta azon ajánlásait, amelyek a cég szerint az AI elszámoltathatóságának központi elemeit alkotják.
A vállalat rámutat, hogy ma nincs átfogó, megbízható eljárás az előrehaladott mesterséges intelligencia (AI) rendszerek értékelésére, és különösen hiányzik egy hosszabb távra vonatkozó, a még fejlettebb rendszerekre is alkalmazható folyamat. Anthropic javaslatai azokat a folyamatokat és infrastruktúrát vázolják fel, amelyek a szervezet szerint szükségesek az AI elszámoltathatóságához. A javaslatok tárgyalják az NTIA potenciális szerepét mint koordináló testület, amely más kormányzati intézményekkel, például a National Institute of Standards and Technology-vel (NIST) együttműködve szabványokat állíthat fel.
Főbb ajánlások
-
Finanszírozás az értékelések fejlesztésére
- Több forrást javasolnak az AI modellértékelési kutatás finanszírozására. A szigorú, szabványosított értékelések kidolgozása nehéz és időigényes feladat, amely jelentős erőforrásokat igényel, és ahol a kormányzati támogatás elősegítheti a haladást.
- Rövid távon azt javasolják, hogy az AI rendszereket üzemeltető vállalatokat kötelezzék az értékelési módszerek és eredmények közzétételére; ez a nyilvánosságra hozatal azonban nem szükségszerű, ha az IP- vagy titoktartási szempontból problémás lenne.
- Hosszú távon ipari értékelési szabványok és bevált gyakorlatok kidolgozását javasolják, amelyet olyan szervezetek mint a NIST koordinálhatnának.
-
Képesség-alapú, kockázatérzékeny értékelések
- Általános, szabványos képességértékeléseket kell fejleszteni az AI rendszerekhez, különösen azokra a kockázatokra célozva, amelyek az előrehaladott modellekből fakadhatnak (például megtévesztés vagy autonóm viselkedés).
- Több kutatás és finanszírozás révén kockázati küszöböt kell meghatározni. Ha egy modell egy ilyen küszöb alatt marad, a meglévő biztonsági szabványok elegendőek lehetnek: ebben az esetben a megfelelés ellenőrizhető és a modell telepíthető.
- Ha egy modell meghaladja a kockázati küszöböt, és a biztonsági értékelések illetve a megvalósított enyhítések nem elegendőek, a javaslat szerint a telepítést meg kell állítani, szigorúbb felügyeletet kell bevezetni és értesíteni kell a szabályozó hatóságokat; a telepítés csak a megfelelő védőintézkedések meghatározása után engedélyezhető.
-
Nagy tréningfuttatások előzetes regisztrációja
- Az Anthropic egy olyan folyamat létrehozását javasolja, amelyben az AI fejlesztők bejelentik a nagy számításigényű tréningfuttatásokat, hogy a szabályozók tisztában legyenek a potenciális kockázatokkal. Ennek része a címzett, a szükséges információk és a kibervédelmi, titoktartási, IP- és adatvédelmi garanciák meghatározása.
- Konkrétan egy bizalmas nyilvántartás létrehozását javasolják, amelyben az AI fejlesztők a nagy tréningfuttatások részleteit (például modell specifikációk, modell típus, számítási infrastruktúra, várható befejezési időpont, és biztonsági tervek) előre bejelenthetik saját országuk nemzeti kormányának. A nyilvántartás aggregált adatait a legmagasabb szintű védelmi szabványok szerint kell kezelni.
-
Független, megbízható külső auditorok felhatalmazása
- A harmadik fél auditoraival szemben három kulcsfontosságú követelményt említenek:
- technikai hozzáértés — egyes auditoroknak mély gépi tanulási tapasztalattal kell rendelkezniük;
- biztonságtudatosság — képesnek kell lenniük az értékes IP védelmére, amely lopás esetén nemzetbiztonsági kockázatot jelenthet;
- rugalmasság — képesnek kell lenniük robusztus, ugyanakkor könnyített értékelések elvégzésére, amelyek fenyegetéseket tárnak fel anélkül, hogy aláásnák az amerikai versenyképességet.
- A harmadik fél auditoraival szemben három kulcsfontosságú követelményt említenek:
-
Külső red teaming kötelezővé tétele a modellkiadás előtt
- A vállalatokat kötelezni kell külső red teamingre a modellkiadás előtt, akár központosított harmadik fél (például a NIST) bevonásával, akár decentralizált módon (például kutatói API-hozzáférésen keresztül), hogy standardizálják az ellenfél-szimulációs teszteket. A javaslat hangsúlyozza, hogy jó minőségű külső red teaming opcióknak kell rendelkezésre állniuk, mielőtt ez a követelmény általánosan kötelezővé válna, mert a red teaming szakértelme jelenleg főleg a magán laboroknál összpontosul.
-
Interpretálhatósági kutatások elősegítése
- Több forrást és kormányzati támogatást javasolnak az interpretálhatóság (interpretability) kutatására, beleértve egyetemi, nonprofit és vállalati projektek támogatását. Ez segítené a kisebb modelleken végzett érdemi munkát, és nem csak a legnagyobb, határvonalon dolgozó laborokra támaszkodna.
- Anthropic elismeri, hogy jelenleg az interpretálhatóságra vonatkozó szabályozási követelmények teljesítése sok esetben nem lehetséges, de a jövőben, kutatási előrelépések hatására ez változhat.
-
Antitröszt és az iparági együttműködés tisztázása
- A szabályozóknak iránymutatást kell adniuk az engedélyezett iparági együttműködési formákról az antitröszt szabályok keretein belül. A jogi bizonytalanság csökkentése lehetővé tenné, hogy a magáncégek közösen dolgozzanak a közérdekű biztonsági célokon anélkül, hogy antitröszt aggályokkal szembesülnének.
Összefoglalás
Anthropic úgy véli, hogy ezek a javaslatok jelentős előrelépést hozhatnak az AI elszámoltathatóságának létrehozásában. A cég hangsúlyozza, hogy a megvalósításhoz kutatók, AI laborok, szabályozók, auditorok és más szereplők együttműködése szükséges, és maga is elkötelezett a biztonságos fejlesztés és telepítés előmozdítása mellett. Az értékelések, red teaming, szabványok, interpretálhatósági kutatások, auditok és erős kiberbiztonsági gyakorlatok mind fontos eszközök lehetnek az AI kockázatainak csökkentésében, miközben a technológia előnyeit hasznosítjuk.
Az Anthropic teljes benyújtását az NTIA felhívására a cég a hivatalos dokumentumban tette hozzáférhetővé.



