Biztonság

Anthropic Safeguards: Claude rendszerszintű védelmi rétegeinek bemutatása

Az Anthropic Safeguards csapata bemutatta, hogyan építik be a védelmi mechanizmusokat Claude nagy nyelvi modellbe annak érdekében, hogy a szolgáltatás biztonságos és hasznos maradjon.

Anthropic Safeguards: Claude rendszerszintű védelmi rétegeinek bemutatása
  1. augusztus 12-én az Anthropic a Safeguards csapat munkájáról és a Claude modellek köré épített védelmi mechanizmusokról közölt részleteket. A cég célja, hogy a Claude képességeit az emberek hasznára fordítsa, miközben csökkenti azokat a kockázatokat, amelyek a modell rosszindulatú vagy káros felhasználásából eredhetnek.

A Safeguards csapat és működési elv

A Safeguards csapat szakemberekből áll, akik politikai, végrehajtási, termék-, adattudomány-, fenyegetettség-intelligencia- és mérnöki területekről érkeznek. Feladatuk a veszélyforrások azonosítása, a fenyegetésekre adott válaszok kidolgozása és olyan védelmek építése, amelyek a gyakorlatban is hatékonyan tartják Claude-ot hasznosnak és biztonságosnak. Munkájuk rendszerszintű: a politikák kialakításától és a modelltréningen át a valós idejű végrehajtásig, valamint új típusú visszaélések azonosításáig terjed.

Politikaalkotás

A Safeguards kialakította a Usage Policy-t, amely meghatározza, hogyan és mire nem szabad használni Claudet. A Usage Policy különös figyelmet fordít olyan kritikus területekre, mint a gyermekvédelem, a választások integritása és a kiberbiztonság, ugyanakkor iparági iránymutatást is ad egészségügyre és pénzügyekre vonatkozóan.

Két fő mechanizmus vezérli a politikafejlesztést:

  • Unified Harm Framework: egy fejlődő keretrendszer, amely öt dimenzió mentén (fizikai, pszichológiai, gazdasági, társadalmi és egyéni autonómia) segít felmérni a Claude használatából származó potenciális károkat. Nem formális osztályozásról van szó, hanem egy strukturált szempontrendszerről, amely a visszaélés valószínűségét és kiterjedését veszi figyelembe.

  • Policy Vulnerability Testing: külső szakterületi partnerekkel együtt azonosítanak kockázatos területeket, majd stresstesztekkel ellenőrzik, hogyan teljesítenek a politikák nehéz promptok alatt. Partnerek között említik a terrorizmus, radikalizáció, gyermekvédelem és mentális egészség területén dolgozó szakértőket. A 2024-es amerikai választási ciklus alatt például az Institute for Strategic Dialogue-vel együttműködve azonosították, mikor adhat Claude elavult információt; ennek hatására a Claude.ai felhasználóknak megjelenő banner a felhasználókat megbízható forrásokra, például a TurboVote-ra irányította.

Claude képzése és finomhangolása

A Safeguards együttműködik a finomhangolási csapatokkal, hogy elősegítse a káros viselkedés megelőzését. Hosszan tartó szakmai egyeztetések alapján határozzák meg, milyen viselkedési mintákat érdemes beépíteni a tréningbe. Az értékelési és detektálási folyamatok azonosítják a potenciálisan káros válaszokat, és ha problémát találnak, a tréningcsapattal közösen módosításokat eszközölnek — például a reward modellek frissítését vagy a rendszerpromptok beállítását.

A cég domain-szakértőkkel dolgozik a kényes területek árnyalt kezelésére. Például a ThroughLine nevű online krízistámogatásban jártas szervezettel együttműködve fejlesztették Claude képességét arra, hogy a öngyilkossági szándék vagy mentális egészség kérdéseit finoman, helyénvaló módon kezelje: nem pusztán elutasítani a beszélgetést, hanem megérteni a felhasználó szándékát és megfelelő választ adni.

A tréning eredményeként Claude többek közt megtanul visszautasítani a káros, jogellenes tevékenységhez nyújtott segítséget, felismeri a rosszindulatú kódgenerálás és csalárd tartalom előállítására irányuló próbálkozásokat, és képes óvatosan kezelni érzékeny témákat.

Tesztelés és értékelés a kiadás előtt

Minden új modell megjelenés előtt átfogó értékelésen megy keresztül, amely több részből áll:

  • Safety evaluations: a Usage Policy-nek való megfelelés vizsgálata olyan témákban, mint a gyermekexploitatív tartalom vagy az öngyilkosság; a tesztek lefedik az egyértelmű szabálysértéseket, a kétértelmű kontextusokat és a többkörös beszélgetéseket. A Claude modelleket önmagukban is felhasználják a válaszok pontozására, emberi felülvizsgálattal kiegészítve.

  • Risk assessments: magas kockázatú területeken — például kiberkár, vagy CBRNE (kémiai, biológiai, radiológiai és nukleáris fegyverek és nagy hatóanyagú robbanószerek) — a Safeguards kormányzati és ipari partnerekkel együtt végez „AI capability uplift” teszteket, meghatározza a lehetséges fenyegetési modelleket, és felméri a védelmek hatékonyságát ezekkel szemben.

  • Bias evaluations: ellenőrzik, hogy Claude következetesen megbízható és pontos választ ad-e különböző kontextusokban és felhasználók számára. Politikai elfogultság esetén ellentétes nézőpontokat tartalmazó promptokkal tesztelnek, és értékelik a válaszokat tényszerűség, átfogó jelleg, egyenértékűség és konzisztencia szempontjából. Vizsgálják a válaszok esetleges torzulását foglalkozásokra, egészségügyre és identitás attribútumokra (nem, faj, vallás) vonatkozóan.

A pre-deployment tesztek segítenek eldönteni, hogy a tréning elégséges-e, vagy további védőintézkedéseket kell építeni. Például a computer use eszköz pre-launch értékelésekor megállapították, hogy képes lehet spam generálására és terjesztésére; erre reagálva a megjelenés előtt új detekciós módszereket és végrehajtási mechanizmusokat fejlesztettek (például lehetőség a funkció kiiktatására olyan fiókoknál, amelyek visszaélést jeleznek), és további védelmet vezettek be prompt injection ellen. Az értékelések eredményeit a cég system cards dokumentumai tartalmazzák, amelyeket minden új modellcsaládhoz kiadnak.

Valós idejű detekció és végrehajtás

A telepítés után az automatizált rendszerek és emberi felülvizsgálat kombinációját használják a károk detektálására és a Usage Policy érvényesítésére.

A detektálást és végrehajtást egy speciálisan promptolt vagy finomhangolt Claude modellekből álló osztályozó ("classifiers") készlet hajtja. Ezek a classifier-ek valós időben keresik a különböző szabálysértéseket, és egyszerre több classifier is futhat, mindegyik a saját típusú kárra figyelve. Emellett a gyermekeket ábrázoló szexuális visszaélés (CSAM) felismerésére szolgáló rendszerben a feltöltött képek hash-értékeit összevetik ismert CSAM adatbázisokkal első fél termékeknél.

A classifier-ek alapján a cég többféle végrehajtási lépést tehet:

  • Response steering: valós időben módosíthatják Claude értelmezését és válaszadási módját, hogy megakadályozzák a káros tartalom előállítását. Például spam vagy rosszindulatú kód generálásának gyanúja esetén automatikusan kiegészítő utasításokat lehet hozzáadni Claude rendszerpromptjához. Szűk esetekben teljesen meg is lehet tiltani a válaszadást.

  • Account enforcement actions: vizsgálják a szabálysértési mintákat, és fiókszintű intézkedéseket hozhatnak, figyelmeztetéstől súlyos esetben fiók megszüntetéséig. Vannak védelmek a csalárd fióklétrehozás és a szolgáltatások jogosulatlan használata ellen is.

Ezeknek a rendszereknek a megépítése jelentős kihívást jelent a szükséges gépi tanulási kutatás és a mérnöki megoldások miatt: az osztályozóknak trilliónyi bemeneti és kimeneti tokent kell képesek feldolgozni úgy, hogy közben minimalizálják a számítási többletet és a jogos tartalom fölötti túlzott beavatkozást.

Folyamatos monitorozás és vizsgálat

Túl a pillanatnyi promptok és fiókok vizsgálatán, a Safeguards a káros forgalom nagyobb mintázatait is elemzi, hogy felmérje egyes visszaélések előfordulását és feltárja összetettebb támadási sémákat. Főbb elemei:

  • Claude insights and observations: az insights eszköz segít a valós használat mérésében és a forgalom privát módon csoportosított témaklubokba rendezésében, lehetővé téve kutatási eredményeket és guardrail-ök finomhangolását. Ilyen kutatás például a Claude használatának érzelmi hatásaira vonatkozó munka.

  • Hierarchical summarization: a számítógépes használat és potenciális káros kiberhasználat monitorozására alkalmazott technika, amely egyéni interakciókat sűrít össze, majd ezeket a kivonatokat elemzi, hogy fiókszintű aggodalmakat — például nagy volumenű automatizált befolyásolási műveleteket — észleljen.

  • Threat intelligence: a legsúlyosabb visszaélések, az adverszári használat és olyan mintázatok azonosítása, amelyeket a meglévő detektálórendszerek esetleg figyelmen kívül hagynak. Ilyen módszerekhez tartozik a szokatlan fióktevékenység csúcsainak összehasonlítása tipikus használati mintákkal, valamint külső fenyegetési adatok (nyílt forráskódú repók, ipari jelentések) keresztellenőrzése a belső rendszerekkel. A Safeguards csapat olyan csatornákat is figyel, ahol rossz szereplők mozoghatnak (közösségi média, üzenetküldő platformok, hacker fórumok), és eredményeit nyilvános threat intelligence riportokban osztja meg.

Együttműködés, visszajelzés és toborzás

Az Anthropic hangsúlyozza, hogy az AI-használat védelme túl nagy kihívás ahhoz, hogy egy szervezet egyedül oldja meg. Aktívan keresnek visszajelzést és partnerséget felhasználóktól, kutatóktól, döntéshozóktól és civil társadalmi szervezetektől. Nyilvános bug bounty programot is működtetnek a védelmek tesztelésére.

A Safeguards munkájának támogatására álláslehetőségeket hirdetnek; az érdeklődők a Careers oldalon találhatnak további információt.