- szeptember 12-én közzétett bejelentésében az Anthropic arról számolt be, hogy az elmúlt év során együttműködtek a US Center for AI Standards and Innovation (CAISI) és a UK AI Security Institute (AISI) nevű, a mesterséges intelligencia rendszerek biztonságát mérő és fejlesztő kormányzati testületekkel. A kezdeti konzultációkból folyamatos partnerség bontakozott ki: a CAISI és az AISI csapatai hozzáférést kaptak az Anthropic rendszereihez a modellfejlesztés különböző szakaszaiban, így tartósan tesztelhették azokat.
Mit tettek a kormányzati partnerek és miért számít ez
A CAISI és az AISI szakemberei nemzetbiztonsági szakterületeken — például kiberbiztonság, hírszerzés-elemzés és fenyegetésmodellezés — szerzett részletező ismereteit a gépi tanulási szakértelmükkel ötvözve vizsgálták a potenciális támadási irányokat és védelmi mechanizmusokat. Az Anthropic szerint ez a külső visszajelzés segítette őket abban, hogy rendszereik ellenállóbbak legyenek a kifinomult visszaélési kísérletekkel szemben.
Az együttműködés részeként mindkét kormányzati szervezet többször is értékelte az Anthropic "Constitutional Classifiers" nevű védelmi rendszerének több iterációját a Claude Opus 4 és Claude Opus 4.1 modelleken a telepítést megelőzően és azt követően is. Ezek a vizsgálatok konkrét sebezhetőségek feltárásához és a védelmi eszközök megerősítéséhez vezettek.
Feltárt sebezhetőségek és azokra adott válaszok
A CAISI és az AISI red-teamjei többféle sebezhetőséget azonosítottak, amelyeket az Anthropic technikai csapata a későbbiekben javított vagy amelyek az architektúra módosításához vezettek. A feltárt problémák közé tartoztak:
-
Prompt injection sebezhetőségek: a red-teamerek rejtett utasításokat használtak, amelyek megtévesztették a modelleket, és bizonyos annotációk — például hamisan azt állítani, hogy emberi felülvizsgálat történt — képesek voltak megkerülni a klasszifikátorok detektálását. Az Anthropic kijelenti, hogy ezeket a sebezhetőségeket javították.
-
A védelmi architektúrák stressztesztelése: a tesztelők egy fejlett, univerzális jailbreaket fejlesztettek ki, amely a meglévő detekciós módszereket kicselezte. Nem egyedi javítás született erre az exploitra, hanem az Anthropic alapvetően átalakította a védelmi architektúrát, hogy az az érintett sebezhetőségi osztályt kezelni tudja.
-
Cíferszerű támadások: kódolt, karakterhelyettesítést vagy más elrejtési technikákat alkalmazó kéréseket használtak a detektálás megkerülésére. Ezek az eredmények vezettek a felismerési rendszerek fejlesztéséhez, hogy az álcázott veszélyes tartalmakat ne lehessen egyszerűen kódolással kijátszani.
-
Bemenet- és kimenet-eltakarásos támadások: a red-teamerek univerzális jailbreakeket fedeztek fel, amelyek a védelmekhez illesztett, kifinomult elrejtési módszereket alkalmaztak — például a veszélyes stringek darabolása és ártalmatlannak tűnő kontextusba helyezése. Az ilyen vakfoltok azonosítása célzott szűrési fejlesztéseket tett lehetővé.
-
Automatizált támadásfinomítás: a tesztelők új, automatizált rendszereket építettek, amelyek iteratívan optimalizálták a támadási stratégiákat. Ezzel egy kevésbé hatékony jailbreakből egy hatékony univerzális jailbreaket létrehozva, az Anthropic ezen iterációkat felhasználta a védelmek további javítására.
Biztonsági értékelés és kockázati módszertan
A konkrét sebezhetőségek feltárásán túl CAISI és AISI szakértői hozzájárultak az Anthropic szélesebb biztonsági megközelítésének megerősítéséhez is. Külső nézőpontjuk hasznos volt az bizonyíték-követelmények, a telepítési megfigyelés és a gyors reagálási képességek átgondolásában, így nyomás alá helyezték az Anthropic feltételezéseit és rámutattak olyan területekre, ahol több vagy más típusú bizonyíték lehet szükséges a fenyegetésmodellek alátámasztásához.
Az együttműködés gyakorlati tanulságai
Az Anthropic tapasztalatai több gyakorlati tanulsággal szolgálnak arra vonatkozóan, hogyan érdemes a kormányzati kutató- és szabványosító szervekkel együttműködni a modellek biztonságának javítása érdekében:
-
Átfogó modellhozzáférés növeli a red-teaming hatékonyságát: a teljes körű hozzáférés, beleértve a telepítés előtti prototípusokat és a különböző védettségi konfigurációkat, lehetővé tette a külső csapatok számára, hogy először a védtelen verziókat támadják, majd fokozatosan fejlesszék a megkerülési technikáikat.
-
Részletes dokumentáció és belső erőforrások megosztása: Anthropic megosztotta a védelmi architektúra részleteit, dokumentált sebezhetőségeket, védelmi jelentéseket és a tartalmi irányelvek finom részleteit, ami célzottabb tesztelést tett lehetővé.
-
Valós idejű védelmi adatok hasznosak: a klasszifikátor pontszámokhoz való hozzáférés felgyorsította a sebezhetőség-felderítést és finomította a támadási stratégiákat.
-
Ismételt, iteratív tesztelés: a folyamatos együttműködés — napi kommunikációs csatornákkal és gyakori technikai mély-megbeszélésekkel kritikus fázisokban — lehetővé tette a komplexebb, mélyebb sebezhetőségek feltárását.
-
Többrétegű megközelítés erősebb védelmet jelent: a public bug bounty programok nagy számú, diverz hibajelentést hoznak, míg a szakértői kormányzati csapatok képesek a mély, csekély és kifinomult támadások feltárására; együtt egy erősebb, átfogóbb védelmi ökoszisztémát alkotnak.
Következtetés
Az Anthropic szerint a nagy teljesítményű AI modellek biztonságossá tétele és a visszaélések megelőzése nem csupán technikai fejlesztést, hanem új ipar–kormányzati együttműködési formákat is igényel. A cég örömmel fogadja, hogy más AI-fejlesztők is dolgoznak a CAISI-hez és az AISI-hez hasonló kormányzati szervekkel, és bátorítja a további hasonló együttműködéseket és a tapasztalatok szélesebb körű megosztását. Végül az Anthropic köszönetét fejezte ki a US CAISI és a UK AISI technikai csapatainak a szigorú tesztelésért és a folyamatos együttműködésért, amely állításuk szerint anyagilag is javította rendszereik biztonságát és előrelendítette a védelmi intézkedések hatékonyságának mérését.



