Biztonság

Anthropic Frontier Red Team: javuló kiber- és bioképességek, de nemzetbiztonsági küszöb alatt

Anthropic Frontier Red Team március 19., 2025-i jelentése a frontier mesterséges intelligencia modellek lehetséges nemzetbiztonsági kockázatairól számol be.

Anthropic Frontier Red Team: javuló kiber- és bioképességek, de nemzetbiztonsági küszöb alatt

Anthropic közzétette a Frontier Red Team elmúlt egy évben végzett vizsgálatainak eredményeit (poszt dátuma: 2025. március 19.). A jelentés azt ismerteti, hogyan változnak a potenciális nemzetbiztonsági kockázatok a „frontier” (vezető) nagy nyelvi modellek képességeinek gyors fejlődésével. Az Anthropic értékelése szerint a modellek kulcsfontosságú, kettős felhasználású területeken — különösen a kiberbiztonságban és egyes biológiai ismeretekben — „korai figyelmeztető jeleket” mutatnak: a modellek sok esetben egyetemi szintű tudást közelítenek meg, és bizonyos feladatokban túl is teljesítenek korábbi emberi alapokon. Ugyanakkor jelenleg a cég szerint ezek a modellek még nem érték el azokat a küszöböket, amelyeknél jelentősen megemelkedett nemzetbiztonsági kockázatról beszélnének.

Általános megfontolások

Az Anthropic hangsúlyozza, hogy az AI-képességek gyors javulása ellenére a valós kockázatokat több tényező határozza meg: fizikai korlátok, speciális berendezések, emberi szakértelem és a megvalósítás gyakorlati nehézségei továbbra is jelentős gátat jelentenek. Ezeket a kontextusbeli korlátokat figyelembe véve a cég részletezi, milyen előrehaladást és mintákat lát különböző kulcsterületeken.

Kiberbiztonság

Anthropic szerint a 2024-es év „zero to one” pillanat volt a kiberterületen. Capture The Flag (CTF) gyakorlatokban — ahol szoftver sebezhetőségek felderítése és kihasználása történik zárt környezetben — a Claude modell szintje egy év alatt középiskolai szintről egyetemi szintre emelkedett. Egyes Intercode CTF kihívásokon kevesebb mint negyedről közel minden feladvány megoldására jutott előre kevesebb mint egy év alatt.

A legújabb modell, Claude 3.7 Sonnet tovább javított: a Cybench nyilvános benchmarkon, amely CTF-feladatokat használ nagyméretű nyelvi modellek értékelésére, a Claude 3.7 Sonnet az esetek nagyjából egyharmadában képes megoldani a kihívásokat öt kísérlet alatt. Ez szemben áll a tavalyi végponti modell körülbelül öt százalékos teljesítményével.

A fejlődés több kiberfeladat-kategóriában is megfigyelhető (például pwn — bináris/exploit, web — webalkalmazás, crypto — kriptográfiai primitívek és protokollok). Ugyanakkor a modellek továbbra is elmaradnak a szakértő emberi támogatóktól bizonyos képességekben: nehézséget okoz például a bináris futtatható állományok visszafejtése (reverse engineering), valamint a hálózati felderítés és laterális mozgás önálló végrehajtása.

Akadémiai együttműködésben, a Carnegie Mellon University szakértőivel Anthropic nagyjából 50 hosztból álló, realistább kiber-range-eket tesztelt, amelyek többfázisú támadások felderítését és végrehajtását szimulálják. A modellek önállóan még nem voltak képesek sikerrel járni ilyen hálózati környezetben. Ha viszont a modelleket egy kutatók által fejlesztett szoftverkészlettel (Incalmo) látták el, akkor egyszerű utasításokkal a modellek képesek voltak lemásolni egy ismert nagyléptékű személyes adatok ellopásához hasonló támadást.

Ez az értékelési infrastruktúra lehetővé teszi az Anthropic számára a korai figyelmeztetést, ha a modellek autonóm képességei tovább javulnak, valamint segíthet az AI-alapú kibervédelem fejlesztésében is.

Biosecurity (biovédelem)

Anthropic korábbi posztjaihoz hasonlóan tovább vizsgálta a modellek biológiai képességeit. A cég beszámolója szerint a modellek gyorsan javulnak a biológiai ismeretek megértésében: egy év alatt a Claude modell a világelső virológiai szakértők teljesítménye alatti szintről azokat meghaladó teljesítményre lépett egy laboratóriumi hibaelhárítási értékelésen (VCT, amelyet a SecureBio tervezett).

A biológiai képességek azonban egyenetlenek. Belső tesztek szerint a modellek közelítenek a szakértői szinthez olyan feladatokban, amelyek a laborprotokollok értelmezését és DNS-/fehérjeszekvenciák manipulálását igénylik; a legújabb modell egyes másolási (cloning) munkafolyamatokban meghaladja a humán szakértői bázist. Ugyanakkor a modellek gyengébbek a tudományos ábrák értelmezésében.

A bio-kockázat gyakorlati jelentőségének felmérésére a cég kis, kontrollált kísérleteket végzett fegyveresítéshez kapcsolódó feladatokban, és világklasszis biovédelmi szakértőkkel dolgozott együtt. Egy kísérletben a legfrissebb modell megléte növelt bizonyos mértékű „emelkedést” (uplift) kezdő résztvevők teljesítményében azokhoz képest, akik nem használtak modellt. Ugyanakkor még a modellhez hozzáférő legjobb terv is kritikus hibákat tartalmazott, amelyek a valós körülmények között kudarchoz vezetnének.

A külső red-team szakértők következtetései vegyesek voltak: egyesek javulást láttak a modellek fegyveresítéssel kapcsolatos tudásában, mások szerint a tervekben szereplő kritikus hibák száma túl magas volt ahhoz, hogy egy kezdő támadó megbízható végrehajtást érjen el. Összességében az Anthropic álláspontja az, hogy jelenleg a modellek nem képesek megbízhatóan végigvezetni egy rosszindulatú kezdőt a biológiai fegyver megszerzésének és használatának gyakorlati lépésein.

A gyors javulás miatt a cég továbbra is jelentős erőforrásokat fordít a biokockázatok figyelésére és enyhítésére, például a nemrég ismertetett „constitutional classifiers” fejlesztésére.

Külső partnerségek és stratégiai figyelmeztetés

Anthropic hangsúlyozza, hogy az előre kidolgozott értékelési tervek és a képességküszöbökre vonatkozó vállalások gyorsabb, felelősségteljes fejlesztést tesznek lehetővé. Modelleiket előtelepítés előtti tesztelésnek vetette alá a US AI Safety Institute és a UK AI Security Institute (AISI), melyek vizsgálatai hozzájárultak a Claude 3.7 Sonnet nemzetbiztonsági relevanciájának megértéséhez, és befolyásolták a modell AI Safety Level (ASL) meghatározását.

Anthropic elsőként kezdeményezett ilyen típusú együttműködést a National Nuclear Security Administration-nel (NNSA), amely a US Department of Energy része: a NNSA Claude-ot titkos környezetben teszteli nukleáris és radiológiai kockázattal kapcsolatos tudás szempontjából. A kormányzati red-teaminget az egyedi érzékenység miatt maga a kormány végzi. Az Anthropic más CBRN (kémiai, biológiai, radiológiai, nukleáris) kockázatokra vonatkozó felismeréseit és enyhítési megközelítéseit megosztotta, amelyeket a NNSA adaptált a nukleáris területre.

Előretekintés

Anthropic megfogalmazza, hogy fontosak a belső védelmi intézkedések (például Responsible Scaling Policy), független értékelő szervezetek (AI Safety/Security Institutes) és a célzott külső felügyelet. A jövőben a cég gyakrabban tervez automatikus értékelésekre, elicitationre, elemzésre és jelentéskészítésre épülő teszteket.

A vállalat elismeri, hogy a modellek fejlődése gyors, és ahogy növekszik az extended thinking (kiterjesztett gondolkodás) képességük, a jelenlegi segédeszközök — például az Incalmo — helyett a modellek „dobozból” jobb kiberképességeket nyújthatnak. Az Anthropic úgy látja, hogy egyes biológiai kutatások alapján modelleik közelednek ahhoz a képességszinthez, amely AI Safety Level 3 óvintézkedéseket tenne szükségessé; ezért további beruházásokat tesznek ezeknek az intézkedéseknek az időben rendelkezésre állására.

A cég szerint a frontvonalbeli AI-laborok és a kormányzat közötti mélyebb együttműködés elengedhetetlen a jobb értékelésekhez és kockázatcsökkentéshez. Végül Anthropic jelzi, hogy toborzást folytat: ha valaki közvetlenül hozzájárulna a munkához, jelenleg felvesznek új munkatársakat.

Miért számít ez

A jelentés részletesen dokumentálja, hogy a vezető generációs nagy modellek rövid idő alatt képesek jelentős előrehaladást elérni olyan feladatokban, amelyek kettős felhasználásúak lehetnek. Ugyanakkor a cég jelenlegi értékelése szerint a rendszerek még nem lépték át azt a bizonyos, a nemzetbiztonságot közvetlenül érintő küszöböt. A gyors fejlődés és a meglévő hiányosságok együttesen azt jelzik, hogy folyamatos, célzott értékelésre és közösségi-kormányzati együttműködésre van szükség, hogy időben észlelhető és kezelhető legyen a kockázat.