Anthropic közzétette a Frontier Red Team elmúlt egy évben végzett vizsgálatainak eredményeit (poszt dátuma: 2025. március 19.). A jelentés azt ismerteti, hogyan változnak a potenciális nemzetbiztonsági kockázatok a „frontier” (vezető) nagy nyelvi modellek képességeinek gyors fejlődésével. Az Anthropic értékelése szerint a modellek kulcsfontosságú, kettős felhasználású területeken — különösen a kiberbiztonságban és egyes biológiai ismeretekben — „korai figyelmeztető jeleket” mutatnak: a modellek sok esetben egyetemi szintű tudást közelítenek meg, és bizonyos feladatokban túl is teljesítenek korábbi emberi alapokon. Ugyanakkor jelenleg a cég szerint ezek a modellek még nem érték el azokat a küszöböket, amelyeknél jelentősen megemelkedett nemzetbiztonsági kockázatról beszélnének.
Általános megfontolások
Az Anthropic hangsúlyozza, hogy az AI-képességek gyors javulása ellenére a valós kockázatokat több tényező határozza meg: fizikai korlátok, speciális berendezések, emberi szakértelem és a megvalósítás gyakorlati nehézségei továbbra is jelentős gátat jelentenek. Ezeket a kontextusbeli korlátokat figyelembe véve a cég részletezi, milyen előrehaladást és mintákat lát különböző kulcsterületeken.
Kiberbiztonság
Anthropic szerint a 2024-es év „zero to one” pillanat volt a kiberterületen. Capture The Flag (CTF) gyakorlatokban — ahol szoftver sebezhetőségek felderítése és kihasználása történik zárt környezetben — a Claude modell szintje egy év alatt középiskolai szintről egyetemi szintre emelkedett. Egyes Intercode CTF kihívásokon kevesebb mint negyedről közel minden feladvány megoldására jutott előre kevesebb mint egy év alatt.
A legújabb modell, Claude 3.7 Sonnet tovább javított: a Cybench nyilvános benchmarkon, amely CTF-feladatokat használ nagyméretű nyelvi modellek értékelésére, a Claude 3.7 Sonnet az esetek nagyjából egyharmadában képes megoldani a kihívásokat öt kísérlet alatt. Ez szemben áll a tavalyi végponti modell körülbelül öt százalékos teljesítményével.
A fejlődés több kiberfeladat-kategóriában is megfigyelhető (például pwn — bináris/exploit, web — webalkalmazás, crypto — kriptográfiai primitívek és protokollok). Ugyanakkor a modellek továbbra is elmaradnak a szakértő emberi támogatóktól bizonyos képességekben: nehézséget okoz például a bináris futtatható állományok visszafejtése (reverse engineering), valamint a hálózati felderítés és laterális mozgás önálló végrehajtása.
Akadémiai együttműködésben, a Carnegie Mellon University szakértőivel Anthropic nagyjából 50 hosztból álló, realistább kiber-range-eket tesztelt, amelyek többfázisú támadások felderítését és végrehajtását szimulálják. A modellek önállóan még nem voltak képesek sikerrel járni ilyen hálózati környezetben. Ha viszont a modelleket egy kutatók által fejlesztett szoftverkészlettel (Incalmo) látták el, akkor egyszerű utasításokkal a modellek képesek voltak lemásolni egy ismert nagyléptékű személyes adatok ellopásához hasonló támadást.
Ez az értékelési infrastruktúra lehetővé teszi az Anthropic számára a korai figyelmeztetést, ha a modellek autonóm képességei tovább javulnak, valamint segíthet az AI-alapú kibervédelem fejlesztésében is.
Biosecurity (biovédelem)
Anthropic korábbi posztjaihoz hasonlóan tovább vizsgálta a modellek biológiai képességeit. A cég beszámolója szerint a modellek gyorsan javulnak a biológiai ismeretek megértésében: egy év alatt a Claude modell a világelső virológiai szakértők teljesítménye alatti szintről azokat meghaladó teljesítményre lépett egy laboratóriumi hibaelhárítási értékelésen (VCT, amelyet a SecureBio tervezett).
A biológiai képességek azonban egyenetlenek. Belső tesztek szerint a modellek közelítenek a szakértői szinthez olyan feladatokban, amelyek a laborprotokollok értelmezését és DNS-/fehérjeszekvenciák manipulálását igénylik; a legújabb modell egyes másolási (cloning) munkafolyamatokban meghaladja a humán szakértői bázist. Ugyanakkor a modellek gyengébbek a tudományos ábrák értelmezésében.
A bio-kockázat gyakorlati jelentőségének felmérésére a cég kis, kontrollált kísérleteket végzett fegyveresítéshez kapcsolódó feladatokban, és világklasszis biovédelmi szakértőkkel dolgozott együtt. Egy kísérletben a legfrissebb modell megléte növelt bizonyos mértékű „emelkedést” (uplift) kezdő résztvevők teljesítményében azokhoz képest, akik nem használtak modellt. Ugyanakkor még a modellhez hozzáférő legjobb terv is kritikus hibákat tartalmazott, amelyek a valós körülmények között kudarchoz vezetnének.
A külső red-team szakértők következtetései vegyesek voltak: egyesek javulást láttak a modellek fegyveresítéssel kapcsolatos tudásában, mások szerint a tervekben szereplő kritikus hibák száma túl magas volt ahhoz, hogy egy kezdő támadó megbízható végrehajtást érjen el. Összességében az Anthropic álláspontja az, hogy jelenleg a modellek nem képesek megbízhatóan végigvezetni egy rosszindulatú kezdőt a biológiai fegyver megszerzésének és használatának gyakorlati lépésein.
A gyors javulás miatt a cég továbbra is jelentős erőforrásokat fordít a biokockázatok figyelésére és enyhítésére, például a nemrég ismertetett „constitutional classifiers” fejlesztésére.
Külső partnerségek és stratégiai figyelmeztetés
Anthropic hangsúlyozza, hogy az előre kidolgozott értékelési tervek és a képességküszöbökre vonatkozó vállalások gyorsabb, felelősségteljes fejlesztést tesznek lehetővé. Modelleiket előtelepítés előtti tesztelésnek vetette alá a US AI Safety Institute és a UK AI Security Institute (AISI), melyek vizsgálatai hozzájárultak a Claude 3.7 Sonnet nemzetbiztonsági relevanciájának megértéséhez, és befolyásolták a modell AI Safety Level (ASL) meghatározását.
Anthropic elsőként kezdeményezett ilyen típusú együttműködést a National Nuclear Security Administration-nel (NNSA), amely a US Department of Energy része: a NNSA Claude-ot titkos környezetben teszteli nukleáris és radiológiai kockázattal kapcsolatos tudás szempontjából. A kormányzati red-teaminget az egyedi érzékenység miatt maga a kormány végzi. Az Anthropic más CBRN (kémiai, biológiai, radiológiai, nukleáris) kockázatokra vonatkozó felismeréseit és enyhítési megközelítéseit megosztotta, amelyeket a NNSA adaptált a nukleáris területre.
Előretekintés
Anthropic megfogalmazza, hogy fontosak a belső védelmi intézkedések (például Responsible Scaling Policy), független értékelő szervezetek (AI Safety/Security Institutes) és a célzott külső felügyelet. A jövőben a cég gyakrabban tervez automatikus értékelésekre, elicitationre, elemzésre és jelentéskészítésre épülő teszteket.
A vállalat elismeri, hogy a modellek fejlődése gyors, és ahogy növekszik az extended thinking (kiterjesztett gondolkodás) képességük, a jelenlegi segédeszközök — például az Incalmo — helyett a modellek „dobozból” jobb kiberképességeket nyújthatnak. Az Anthropic úgy látja, hogy egyes biológiai kutatások alapján modelleik közelednek ahhoz a képességszinthez, amely AI Safety Level 3 óvintézkedéseket tenne szükségessé; ezért további beruházásokat tesznek ezeknek az intézkedéseknek az időben rendelkezésre állására.
A cég szerint a frontvonalbeli AI-laborok és a kormányzat közötti mélyebb együttműködés elengedhetetlen a jobb értékelésekhez és kockázatcsökkentéshez. Végül Anthropic jelzi, hogy toborzást folytat: ha valaki közvetlenül hozzájárulna a munkához, jelenleg felvesznek új munkatársakat.
Miért számít ez
A jelentés részletesen dokumentálja, hogy a vezető generációs nagy modellek rövid idő alatt képesek jelentős előrehaladást elérni olyan feladatokban, amelyek kettős felhasználásúak lehetnek. Ugyanakkor a cég jelenlegi értékelése szerint a rendszerek még nem lépték át azt a bizonyos, a nemzetbiztonságot közvetlenül érintő küszöböt. A gyors fejlődés és a meglévő hiányosságok együttesen azt jelzik, hogy folyamatos, célzott értékelésre és közösségi-kormányzati együttműködésre van szükség, hogy időben észlelhető és kezelhető legyen a kockázat.



