Anthropic közzétette 2023. július 26‑i bejegyzését arról a munkáról, amelyet a „frontier threats red teaming” (határmezős fenyegetések ellenőrzése, azaz ellenséges tesztelés) keretében végzett. A vállalat célja egy, a nemzetbiztonsággal kapcsolatos speciális kockázatok — különösen a biokockázatok — mérsékletének és ismételhető vizsgálatának kidolgozása, valamint az ehhez szükséges módszerek és eszközök skálázása.
Miért fontos ez
A szakirodalom és egyes kutatók régóta felhívták a figyelmet arra, hogy a fejlett nyelvi modellek (LLM‑ek) idővel nemzetbiztonsági szempontból releváns képességekre tehetnek szert. Anthropic emlékeztet arra is, hogy ügyvezető igazgatója, Dario Amodei, a kérdést a szenátusi meghallgatásában is kiemelte. A White House‑on 2023. július 21‑én bejelentett kötelezettségvállalások között Anthropic az „belső és külső biztonsági tesztelést” is támogatta, különös tekintettel a biobiztonságra és a kiberbiztonságra.
Módszer: hogyan zajlik a frontier threats red teaming
Anthropic hangsúlyozza, hogy ezek a vizsgálatok jelentős befektetést és szakterületi tudást igényelnek. A vállalat alapelvei:
- A munkát tapasztalt domain‑szakértőkkel végzik együtt. Ezek a szakértők évtizedes tapasztalattal rendelkeznek a területen.
- Először fenyegetési modelleket definiálnak: milyen típusú információ veszélyes, hogyan kombinálódnak az adatok kárhozó módon, és milyen pontosság illetve gyakoriság szükséges a kár okozásához. Több, pontos információ összekapcsolása gyakran szükséges ahhoz, hogy valódi kárt lehessen okozni.
- A vizsgálatot következetes kutatási terv szerint végzik; a szakterület és az LLM‑szakértők együttesen sok időt (például több mint 100 órát) töltenek azzal, hogy közelről próbára tegyék és megértsék a modellek tényleges képességeit. A szakértők megtanulják a modellekkel való hatékony párbeszédet, valamint a „jailbreak” technikákat.
- Cél az automatizált, szakértői tudásra épülő értékelések és a futtatásukhoz szükséges eszközök kifejlesztése, hogy a tesztek ismételhetők és skálázhatók legyenek.
- Mivel az eredmények és a módszerek érzékeny információt tartalmazhatnak, a vizsgálathoz megbízható harmadik felekkel való partnerség és erős információbiztonság szükséges.
Eredmények: biokockázatok red teamingje
Az elmúlt hat hónapban Anthropic több mint 150 órát dolgozott együtt vezető biobiztonsági szakértőkkel azzal a céllal, hogy tesztelje a modell képességét káros biológiai információ — például biológiai fegyverek tervezése vagy beszerzése — előállítására. A szakértők megtanulták, hogyan kommunikáljanak és „jailbreakeljék” a modellt, és kvantitatív értékeléseket dolgoztak ki a képességek mérésére. Ezt egy egyedi, biztonságos interfészen keresztül végezték, amelyben nem voltak éles trust & safety felügyeleti korlátozások, mint a publikus rendszereken.
A fő megállapítások:
- A jelenlegi frontier modellek időnként szakértői szintű, részletes és pontos tudást tudnak generálni bizonyos biológiai témákban. Ez nem minden vizsgált területen gyakori, de vannak olyan területek, ahol előfordul.
- A jelek arra utalnak, hogy a modellek képessége nő a méretükkel. Továbbá a modellek eszközhozzáférése (tools) növelheti biológiai képességeiket.
- Összességében az Anthropic úgy értékeli, hogy az ellenőrzés nélküli LLM‑ek felgyorsíthatják a rosszindulatú szereplő erőfeszítéseit a biológia visszaélése terén—azaz könnyebbé tehetik olyan szakértői, egymásra épülő információk összegyűjtését, amelyek önmagukban nehezebben lennének elérhetők csupán internethasználattal. Jelenleg ezek a hatások kicsik, de viszonylag gyorsan növekednek. Anthropic aggódik amiatt, hogy ezek a kockázatok a közeljövőben realizálódhatnak (például 2–3 éven belül), nem pedig csak 5 vagy több év múlva.
Ezzel párhuzamosan a kutatás lehetővé teszi a mérséklő intézkedések felfedezését és bevezetését:
- Az egyszerűbb változtatások a tanítási (training) folyamatban jelentősen csökkenthetik a káros kimeneteket azáltal, hogy a modell jobban meg tudja különböztetni a veszélyes és ártalmatlan biológiai felhasználást (Anthropic példaként említi a Constitutional AI‑ból származó megközelítéseket).
- Osztályozó alapú (classifier) szűrők megnehezíthetik, hogy egy rosszindulatú szereplő több, egymásra épülő, szakértői szintű információt szerezzen meg. Ilyen szűrőket Anthropic már telepített a publikus frontier modelljébe.
A vállalat felsorolt további lehetséges mérsékléseket a modellfejlesztés és üzembe helyezés minden lépésére, amelyeket tovább kísérleteznek.
További kutatási irányok és javaslatok
A projekt befejezésekor több további kísérlet és értékelés szerepel a tervben, mint amennyi a kiinduláskor volt. Különösen fontosnak tartják mérni, mennyivel gyorsíthatja fel a kártételt egy LLM a hagyományos keresőhöz képest — ezt ismétlődően kell majd vizsgálni a mai és a jövőbeli modelleken (beleértve a következő generációs, eszközhasználó és multimodális modelleket).
Anthropic azt javasolja, hogy a frontier modelleket fejlesztő cégek sürgősen végezzenek több elemzést és dolgozzanak ki erősebb mérsékléseket, majd osszák meg ezeket felelős ipari szereplőkkel és kiválasztott kormányügynökségekkel. Fontos előkészíteni azt is, hogyan kezeljék a potenciális modellek kiadását, amelyeket nem vizsgáltak ilyen red teaminggel: ha nem születnek új megközelítések a mérséklésre, feltételezhetően rossz szereplők kisebb, finomhangolt vagy feladatorientált modellekből is kinyerhetnek káros biológiai képességeket, ha elérhetővé válnak erősebb alapmodellek súlyai.
Skálázás, együttműködés és felelősségteljes nyilvánosság
Anthropic közli, hogy a frontier threats red teaming kutatás skálázását kezdi meg és erre toboroz csapatot. A cél egy olyan kutatócsoport felállítása, amely jövőbeli képességeket vizsgál, skálázható értékeléseket és mérsékléseket épít. A vállalat kifejezte, hogy eredményeit megosztja kormányzati szereplőkkel, laboratóriumokkal és más érintettekkel, és pilotál egy felelősségteljes jelentési folyamatot a kockázatok és mérséklések egymás közti bejelentésére.
Anthropic különösen arra buzdít másokat — laborokat vagy független, harmadik fél értékelő szervezeteket —, hogy végezzenek hasonló munkát, és vállalja a támogatást azoknak a csoportoknak, amelyek szeretnének bekapcsolódni.
Összegzés
Anthropic kutatása megerősíti, hogy a nemzetbiztonsági jellegű „frontier threats” red teaming időben és fontos. A jelenlegi modellek csak az első korai jeleit mutatják annak, hogy növekvő kockázatok jelenhetnek meg, ezért van ablak a megelőző beavatkozásokra, mielőtt a következő modellgenerációk eszközhasználattal vagy multimodális képességekkel tovább növelnék ezeket a kockázatokat. Anthropic azt javasolja, hogy a szakterület szereplői működjenek együtt, hozzanak létre független értékelő harmadik feleket, és osszák meg a megtalált mérséklési módszereket a releváns partnerekkel.



