Anthropic bejelentése szerint a vállalat a U.S. Department of Energy (DOE) egyik alá tartozó szervezetével, a National Nuclear Security Administrationnel (NNSA) együttműködve nemcsak a modellek nukleáris proliferációs kockázatait értékeli, hanem kifejlesztett egy automatikus osztályozó rendszert is, amely a nukleáris témájú beszélgetéseket képes megkülönböztetni attól függően, hogy veszélyesek vagy ártalmatlanok.
Az együttműködés háttere
A közlemény hangsúlyozza, hogy a nukleáris technológia kettős hasznosítású: ugyanazok az alapelvek szolgálják a békés energiatermelést és a fegyverfejlesztés lehetőségét is. Ahogy az AI-modellek képességei növekednek, fontos felmérni, hogy azokon keresztül hozzáférhetővé válhat-e olyan technikai ismeret, amely nemzetbiztonsági kockázatot jelent.
Anthropic tavaly áprilisban kezdett együttműködni a DOE/NNSA-val, hogy a modelleket a nukleáris proliferációval kapcsolatos kockázatok szempontjából értékeljék. A most közzétett fejlesztés azonban túlmutat az értékelésen: egy konkrét, működő eszközt hoztak létre a kockázatok folyamatos megfigyelésére.
Mi készült és hogyan működik
A közösen kifejlesztett osztályozó — egy olyan AI-rendszer, amely automatikusan kategorizál tartalmakat — előzetes tesztekben 96%-os pontossággal különítette el a problémás és a nem problémás nukleáris témájú beszélgetéseket. Az Anthropic közlése szerint az osztályozót már üzembe helyezték a Claude nevű modell forgalmán, a szélesebb visszaélés-azonosító rendszer részeként.
Kezdeti adatok és további tervek
Az első üzembe helyezési adatok arra utalnak, hogy az osztályozó a valós Claude-beszélgetésekben is jól teljesít. Anthropic tervezi, hogy megosztja a módszertanát a Frontier Model Forum nevű iparági testülettel, abban reménykedve, hogy az együttműködés mintaként szolgálhat más AI-fejlesztők számára, akik hasonló védőintézkedéseket szeretnének bevezetni az NNSA-val együttműködve.
Miért jelent ez fontos előrelépést
A vállalat szerint ez az első alkalom, hogy ilyen jellegű, állami és magánszféra közötti együttműködésben kifejlesztett eszköz nyíltan demonstrálja, miként lehet kombinálni a kormányzati és iparági erőforrásokat a kockázatok kezelése érdekében. Az Anthropic Frontier Red Team blogján részletesebb leírás található az NNSA-val kötött együttműködésről és a fejlesztésről.
Időpontok és forrás
A bejelentés dátuma: 2025. augusztus 21. Az együttműködés közvetlenül azután indult, hogy Anthropic áprilisban megkezdte a DOE/NNSA-val folytatott közös értékelést. A fejlesztés részleteiről további információk az Anthropic Frontier Red Team blogján érhetők el.
Rövid összegzés
Anthropic és az amerikai energiaügyi hivatal NNSA-ja közösen fejlesztett AI-osztályozót, amely a kezdeti vizsgálatok szerint 96%-os pontossággal képes megkülönböztetni a kockázatos és ártalmatlan nukleáris témájú beszélgetéseket; az eszközt már élesben tesztelik a Claude-forgalmon, és a módszertant megosztják az iparággal.



