Biztonság

Mesterséges intelligenciával generált szöveg

Anthropic és amerikai energiaügyi ügynökség közös AI-ellenőrző rendszert fejleszt nukleáris visszaélések ellen

Az Anthropic és az Egyesült Államok Energiaügyi Minisztérium (U.S.

Anthropic és amerikai energiaügyi ügynökség közös AI-ellenőrző rendszert fejleszt nukleáris visszaélések ellen

Anthropic bejelentése szerint a vállalat a U.S. Department of Energy (DOE) egyik alá tartozó szervezetével, a National Nuclear Security Administrationnel (NNSA) együttműködve nemcsak a modellek nukleáris proliferációs kockázatait értékeli, hanem kifejlesztett egy automatikus osztályozó rendszert is, amely a nukleáris témájú beszélgetéseket képes megkülönböztetni attól függően, hogy veszélyesek vagy ártalmatlanok.

Az együttműködés háttere

A közlemény hangsúlyozza, hogy a nukleáris technológia kettős hasznosítású: ugyanazok az alapelvek szolgálják a békés energiatermelést és a fegyverfejlesztés lehetőségét is. Ahogy az AI-modellek képességei növekednek, fontos felmérni, hogy azokon keresztül hozzáférhetővé válhat-e olyan technikai ismeret, amely nemzetbiztonsági kockázatot jelent.

Anthropic tavaly áprilisban kezdett együttműködni a DOE/NNSA-val, hogy a modelleket a nukleáris proliferációval kapcsolatos kockázatok szempontjából értékeljék. A most közzétett fejlesztés azonban túlmutat az értékelésen: egy konkrét, működő eszközt hoztak létre a kockázatok folyamatos megfigyelésére.

Mi készült és hogyan működik

A közösen kifejlesztett osztályozó — egy olyan AI-rendszer, amely automatikusan kategorizál tartalmakat — előzetes tesztekben 96%-os pontossággal különítette el a problémás és a nem problémás nukleáris témájú beszélgetéseket. Az Anthropic közlése szerint az osztályozót már üzembe helyezték a Claude nevű modell forgalmán, a szélesebb visszaélés-azonosító rendszer részeként.

Kezdeti adatok és további tervek

Az első üzembe helyezési adatok arra utalnak, hogy az osztályozó a valós Claude-beszélgetésekben is jól teljesít. Anthropic tervezi, hogy megosztja a módszertanát a Frontier Model Forum nevű iparági testülettel, abban reménykedve, hogy az együttműködés mintaként szolgálhat más AI-fejlesztők számára, akik hasonló védőintézkedéseket szeretnének bevezetni az NNSA-val együttműködve.

Miért jelent ez fontos előrelépést

A vállalat szerint ez az első alkalom, hogy ilyen jellegű, állami és magánszféra közötti együttműködésben kifejlesztett eszköz nyíltan demonstrálja, miként lehet kombinálni a kormányzati és iparági erőforrásokat a kockázatok kezelése érdekében. Az Anthropic Frontier Red Team blogján részletesebb leírás található az NNSA-val kötött együttműködésről és a fejlesztésről.

Időpontok és forrás

A bejelentés dátuma: 2025. augusztus 21. Az együttműködés közvetlenül azután indult, hogy Anthropic áprilisban megkezdte a DOE/NNSA-val folytatott közös értékelést. A fejlesztés részleteiről további információk az Anthropic Frontier Red Team blogján érhetők el.

Rövid összegzés

Anthropic és az amerikai energiaügyi hivatal NNSA-ja közösen fejlesztett AI-osztályozót, amely a kezdeti vizsgálatok szerint 96%-os pontossággal képes megkülönböztetni a kockázatos és ártalmatlan nukleáris témájú beszélgetéseket; az eszközt már élesben tesztelik a Claude-forgalmon, és a módszertant megosztják az iparággal.