Szabályozás

Az Egyesült Államok előzetesen értékeli a fejlett mesterséges intelligencia-modelleket

A National Institute of Standards and Technology (NIST), a Commerce Department irodája, bejelentette, hogy új több ügynökségre kiterjedő munkacsoport, a Testing Risks of AI for National Security (TRAINS) előzetesen értékelni fogja a nemzetbiztonsági kockázatokat az AI-modellek nyilvános kiadása előtt.

Az Egyesült Államok előzetesen értékeli a fejlett mesterséges intelligencia-modelleket

A National Institute of Standards and Technology (NIST), az Egyesült Államok Kereskedelmi Minisztériumának irodája bejelentette, hogy egy több ügynökséget összefogó munkacsoport feladata lesz a fejlett mesterséges intelligencia-modellek nemzetbiztonsági kockázatainak értékelése még a nyilvános bevetésük előtt. A bejelentés éles váltást jelent a Fehér Ház korábbi, laza szabályozási megközelítéséhez képest.

Mit fog vizsgálni a program

A NIST közlése szerint a tesztek elsősorban demonstrálható kockázatokra koncentrálnak majd, különösen a kiberbiztonság, a bio- és a kémiai fegyverek területén. A részleteket — például a vállalatokkal kötött megállapodások pontos tartalmát vagy azt, hogy a teszteredmények alapján milyen korlátozásokat várnak el a modellektől — a kormányzat nem hozta nyilvánosságra.

A vizsgálatokat a Testing Risks of AI for National Security (TRAINS) nevű csoport végzi, amelyet a NIST Center for AI Standards and Innovation (CAISI) felügyel. A TRAINS gyors reagálásra tervezett, több szövetségi ügynökség együttműködésén alapuló kezdeményezés: részt vesznek benne a Kereskedelmi, Védelmi, Energia- és Belbiztonsági Minisztérium, a National Security Agency és a National Institutes of Health.

TRAINS eddig nem közölte, mely konkrét benchmarkokat fogja alkalmazni. A NIST azonban megosztotta a CAISI korábbi összehasonlítását, amelyben a DeepSeek V4 Pro modellt más nagymodell-architektúrákkal vetették össze kilenc nyilvánosan használt mérőszám összesített eredménye alapján; ezek a tesztek kiberbiztonságot, kódolást, matematikai és természettudományi képességeket, valamint absztrakt következtetést fednek, továbbá tartalmaztak egy belső próbát, a PortBench-et is (parancssori eszközök átültetése különböző programozási nyelvek között).

A vállalati részvétel és az eddigi megállapodások

Néhány vezető amerikai AI-cég — köztük Google, Microsoft és xAI — beleegyezett, hogy olyan modelleket bocsát rendelkezésre, amelyeknél korlátozottak vagy hiányoznak a védőkorlátok (guardrails). Anthropic és OpenAI 2024-ben hasonló feltételekkel állapodtak meg. A megállapodások célja a közös állami–magán kutatás lehetővé tétele a képességek és kockázatok felmérésére, valamint a kockázatcsökkentő módszerek kidolgozására.

Ezek a vállalati kötelezettségek egyelőre önkéntesek; a kormányzat fontolóra vesz azonban egy végrehajtási rendeletet (executive order), amely kötelezővé tehetné az előzetes jóváhagyást a modellek bevetése előtt.

Előzmények és politikai kontextus

A döntés fordulatot jelent a Trump-kormányzat azon törekvéseivel szemben, amelyek a Biden-korszak szabályozási korlátainak eltörlését célozták az amerikai AI-vezető szerep fenntartása érdekében. A változás részben Anthropic körüli eseményekhez köthető: a vállalat bejelentése szerint a Claude Mythos Preview nevű, még nem széles körben elérhető modell képes lehet kihasználni ismert sebezhetőségeket népszerű szoftverekben, ami a kormány figyelmét felkeltette.

Donald Trump elnök 2025 januárjában hivatalba lépése után három tanácsadót bízott meg egy AI Action Plan kidolgozásával, amelynek célja az amerikai globális AI-dominancia fenntartása és erősítése volt a Biden-korszak szabályozásainak felfüggesztésével vagy eltörlésével. A Biden-adminisztráció 2023-ban kiadott egy végrehajtási rendeletet, amely előírta, hogy a fejlesztők értesítsék a kormányt, ha olyan modellt képeznek, amelynek számítási igénye nagyjából egybillió (1 trillion) paraméter nagyságrendjéhez közelít.

2026 márciusában Anthropic megpróbálta korlátozni Claude katonai felhasználását megfigyelésre és autonóm fegyverekhez; a Fehér Ház ezt elutasította, és a modellt katonai használattól teljesen eltiltotta. Egy hónappal később Anthropic bejelentette, hogy a Claude Mythos Preview képes lehet automatikusan kihasználni sebezhetőségeket nagy operációs rendszerekben és alkalmazásokban. A cég a Mythos-t 50 szervezettel osztotta meg, amelyek ezt szoftverproblémák felderítésére és javítására használják.

A Fehér Ház a múlt héten ellenezte, hogy a vállalat további 70 szervezetnek bővítse a hozzáférést a preview-hoz, nemzetbiztonsági aggályokra hivatkozva és kérdőjelezve meg, hogy Anthropic rendelkezik-e elegendő számítási erőforrással ahhoz, hogy egyszerre szolgálja ki a meglévő Mythos-felhasználókat és a kormányt. A cég még nem közölte, hogy kifogást emel-e az adminisztráció azon jogával szemben, amely korlátozni próbálja a preview-modellek terjesztését.

Miért fontos ez

A Fehér Ház elmozdulása a laza szabályozástól az előzetes vizsgálatok felé azt tükrözi, hogy a mesterséges intelligencia modellek mára közvetlenül veszélyt jelenthetnek a nemzetbiztonságra. Az előzetes tesztelés lehetőséget adhat a kormánynak arra, hogy korai riasztást kapjon potenciális problémák esetén, és ösztönözheti a fejlesztőket a kockázatok proaktív kezelésére. Ugyanakkor ez a gyakorlat azt is lehetővé tenné, hogy a kormány eldöntse, mely modellek terjeszthetők szélesebb körben, és melyeket kell visszatartani vagy módosítani — olyan indokokkal, amelyek nem feltétlenül lesznek teljesen átláthatóak.

Jelenleg az új modellek kormányzati tesztelése nem kötelező; azok a cégek, amelyek eddig beleegyeztek a vizsgálatokba, ezt önként tették. Az adminisztráció azonban egy végrehajtási rendeletet megfontol, amely kötelezővé tehetné az előzetes értékelést.

Szerkesztőségi megjegyzés

A szabványos, egységes és következetes eljárásokon alapuló benchmarkok bevezetése hasznos lenne az iparág számára, ugyanakkor vitatható, hogy ezeket az intézkedéseket a piacnak vagy a kormánynak kellene-e elsősorban kialakítania. A kormányzati előzetes tesztelés lassíthatja a hazai fejlesztők piacra jutását és versenyhátrányba hozhatja őket külföldi szereplőkkel szemben, továbbá fennáll a veszélye annak, hogy a szabályozás eszközévé válva hozzájáruljon az open-source versenytársak visszaszorításához.