Biztonság

Mesterséges intelligenciával generált szöveg

Anthropic javaslatai az élvonalbeli mesterséges intelligencia-modellek biztonságára

Az Anthropic július 25., 2023-án közzétett bejegyzése az élvonalbeli mesterséges intelligencia-modellek (például Claude) biztonsági védelmének megerősítéséről szól.

Anthropic javaslatai az élvonalbeli mesterséges intelligencia-modellek biztonságára

Dátum: 2023. július 25.

Ahogy az élvonalbeli mesterséges intelligencia‑modellek képességei gyorsan növekednek, Anthropic hangsúlyozza, hogy ezeknek a rendszereknek a biztonsága kritikus fontosságú. A cég a korábbi bejegyzéseiben az Anthropic biztonsági megközelítését és Claude képességeit ismertette; a mostani posztban pedig konkrét lépéseket és javaslatokat oszt meg arról, hogyan kell a modelleket biztonságosan fejleszteni és üzemeltetni.

Miért fontos ez

Anthropic szerint a jövőben elterjedt fejlett AI‑modellek jelentősen befolyásolhatják a gazdasági és nemzetközi biztonsági viszonyokat. Mivel ez a technológia stratégiai jelentőségű, a frontvonalbeli AI‑kutatást és modelleket a hagyományos kereskedelmi technológiákhoz képest jóval szigorúbb védelmi szintre kell emelni, hogy megelőzzék azok ellopását vagy rosszindulatú felhasználását.

Rövid távon a kormányoknak és az élvonalbeli AI‑laboroknak készen kell állniuk arra, hogy védelmet biztosítsanak a fejlett modellek, a modellsúlyok és a mögöttük álló kutatási anyagok számára. Anthropic szerint ez magában foglalja a széles körben elterjesztett, robusztus legjobb gyakorlatok kidolgozását és annak megfontolását, hogy a fejlett AI‑szektor különleges kezelést kapjon a kritikus infrastruktúrához hasonlóan a köz–magán együttműködés szintjén.

Kiberbiztonsági javaslatok

Anthropic alapvetőnek tartja az úgynevezett „két‑szereplős vezérlés” (two‑party control) bevezetését az élvonalbeli AI rendszerek védelmére. Ezt a mintát számos más területen már alkalmazzák: a legbiztonságosabb páncéltermek kinyitásához például két ember és két kulcs szükséges, és több iparágban — gyártás (GMP, ISO 9001), élelmiszerbiztonság (FSMA PCQI, ISO 22000), orvostechnika (ISO 13485) és pénzügyi technológiák (SOX) — használnak több szereplős felülvizsgálati mintákat.

Anthropic szerint ezt a megközelítést alkalmazni kell minden olyan rendszerre, amely a frontier AI modellek fejlesztéséhez, tanításához, hosztolásához és üzembe helyezéséhez kapcsolódik. A gyakorlatban ez azt jelenti, hogy senkinek sem lehet állandó hozzáférése a produkciós kritikus környezetekhez: időkorlátos hozzáférést kell kérni egy kollégától üzleti indoklással. Ezt a mintát Anthropic „multi‑party authorization to AI‑critical infrastructure design” néven említi, és kiemeli, hogy ez egy vezető biztonsági követelmény, amely a teljes kiberbiztonsági legjobb gyakorlatok skálájától függ a helyes megvalósításhoz.

A biztonságos szoftverfejlesztési gyakorlatok szintén alapvetőek az AI‑környezetben. Anthropic a NIST Secure Software Development Framework (SSDF) és a Supply Chain Levels for Software Artifacts (SLSA) szabványokat tekinti aranynormának. Felhívják a figyelmet, hogy végrehajtási rendeletek (például az Egyesült Államokban a 2021‑es EO 14028, amely az OMB‑t utasította szövetségi beszerzési irányelvek kidolgozására) sikerrel ösztönözhetik a nagy technológiai cégeket magasabb fejlesztési színvonalra.

Anthropic megfogalmazása szerint a SSDF és a SLSA nagy része átültethető a modellek és a hozzájuk kapcsolódó szoftverek fejlesztésére: egy modell előállítása és telepítése hasonló folyamat, mint egy szoftver fejlesztése és üzembe helyezése. Ha ezeket a gyakorlatokat megfelelően alkalmazzák, kialakul egy láncoként nyomon követhető „chain of custody”, ami lehetővé teszi, hogy egy telepített modell visszakövethető legyen a fejlesztő céghez — azaz javul a modellproveniencia.

Anthropic ezt „secure model development framework”ként nevezi, és ösztönzi a SSDF kiterjesztését a modellek fejlesztésére NIST szabványalkotási folyamatán belül. Rövid távon ezek a legjobb gyakorlatok beszerzési követelményként is megjelenhetnek kormányzati szerződésekben, ami hatékonyan befolyásolhatja a piacot, mivel sok frontier modell cég az amerikai felhőszolgáltatók infrastruktúráján fut.

Végrehajtás és együttműködés

Anthropic elmondta, hogy maga is bevezeti a két‑szereplős vezérlést, a SSDF‑et, a SLSA‑t és más kiberbiztonsági gyakorlatokat. Ugyanakkor hangsúlyozza: ahogy a modellek képességei nőnek, a védelem további fokozására lesz szükség, és ez iteratív folyamat lesz, amelyben konzultálnak a kormánnyal és az iparági szereplőkkel.

A cég javasolja továbbá, hogy az élvonalbeli AI kutatólaborok hasonló köz–magán együttműködésben vegyenek részt, mint a pénzügyi szolgáltatások kritikus infrastruktúra szektora. A frontvonalbeli AI‑szektort akár az IT‑ágazat külön alcsoportjaként is lehetne kezelni; egy ilyen besorolás segítene az információmegosztás és a kooperáció erősítésében a laborok és a kormányügynökségek között, különösen a nagy erőforrásokkal rendelkező rosszindulatú kibercselekmények elleni védekezésben.

Záró gondolatok

Anthropic elismeri, hogy a biztonság néha látszólag ütközhet a produktivitással, ezért kreatív megoldásokra van szükség, hogy a kutatás és az egyéb munkák hatékonyan folytatódhassanak. A vállalat hangsúlyozza, hogy az AI fejlesztése nagy potenciált hordoz az emberiség számára, de kockázatokkal is jár, ha nem járnak el megfontoltan. Mint a Claude fejlesztője, Anthropic felelősségként kezeli a biztonságos, védett és emberi értékekhez igazodó rendszerépítést, és folytatja nézeteinek megosztását a felelős AI‑fejlesztésről.