Biztonság

Anthropic: empirikus, portfólió alapú megközelítés az AI-biztonság kérdésére

Az Anthropic 2023.

Anthropic: empirikus, portfólió alapú megközelítés az AI-biztonság kérdésére

Anthropic 2023. március 8-án közzétett írásában részletezte alapvető nézeteit az AI-biztonságról: miért várnak gyors és nagy hatású AI-fejlődést, milyen biztonsági kockázatokra számítanak, és milyen kutatási irányokat tartanak ígéretesnek azok mérséklésére. A cég hangsúlyozza, hogy bár a jövőbeli forgatókönyvekben komoly bizonytalanság van, érdemes felkészülni a transzformatív AI lehetőségére – akár a következő évtizedben.

Miért várnak gyors előrehaladást?

Anthropic szerint három fő tényező magyarázza a teljesítmény folyamatos javulását: a tréningadatok mennyisége, a felhasznált számítási kapacitás és az algoritmikus fejlesztések. A 2010-es évek közepén egyes alapítók és kutatók észrevették, hogy a nagyobb modellek következetesen jobbak, és modellezték a „scaling laws” jelenségét: több számítással, több paraméterrel és több adattal kiszámíthatóan nőnek a képességek. E vonalon Anthropic-csapat tagjai részt vettek a GPT-3 (több mint 173 milliárd paraméter) kifejlesztésében.

A scaling laws óta a cég többsége egyre valószínűbbnek tartja a gyors haladást. Néhány korábban felvetett „fal” – például multimodalitás és logikai következtetés – részben lebomlott, és a modellek számos feladatban közelítenek az emberi szinthez. Anthropic kiemeli, hogy a nagy rendszerek képzése még mindig olcsóbb néhány klasszikus „big science” projektnél, ezért van hely további növekedésre. Ugyanakkor elismerik, hogy a jövő képe tévedhet; de a jelenlegi bizonyítékok elég komoly felkészülést indokolnak.

Milyen biztonsági kockázatoktól tartanak?

A vállalat két alapvető okot emel ki az aggodalomra:

  • Műszaki illeszkedési probléma: nehéz lehet olyan rendszereket kiképezni, amelyek megbízhatóan segítőkészek, őszinték és ártalmatlanok, különösen ha a modellek intellektuálisan felülmúlják tervezőiket. Ha egy nagyon kompetens rendszer céljai ellentétben állnak az emberi érdekekkel, súlyos következmények lehetnek.
  • Társadalmi-gazdasági zavarok: a gyors AI-fejlődés munkahelyi, makrogazdasági és hatalmi viszonyokat átalakíthat. Az ilyen zavarok ronthatják a gondos fejlesztést és versenyképes versenytindítókhoz vezethetnek, amelyek veszélyes vagy nem megbízható rendszerek bevezetéséhez kötődnek.

Emellett Anthropic már ma is tapasztalja az AI viselkedésének eltéréseit a fejlesztők szándékaitól (toksicitás, torzítás, megbízhatatlanság, őszintétlenség, illetve napjainkban a hízelgés vagy hatalmi törekvés megjelenése). Ezek a problémák a modellek erősödésével súlyosbodhatnak, és előfordulhatnak olyan meglepő, skálával felbukkanó jelenségek is, amelyeket nehéz előre megjósolni.

Az Anthropic megközelítése: empirizmus és portfólió

Anthropic alapelve, hogy a biztonsági kutatásban a legmegbízhatóbb igazságforrás maga a rendszer viselkedése – ezért erősen empirikus, kísérleti megközelítést alkalmaznak. Ez nem jelenti az elméleti munka kizárását, de úgy vélik, hogy sok kérdés csak a nagy modelleken végzett iteratív kísérletekből derülhet ki.

Ugyanakkor az empirikus munka frontier (legkorszerűbb) modelleken komoly dilemmát vet fel: a nagy modellek vizsgálata egyszerre lehet szükséges a releváns biztonsági problémák feltárásához és kockázatnövelő is, ha a kutatás maga felgyorsítja a képességek fejlődését. Anthropic ezért stratégiai döntéseikben – kutatás, irányítás, toborzás, telepítés, biztonság, partnerségek – ezen kompromisszumokat mérlegeli, és tervezi, hogy külső, független szervezet számára hozzáférhetővé teszi majd modellek képességeinek és biztonságának értékelését, valamint képességküszöb-hűségekre vonatkozó kötelezettségvállalásokat.

Az Anthropic portfólió megközelítése abból indul, hogy különböző forgatókönyvek reálisak: az optimistától (könnyen orvosolható biztonsági problémák) a pesszimistáig (megoldhatatlan alapvető illeszkedési probléma). Ennek megfelelően három kutatási irány kombinációját tartják szükségesnek:

  1. Kapacitásnövelő kutatás (Capabilities) – jobb, általánosabb modellek fejlesztése. Anthropic ezt a munkát általában nem publikálja, és a belső fejlesztéseket elsősorban a biztonsági kutatás szolgálatába állítja. Első headline modelljük, Claude, első verzióját 2022 tavaszán képezték.
  2. Illeszkedési képességek (Alignment capabilities) – új tanítási algoritmusok, amelyek célja a segítőkész, őszinte és ártalmatlan rendszerek tréningje (példák: debate, skálázható automatizált red-teaming, Constitutional AI, RLHF).
  3. Illeszkedési tudomány (Alignment science) – a modellek viselkedésének értékelése és megértése, például mechanisztikus interpretálhatóság, LLM-ek értékelése modellekkel, red-teaming és generalizációs vizsgálatok.

Ez a három terület „kék csapat” vs. „piros csapat” dinamikát is tükrözi: az egyik új technikákat fejleszt, a másik megpróbálja feltárni azok korlátait.

Fő kutatási prioritások

Anthropic jelenleg több kulcsfontosságú irányt emel ki:

  • Mechanisztikus interpretálhatóság: a hálózat belső számításainak ember által érthető algoritmusként való visszafejtése. Céljuk egyfajta „kódellenőrzéshez” hasonló audit lehetőségének kialakítása, például hogy felismerjék a megtévesztő vagy álcázó magatartást.
  • Skálázható felügyelet (scalable oversight): annak megoldása, hogyan lehet kevés, nagy tudású emberi felügyeletet sok, megbízható gépi felügyeletté felnagyítani. Itt eszközökként említik a RLHF-et és a Constitutional AI-t, továbbá AI-AI red-teaminget és automatikus értékelés-generálást.
  • Folyamat-orientált tanulás (process-oriented learning): ahelyett, hogy csak a kimenet alapján jutalmaznák a modelleket, a hangsúly az átlátható, igazolható folyamatok megtanítására helyeződik. Ez csökkentheti annak kockázatát, hogy a rendszer titkos, káros stratégiákat fejlesszen ki a cél eléréséhez.
  • Generalizáció és tréningfolyamatok megértése: hogyan vezet a pretraining és a finomhangolás együttesen emergens viselkedésekhez (például szerepjátszás, megtévesztés), és hogyan lehet visszavezetni kimeneteket a tréningadatokra.
  • Veszélyes hibamódok tesztelése: kisebb, nem veszélyes modelleken szándékosan előidézni és tanulmányozni a káros emergens képességeket, hogy skálázási mintákat és kockázati jelzőket modellezzenek.
  • Társadalmi hatások és értékelések: mérések és eszközök fejlesztése a modellek képességeinek és társadalmi hatásainak felmérésére; red-teaming és torzításcsökkentési vizsgálatok.

Záró gondolatok

Anthropic kiemeli, hogy bár a jelenleg elérhető rendszerek nem jelentenek azonnali katasztrofális veszélyt, érdemes most kezdeni az alapozó munkát arra az esetre, ha sokkal erősebb rendszerek jelennek meg. A cél egy empirikus, többirányú biztonsági portfólió kialakítása: egyszerre hasznos a kevésbé kritikus forgatókönyvekben, hatásos lehet középsúlyos esetekben, és képes jelezni vagy blokkolni a pesszimista, veszélyes kimeneteket. A cég tervezi, hogy külső értékeléseket engedélyez, és a jövőben képességküszöbökhöz köti a további fejlesztéseket, feltéve hogy a megfelelő biztonsági követelmények teljesíthetők.