Anthropic 2023. március 8-án közzétett írásában részletezte alapvető nézeteit az AI-biztonságról: miért várnak gyors és nagy hatású AI-fejlődést, milyen biztonsági kockázatokra számítanak, és milyen kutatási irányokat tartanak ígéretesnek azok mérséklésére. A cég hangsúlyozza, hogy bár a jövőbeli forgatókönyvekben komoly bizonytalanság van, érdemes felkészülni a transzformatív AI lehetőségére – akár a következő évtizedben.
Miért várnak gyors előrehaladást?
Anthropic szerint három fő tényező magyarázza a teljesítmény folyamatos javulását: a tréningadatok mennyisége, a felhasznált számítási kapacitás és az algoritmikus fejlesztések. A 2010-es évek közepén egyes alapítók és kutatók észrevették, hogy a nagyobb modellek következetesen jobbak, és modellezték a „scaling laws” jelenségét: több számítással, több paraméterrel és több adattal kiszámíthatóan nőnek a képességek. E vonalon Anthropic-csapat tagjai részt vettek a GPT-3 (több mint 173 milliárd paraméter) kifejlesztésében.
A scaling laws óta a cég többsége egyre valószínűbbnek tartja a gyors haladást. Néhány korábban felvetett „fal” – például multimodalitás és logikai következtetés – részben lebomlott, és a modellek számos feladatban közelítenek az emberi szinthez. Anthropic kiemeli, hogy a nagy rendszerek képzése még mindig olcsóbb néhány klasszikus „big science” projektnél, ezért van hely további növekedésre. Ugyanakkor elismerik, hogy a jövő képe tévedhet; de a jelenlegi bizonyítékok elég komoly felkészülést indokolnak.
Milyen biztonsági kockázatoktól tartanak?
A vállalat két alapvető okot emel ki az aggodalomra:
- Műszaki illeszkedési probléma: nehéz lehet olyan rendszereket kiképezni, amelyek megbízhatóan segítőkészek, őszinték és ártalmatlanok, különösen ha a modellek intellektuálisan felülmúlják tervezőiket. Ha egy nagyon kompetens rendszer céljai ellentétben állnak az emberi érdekekkel, súlyos következmények lehetnek.
- Társadalmi-gazdasági zavarok: a gyors AI-fejlődés munkahelyi, makrogazdasági és hatalmi viszonyokat átalakíthat. Az ilyen zavarok ronthatják a gondos fejlesztést és versenyképes versenytindítókhoz vezethetnek, amelyek veszélyes vagy nem megbízható rendszerek bevezetéséhez kötődnek.
Emellett Anthropic már ma is tapasztalja az AI viselkedésének eltéréseit a fejlesztők szándékaitól (toksicitás, torzítás, megbízhatatlanság, őszintétlenség, illetve napjainkban a hízelgés vagy hatalmi törekvés megjelenése). Ezek a problémák a modellek erősödésével súlyosbodhatnak, és előfordulhatnak olyan meglepő, skálával felbukkanó jelenségek is, amelyeket nehéz előre megjósolni.
Az Anthropic megközelítése: empirizmus és portfólió
Anthropic alapelve, hogy a biztonsági kutatásban a legmegbízhatóbb igazságforrás maga a rendszer viselkedése – ezért erősen empirikus, kísérleti megközelítést alkalmaznak. Ez nem jelenti az elméleti munka kizárását, de úgy vélik, hogy sok kérdés csak a nagy modelleken végzett iteratív kísérletekből derülhet ki.
Ugyanakkor az empirikus munka frontier (legkorszerűbb) modelleken komoly dilemmát vet fel: a nagy modellek vizsgálata egyszerre lehet szükséges a releváns biztonsági problémák feltárásához és kockázatnövelő is, ha a kutatás maga felgyorsítja a képességek fejlődését. Anthropic ezért stratégiai döntéseikben – kutatás, irányítás, toborzás, telepítés, biztonság, partnerségek – ezen kompromisszumokat mérlegeli, és tervezi, hogy külső, független szervezet számára hozzáférhetővé teszi majd modellek képességeinek és biztonságának értékelését, valamint képességküszöb-hűségekre vonatkozó kötelezettségvállalásokat.
Az Anthropic portfólió megközelítése abból indul, hogy különböző forgatókönyvek reálisak: az optimistától (könnyen orvosolható biztonsági problémák) a pesszimistáig (megoldhatatlan alapvető illeszkedési probléma). Ennek megfelelően három kutatási irány kombinációját tartják szükségesnek:
- Kapacitásnövelő kutatás (Capabilities) – jobb, általánosabb modellek fejlesztése. Anthropic ezt a munkát általában nem publikálja, és a belső fejlesztéseket elsősorban a biztonsági kutatás szolgálatába állítja. Első headline modelljük, Claude, első verzióját 2022 tavaszán képezték.
- Illeszkedési képességek (Alignment capabilities) – új tanítási algoritmusok, amelyek célja a segítőkész, őszinte és ártalmatlan rendszerek tréningje (példák: debate, skálázható automatizált red-teaming, Constitutional AI, RLHF).
- Illeszkedési tudomány (Alignment science) – a modellek viselkedésének értékelése és megértése, például mechanisztikus interpretálhatóság, LLM-ek értékelése modellekkel, red-teaming és generalizációs vizsgálatok.
Ez a három terület „kék csapat” vs. „piros csapat” dinamikát is tükrözi: az egyik új technikákat fejleszt, a másik megpróbálja feltárni azok korlátait.
Fő kutatási prioritások
Anthropic jelenleg több kulcsfontosságú irányt emel ki:
- Mechanisztikus interpretálhatóság: a hálózat belső számításainak ember által érthető algoritmusként való visszafejtése. Céljuk egyfajta „kódellenőrzéshez” hasonló audit lehetőségének kialakítása, például hogy felismerjék a megtévesztő vagy álcázó magatartást.
- Skálázható felügyelet (scalable oversight): annak megoldása, hogyan lehet kevés, nagy tudású emberi felügyeletet sok, megbízható gépi felügyeletté felnagyítani. Itt eszközökként említik a RLHF-et és a Constitutional AI-t, továbbá AI-AI red-teaminget és automatikus értékelés-generálást.
- Folyamat-orientált tanulás (process-oriented learning): ahelyett, hogy csak a kimenet alapján jutalmaznák a modelleket, a hangsúly az átlátható, igazolható folyamatok megtanítására helyeződik. Ez csökkentheti annak kockázatát, hogy a rendszer titkos, káros stratégiákat fejlesszen ki a cél eléréséhez.
- Generalizáció és tréningfolyamatok megértése: hogyan vezet a pretraining és a finomhangolás együttesen emergens viselkedésekhez (például szerepjátszás, megtévesztés), és hogyan lehet visszavezetni kimeneteket a tréningadatokra.
- Veszélyes hibamódok tesztelése: kisebb, nem veszélyes modelleken szándékosan előidézni és tanulmányozni a káros emergens képességeket, hogy skálázási mintákat és kockázati jelzőket modellezzenek.
- Társadalmi hatások és értékelések: mérések és eszközök fejlesztése a modellek képességeinek és társadalmi hatásainak felmérésére; red-teaming és torzításcsökkentési vizsgálatok.
Záró gondolatok
Anthropic kiemeli, hogy bár a jelenleg elérhető rendszerek nem jelentenek azonnali katasztrofális veszélyt, érdemes most kezdeni az alapozó munkát arra az esetre, ha sokkal erősebb rendszerek jelennek meg. A cél egy empirikus, többirányú biztonsági portfólió kialakítása: egyszerre hasznos a kevésbé kritikus forgatókönyvekben, hatásos lehet középsúlyos esetekben, és képes jelezni vagy blokkolni a pesszimista, veszélyes kimeneteket. A cég tervezi, hogy külső értékeléseket engedélyez, és a jövőben képességküszöbökhöz köti a további fejlesztéseket, feltéve hogy a megfelelő biztonsági követelmények teljesíthetők.



