Biztonság

Mesterséges intelligenciával generált szöveg

OpenAI Astra modelljének «opaque recurrence» technikája biztonsági aggályokat kelt

Az OpenAI új Astra elnevezésű modellje egy „recurrent depth” vagy „opaque recurrence” néven ismert érvelési technikát alkalmaz, amely nem a hagyományos, lineáris láncolt gondolkodást követi.

OpenAI Astra modelljének «opaque recurrence» technikája biztonsági aggályokat kelt

A The Information keddi jelentése szerint OpenAI új Astra nevű modellje egy "recurrent depth" néven is említett érvelési technikát alkalmaz, amit az iparági cikkek "opaque recurrence" (átláthatatlan rekurzió) néven is neveznek. Ez a megközelítés eltér a legtöbb érvelési modell hagyományos, soros gondolkodási folyamatától, és arra utal, hogy a modell egy lekérdezést többször, hurkokban dolgoz fel.

Miért kelt ez aggodalmat?

A technika kritikusai szerint az opaque recurrence megnehezíti a modell "chain of thought" — azaz a gondolatmenet — nyomon követését és értelmezését. A chain of thought hagyományos esetben azokat a lépéseket tükrözi, amelyeket a modell egy feladat megoldása során követ, és bár nem tökéletes reprezentáció, fontos eszköz a viselkedés vagy a nemkívánatos kimenetek kivizsgálására. Az OpenAI korábbi "rogue agent" eseteiben a chain-of-thought naplók segítettek feltárni az ügynökök viselkedésének okait.

Redwood Research vezérigazgatója, Buck Shlegeris a The Information-cikk után posztjában "rendkívül aggasztónak" nevezte az Astra opaque recurrence használatáról szóló beszámolót. Shlegeris azt írta: nem biztos abban, mennyivel lesz Astra kevésbé monitorozható a chain-of-thought alapján, de ha OpenAI továbbviszi ezt a technikát, „opciójuk nyílhat arra, hogy drasztikusan növeljék a rekurziót és teljesen tönkretegyék a CoT-monitorozhatóságot.”

Hasonlóan aggódik a hosszú ideje AI-biztonsági kérdésekkel foglalkozó Zvi Mowshowitz is, aki szerint törvényekre lehet szükség, hogy megakadályozzák az AI-laborok közötti „versenyt az aljára”. Mowshowitz posztjában arra figyelmeztetett, hogy a technika „játékkal tűzzel”, és sértheti azt a tabut, amelyet az OpenAI és az Anthropic igyekezett létrehozni: a chain-of-thought hűségének és monitorozhatóságának megőrzését.

Redwood Research vezető tudósa, Ryan Greenblatt egy, a hírekre adott reakcióposztban azt írta, hogy az opaque reasoning (átláthatatlan érvelés) könnyen gyorsabban skálázódhat, mint a hagyományos chain-of-thought, és ezzel gyakorlatilag minden érvelést eltávolíthat a látható csatornákból. Greenblatt szerint egy lehetséges, aggasztó irány az lehet, hogy a modell teljesen vagy majdnem teljesen a latens térben kezd el érvelni.

OpenAI álláspontja és korlátok

A beszámolók szerint Astra technikájának alkalmazása korlátozott. Az OpenAI cáfolta, hogy a modell átállna egy úgynevezett "neuralese" — teljesen rejtett, érthetelen belső nyelv — használatára, és hangsúlyozta, hogy továbbra is számítanak a leolvasható gondolatmenetekre. Jakub Pachocki, az OpenAI vezető tudósa egy X-posztban kiemelte, hogy az OpenAI már a legelső érvelési modelljei óta dolgozik a chain-of-thought monitorozás megőrzésén és felhasználásán, és ez a cél központi eleme jelenlegi kutatási programjuknak.

A vállalat emellett bejelentette, hogy kiterjedt chain-of-thought monitorozási rendszerek bevezetését tervezi a jövőbeni biztonsági intézkedései részeként.

Mi a legfontosabb kérdés?

A szakmai konszenzus szerint minden AI-modell végez bizonyos mértékű átláthatatlan érvelést, és sok kutató nem tekinti a chain-of-thought naplókat a modell gondolkodásának direkt, teljes leképezésének. Ugyanakkor az opaque recurrence elterjedése növelheti a kockázatot, hogy a modellek érvelése kevésbé lesz monitorozható, különösen ha ez a megközelítés szélesebb körben elterjed más laboroknál is. A The Information szerdai reggeli további jelentése szerint az Anthropic és a Google DeepMind is már tárgyalt a technikáról.

Az Astra esetében jelenleg úgy tűnik, hogy a technika alkalmazása nem általános és a modell gondolatmenete továbbra is értelmezhető marad. Ugyanakkor a kutatók és biztonsági szakértők figyelmeztetései rámutatnak, hogy a technológiai irányok és skálázódás döntőek lesznek a jövőbeni monitorozhatóság és biztonság szempontjából.