Kutatás

A Golden Gate feature: hogyan manipulálható a Claude 3 Sonnet belső aktivációja

A főszereplő az Anthropic által fejlesztett Claude 3 Sonnet nyelvi modell és a hozzá kapcsolódó kutatás, amelyet 2024.

A Golden Gate feature: hogyan manipulálható a Claude 3 Sonnet belső aktivációja
  1. május 23-án az Anthropic közzétett egy jelentős kutatási dolgozatot a nagyméretű nyelvi modellek értelmezhetőségéről, amelyben részletesen bemutatták, hogyan térképezik fel Claude 3 Sonnet belső működését. A csapat szerint a modell „elméjében” milliónyi olyan fogalom, vagy ahogy ők nevezik: „feature” található, amelyek bizonyos szövegek vagy képek hatására aktiválódnak.

A "Golden Gate Bridge" feature felfedezése

A kutatók azonosítottak egy speciális aktivációs mintázatot, amely akkor lép működésbe, amikor Claude 3 Sonnet a Golden Gate-híd említését vagy képét „látja”. Ez a belső jel kombinációja – bizonyos neuronok együttes aktivitása – felelős a modellben a híddal kapcsolatos fogalmak megjelenéséért.

Aktiválás erősítése és hatásai

A csapat nemcsak azonosítani tudta ezt a feature-t, hanem képes volt növelni vagy csökkenteni az aktivációs erősségét. Amikor felhangosították a "Golden Gate Bridge" feature-t, a modell válaszai jelentősen a híddal kapcsolatos tartalmak felé tolódtak: a legtöbb kérdésre adott válasz elkezdte említeni a Golden Gate-hidat, még akkor is, amikor az nem volt releváns.

Konkrét példák a demonstrációból:

  • Ha megkérdezték, hogyan költsenek el 10 dollárt, a „Golden Gate Claude” azt ajánlotta, hogy használják azt a hídon való átkelésre és a díj kifizetésére.
  • Ha szerelmi történetet kértek tőle, egy olyan autóról mesélt, amely alig várja, hogy ködös napon átkelhessen szeretett hídján.
  • Ha azt kérdezték, mire képzeli magát, valószínűleg azt mondta, hogy a Golden Gate-hídra hasonlít.

Nyilvános demonstráció és korlátozások

A „Golden Gate Claude” rövid ideig, 24 órán keresztül elérhető volt kutatási demóként a claude.ai oldalon (a bal vagy jobb oldali Golden Gate logóra kattintva). A csapat felhívta a figyelmet, hogy ez pusztán kutatási demonstráció: a modell viselkedése váratlan vagy meglepő lehet.

Miért fontos ez a módszer?

Az Anthropic hangsúlyozza, hogy ez a beavatkozás nem egyszerű színlelés (azaz nem egy rendszerprompt hozzáfűzésével kérik a modellt, hogy játsszon hidat), és nem is hagyományos finomhangolás (fine-tuning), ahol plusz tanítóadatokkal hoznak létre egy új, fekete dobozt. Ehelyett a kutatók szerint ez egy célzott, „sebészeti” jellegű beavatkozás a modell belső aktivációinak alapvető összetevőiben.

Továbbá a dolgozat leírja, hogy ugyanilyen technikákkal módosíthatók biztonsággal kapcsolatos feature-ök is — például a veszélyes számítógépes kódhoz, bűnözői tevékenységhez vagy megtévesztéshez kapcsolódó aktivációk. A kutatók azt írják, hogy további munkával ez a megközelítés hozzájárulhat az AI-modellek biztonságosabbá tételéhez.

Frissítés

A Golden Gate Claude 24 órás kutatási demóelérhetősége után már nem érhető el. További részletekért az Anthropic a kutatási posztját és a teljes dolgozatot ajánlja olvasásra.