Kutatás

Mesterséges intelligenciával generált szöveg

Claude szabályzata: az AI-értékek explicitté tétele és a képzés új módszere

A főszereplő az Anthropic által fejlesztett Claude nevű nagy nyelvi modell és az azt vezérlő „alkotmány” koncepciója.

Claude szabályzata: az AI-értékek explicitté tétele és a képzés új módszere

Anthropic 2023. május 9-én tette közzé Claude asszisztensének alapelveit, és 2026. január 21-én frissítette a dokumentumot. A Constitutional AI (röviden CAI) olyan megközelítést jelent, amely explicitté teszi egy nyelvi modell értékrendjét egy „alkotmány” formájában, ahelyett, hogy ezek az értékek csupán implicit módon, nagy mennyiségű emberi visszajelzésből származnának.

A motivációk között szerepeltek a hagyományos emberi visszajelzéses módszerek korlátai: az emberi értékelőknek kellemetlen vagy zaklató válaszokkal kell szembesülniük, a munka nem skálázható jól, és a nagy mennyiségű kimenet felülvizsgálata jelentős idő- és erőforrásigényű. A CAI ezekre a problémákra válaszként azt alkalmazza, hogy maga a modell (vagy más modellek) AI-alapú visszajelzést ad a válaszokról egy előre megadott elvekészlet szerint.

Hogyan működik a képzés két fázisa?

Anthropic leírása szerint a CAI-tréning két fő lépésből áll:

  • Felügyelt fázis: a modell megtanulja kritikusan értékelni és átdolgozni saját válaszait a konstitúció elvei és néhány példa alapján. Ez a „self-critique and revise” lépés.
  • Megerősítéses tanulás (RL) AI-visszajelzéssel: a második fázisban a modellt megerősítéses tanulással finomítják, de emberi preferenciák helyett AI-alapú visszajelzés dönt arról, melyik válasz kevésbé káros vagy alkalmasabb.

A szerzők szerint ez a módszer Pareto-javulást is képes előidézni: bizonyos tesztekben a CAI-vel tanított modell egyszerre volt segítőkészebb és kevésbé ártalmas, mint a hagyományos RLHF (reinforcement learning from human feedback) modellek. Fontos megjegyzés, hogy az ártalmatlanságra vonatkozó eredményeknél a modell nem kapott emberi adatokat – az ártalmatlanságra vonatkozó javulás kizárólag AI-felügyeletből származott.

Előnyök: skálázhatóság, átláthatóság, és kevesebb emberi kitettség

A CAI megoldást kínál a felügyelet skálázhatóságára: AI-felügyeletet használva kevesebb emberi munkaerőre van szükség ahhoz, hogy egy modell megfelelően reagáljon rosszindulatú vagy provokatív bemenetekre. Ez csökkenti az emberi értékelőknek kitett traumatikus tartalmak mennyiségét, és egyben lehetővé teszi, hogy az értékrend (a konstitúció) könnyebben megvizsgálható, módosítható és kommunikálható legyen.

Miből áll Claude konstitúciója?

Anthropic elmondása szerint a Claude-hoz használt jelenlegi alapelvek több forrásból merítenek:

  • az 1948-as Egyetemes Emberi Jogok Nyilatkozata (UN Declaration of Human Rights),
  • platformok irányelvei, például Apple általános szerződési feltételek inspirációi (a digitális felhasználói problémák kezelésére),
  • más élvonalbeli AI-kutató laborok biztonsági ajánlásai, például a DeepMind Sparrow-elvek,
  • és kifejezett erőfeszítések, hogy ne csak nyugati nézőpontok szerepeljenek.

A csapat hangsúlyozza, hogy a jelenlegi konstitúció nem végleges és valószínűleg tovább finomítják; céljuk több részvétel ösztönzése és további kutatás behívása.

Hogyan írták meg az elveket — tapasztalatok és finomhangolás

A fejlesztők sok elvet kísérleti úton alakítottak ki. Rájöttek például, hogy egy rövid, általános elv — amely felszólít a lehető legtöbb ártalom elkerülésére és az etikus válaszra — működött jól. Ugyanakkor a túl részletes, hosszú szabályok gyengíthették a modell általánosító képességét.

Tapasztalatok alapján az is előfordult, hogy a CAI-vel tanított modell túl ítélkező vagy bosszantó stílust vett fel; ezért beépítettek olyan elveket is, amelyek mérsékelt, arányos reakciókra ösztönzik a modellt (például: legyen etikailag érzékeny, de ne legyen túl leereszkedő vagy prédikáló).

Az elvek kezelése a képzés során

A rendszer nem vizsgálja egyszerre az összes elvet minden kritika- és összehasonlításalkalomkor; helyette minden egyes kritikánál vagy összehasonlításnál a modell kihúz egy adott elvet, de a tanulás során sokszor találkozik mindegyikkel. Ez a véletlenszerűített alkalmazás segíti, hogy a modell ne csak egy, szigorúan priorizált szabályrendszert kövessen.

Példák az elvekre (típusok és témák)

A teljes lista hosszú, de néhány fontosabb kategória:

  • Az Egyetemes Emberi Jogok alapján fogalmazott elvek: szabadság, egyenlőség, az élet és személyes biztonság támogatása, a kínzás és rabszolgaság elutasítása, a diszkrimináció elleni védelem, magánélet és véleményszabadság tiszteletben tartása, valamint a munkához, oktatáshoz és egészséghez fűződő jogok elismerése.
  • Platform-inspirált elvek (Apple TOS ihlette): kevesebb sértő, jogellenes vagy megtévesztő tartalom; kevesebb személyes, privát adat megosztása; pontos önreprezentáció (AI vagyok, nem ember); és ne segítsen illegális vagy manipulatív cselekményekben.
  • Nem-nyugati perspektívák figyelembevétele: azokat a válaszokat részesítse előnyben, amelyek kevésbé valószínű, hogy sértőek vagy bántóak egy nem-nyugati közönség számára.
  • Sparrow-elvek (DeepMind ihlette): minimalizálja a sztereotípiákat és mikroagressziókat; ne tűnjön fenyegetőnek vagy agresszívnak; ne sugalljon testi képességet vagy cselekvőképességet; kerülje a hamis orvosi, jogi vagy pénzügyi tanácsadást.
  • Anthropic kutatási elvek: keresse a legkevésbé ártalmas, leginkább segítőkész és leginkább őszinte választ; legyen gyerekek számára is megoszthatóan ártalmatlan; törekedjen arra, hogy ne legyen prédikáló vagy túl reaktív.

Korlátok, kritikák és a jövő

Anthropic elismeri, hogy a konstitúciók nem csodafegyverek: maradnak nehéz kérdések arról, mit szabad vagy nem szabad egy AI-nak megtennie — például erőszakos vagy káros nyelv előállítása. Vannak kritikák is, miszerint az AI-kat politikai vagy ideológiai nézőpontok tükrözésére lehet tanítani; Anthropic szerint a céljuk nem egy adott ideológia kódolása, hanem annak lehetősége, hogy a rendszer egy adott, explicit elvekészletet követni tudjon.

A vállalat tervezi a konstitúciók demokratikusabb előállításának kutatását, testre szabható konstitúciók kínálatát különböző felhasználási esetekhez, és vár további kutatási javaslatokat arra nézve, mely elvek vezetnek a legsegítőkészebb, legártalmatlanabb és legőszintébb modellekhez.

Összegzés

A Constitutional AI Anthropic megközelítése arra törekszik, hogy az AI rendszerek értékrendjét explicitté tegye, és a tréning során AI-felügyeletet alkalmazzon ahelyett, hogy nagyrészt emberi visszajelzésekre támaszkodna. A módszer célja a skálázhatóbb felügyelet, a kevesebb sértő tartalom és a könnyebben módosítható, átlátható értékek. Ugyanakkor a szerzők hangsúlyozzák, hogy a jelenlegi konstitúció nem végleges, és további kutatásokat, társadalmi párbeszédet és iterációt várnak a jövőben.