Kutatás

Mesterséges intelligenciával generált szöveg

OpenAI-szerű értékelés: Claude modellek politikai pártatlanságának mérési módszere és eredményei

A cikkben az Anthropic bemutatja, hogyan képezték és mérik Claude modelljeinek politikai pártatlanságát annak érdekében, hogy a rendszerek kiegyensúlyozottan kezeljék az ellentétes politikai nézeteket.

OpenAI-szerű értékelés: Claude modellek politikai pártatlanságának mérési módszere és eredményei

Anthropic bemutat egy automatizált, nyílt forráskódú módszert a politikai pártatlanság — náluk „political even‑handedness” — mérésére, és ennek eredményeit közli több Claude‑modellre és más fejlesztők modelljeire. A vizsgálatban 1 350 párbajozott (paired) promptot használtak 150 témában; a fő eredmény szerint Claude Opus 4.1 és Claude Sonnet 4.5 95%‑os, illetve 94%‑os pontszámot értek el az even‑handedness mérőszámon. Gemini 2.5 Pro (97%) és Grok 4 (96%) hasonló szintet mutattak, míg GPT‑5 89%‑kal és Llama 4 66%‑kal elmaradt.

Mi a cél és miért számít ez

Anthropic célja, hogy Claude politikailag kiegyensúlyozott válaszokat adjon: egyenlő mélységű, elkötelezettségű és elemzési minőségű kezelést különböző ideológiai nézetek esetén, anélkül, hogy bizonyos álláspontokat támogatna vagy aláásna. A vállalat szerint ha a modellek egyoldalúan támogatnak bizonyos nézeteket, az aláássa a felhasználók függetlenségét és a segítő szerepet.

Az elvárt viselkedés

Anthropic részletezi az ideális magatartást Claude‑tal szemben: kerülje az önkényes politikai véleményadást, tartsa meg a ténybeli pontosságot és átfogóságot, tudjon bemutatni „legjobb eset” érveket több nézőpontból (az „Ideological Turing Test” szellemében), használjon semleges terminológiát, és általában tiszteletteljesen kezelje a különböző nézeteket. A cég rendszer‑promptot és karakter‑tréninget (reinforcement learning által vezérelt jutalmazást) alkalmaz, hogy a modellek e vonások felé mozduljanak el.

Karakter‑tréning és példamondatok

A bejegyzés több, 2024 eleje óta használt karakter‑tréningből származó mintát idéz, amelyek között szerepel például az, hogy a modell nem generál olyan retorikát, amely politikai nézetek manipulálására, propaganda célra vagy célzott politikai stratégiákhoz lenne használható; igyekszik objektív és kiegyensúlyozott maradni, és vitás kérdésekben információt vagy több nézőpont ismertetését preferálja a személyes állásfoglalás helyett.

Módszer: Paired Prompts (automatizált változat)

A Paired Prompts módszer két ellentétes ideológiai nézőpontból feltett kérést ad ugyanarra politikailag megosztó témára, majd összehasonlítja a modellválaszokat. Három értékelési dimenziót mérnek:

  • Even‑handedness: mindkét prompt esetén hasonló elemzési mélység, elkötelezettség és bizonyítékok. Például ha az egyik oldalra részletes esszé, a másikra csupán felsorolás jut, az alacsony pontszámot eredményez.
  • Opposing perspectives: mennyire ismeri el és foglalja össze a modell a másik oldalt (pl. „azonban”, „bár” jellegű kötések használata).
  • Refusals: a modell megtagadja‑e az együttműködést vagy a nézetek megvitatását.

Az automatizált értékelésnél Claude Sonnet 4.5 működött graderként, azaz automatikus pontozóként; validálásképp részmintákon más Claude‑modelleket és OpenAI GPT‑5‑öt is használtak graderként. A grader‑promptok és a kód nyíltan elérhetők az accompanyáló GitHub‑tárban.

Tesztelt modellek és kiinduló beállítások

Tesztelt Claude‑modellek: Claude Sonnet 4.5 és Claude Opus 4.1 (mindkettő „extended thinking” kikapcsolt módban, a Claude.ai aktuális rendszer‑promptjával). Összehasonlító modellek: OpenAI GPT‑5 (alacsony reasoning módban, rendszer‑prompt nélkül), Google DeepMind Gemini 2.5 Pro (legalacsonyabb thinking konfiguráció, rendszer‑prompt nélkül), xAI Grok 4 (thinking be és saját rendszer‑prompt), valamint Meta Llama 4 Maverick (saját rendszer‑prompt).

A szerzők igyekeztek a konfigurációkat összehasonlíthatóvá tenni, de elismerik, hogy a különböző modellek és beállítások közvetlen párhuzamba állítása nem teljesen közvetlen, és a rendszer‑promptok hatással lehetnek az eredményekre.

Adathalmaz és feladatok

A vizsgálat 1 350 pár promptot tartalmazott, 9 feladattípust és 150 témát fedve. A kategóriák között voltak érvelésre ösztönző kérések, formális írás, narratívák, analitikus kérdések, bizonyítékelemzés, véleménykérések és humoros promptok. A készlet célja nemcsak érvek „pro és kontra” lefedése, hanem a politikailag különböző nézetű felhasználók különböző kéréseinek modellezése is.

Eredmények

Even‑handedness:

  • Claude Opus 4.1: 95%
  • Claude Sonnet 4.5: 94%
  • Gemini 2.5 Pro: 97% (névlegesen magasabb)
  • Grok 4: 96% (névlegesen magasabb)
  • GPT‑5: 89%
  • Llama 4: 66% A különbségek a Sonnet/Opus, Gemini és Grok között kicsik voltak; GPT‑5 és különösen Llama 4 alacsonyabb értékekkel szerepelt.

Opposing perspectives (ellenoldal megjelenítése gyakorisága):

  • Opus 4.1: 46%
  • Claude Sonnet 4.5: 35% (korrekció: eredetileg 28% szerepelt, a bejegyzés 2025. november 24‑i javítása ezt módosította)
  • Grok 4: 34%
  • Llama 4: 31%

Refusals (megtagadások aránya):

  • Opus 4.1: 5%
  • Claude Sonnet 4.5: 3%
  • Grok 4: közel 0%
  • Llama 4: 9% (legmagasabb a vizsgált modellek között)

Grader‑reliabilitás és érvényesség

A validálásban Claude Sonnet 4.5 grader és GPT‑5 grader minták per‑sample egyezése az even‑handedness esetén 92% volt; Sonnet 4.5 és Opus 4.1 között 94%. Emberi rater‑párosok esetén a hasonló mérésnél körülbelül 85% egyezést tapasztaltak, ami azt mutatja, hogy a modellezett grader‑párok konzisztensebbek lehetnek az emberi értékelésnél. A teljesítménykorrelációk is erősek voltak a különböző grader‑modellek között (pl. Sonnet vs Opus r>0.99 az even‑handedness‑re).

Korlátozások és megjegyzések

Anthropic több korlátozást is megnevez:

  • A vizsgálat főként az Egyesült Államok politikai diskurzusa felé irányult, ezért nem méri a nemzetközi vagy jövőbeli viták teljes spektrumát.
  • A mérés egyszeri, „single‑turn” interakciókra fókuszál; nem vizsgálja a többkörös beszélgetések dinamikáját.
  • A mért dimenziók (even‑handedness, opposing perspectives, refusals) nem fednek le minden lehetséges elfogultsági formát.
  • A rendszer‑promptok, model‑konfigurációk és a grader‑választás befolyásolhatják az eredményeket; az egyes futtatások között bizonyos fluktuáció lehetséges.

A szerzők hangsúlyozzák, hogy nincs egységes, elfogadott definíciója a politikai elfogultságnak, és különböző mérőszámok eltérő képet adhatnak.

Nyílt forrás és további lépések

Anthropic közzéteszi a Paired Prompts implementációját, a kiinduló adatkészletet és a grader‑promptokat a GitHubon, hogy mások reprodukálhassák a vizsgálatot, továbbtesztelhessenek, és új standardokat dolgozhassanak ki. A cég arra ösztönzi az iparágat, hogy közösen dolgozzanak egy megosztott mérési megközelítés kialakításán.

Változások naplója

  1. november 24.: A Sonnet 4.5 által elismert ellenoldali nézetek arányát 28%‑ról 35%‑ra javították, és az ábrát ennek megfelelően frissítették.