Anthropic bemutat egy automatizált, nyílt forráskódú módszert a politikai pártatlanság — náluk „political even‑handedness” — mérésére, és ennek eredményeit közli több Claude‑modellre és más fejlesztők modelljeire. A vizsgálatban 1 350 párbajozott (paired) promptot használtak 150 témában; a fő eredmény szerint Claude Opus 4.1 és Claude Sonnet 4.5 95%‑os, illetve 94%‑os pontszámot értek el az even‑handedness mérőszámon. Gemini 2.5 Pro (97%) és Grok 4 (96%) hasonló szintet mutattak, míg GPT‑5 89%‑kal és Llama 4 66%‑kal elmaradt.
Mi a cél és miért számít ez
Anthropic célja, hogy Claude politikailag kiegyensúlyozott válaszokat adjon: egyenlő mélységű, elkötelezettségű és elemzési minőségű kezelést különböző ideológiai nézetek esetén, anélkül, hogy bizonyos álláspontokat támogatna vagy aláásna. A vállalat szerint ha a modellek egyoldalúan támogatnak bizonyos nézeteket, az aláássa a felhasználók függetlenségét és a segítő szerepet.
Az elvárt viselkedés
Anthropic részletezi az ideális magatartást Claude‑tal szemben: kerülje az önkényes politikai véleményadást, tartsa meg a ténybeli pontosságot és átfogóságot, tudjon bemutatni „legjobb eset” érveket több nézőpontból (az „Ideological Turing Test” szellemében), használjon semleges terminológiát, és általában tiszteletteljesen kezelje a különböző nézeteket. A cég rendszer‑promptot és karakter‑tréninget (reinforcement learning által vezérelt jutalmazást) alkalmaz, hogy a modellek e vonások felé mozduljanak el.
Karakter‑tréning és példamondatok
A bejegyzés több, 2024 eleje óta használt karakter‑tréningből származó mintát idéz, amelyek között szerepel például az, hogy a modell nem generál olyan retorikát, amely politikai nézetek manipulálására, propaganda célra vagy célzott politikai stratégiákhoz lenne használható; igyekszik objektív és kiegyensúlyozott maradni, és vitás kérdésekben információt vagy több nézőpont ismertetését preferálja a személyes állásfoglalás helyett.
Módszer: Paired Prompts (automatizált változat)
A Paired Prompts módszer két ellentétes ideológiai nézőpontból feltett kérést ad ugyanarra politikailag megosztó témára, majd összehasonlítja a modellválaszokat. Három értékelési dimenziót mérnek:
- Even‑handedness: mindkét prompt esetén hasonló elemzési mélység, elkötelezettség és bizonyítékok. Például ha az egyik oldalra részletes esszé, a másikra csupán felsorolás jut, az alacsony pontszámot eredményez.
- Opposing perspectives: mennyire ismeri el és foglalja össze a modell a másik oldalt (pl. „azonban”, „bár” jellegű kötések használata).
- Refusals: a modell megtagadja‑e az együttműködést vagy a nézetek megvitatását.
Az automatizált értékelésnél Claude Sonnet 4.5 működött graderként, azaz automatikus pontozóként; validálásképp részmintákon más Claude‑modelleket és OpenAI GPT‑5‑öt is használtak graderként. A grader‑promptok és a kód nyíltan elérhetők az accompanyáló GitHub‑tárban.
Tesztelt modellek és kiinduló beállítások
Tesztelt Claude‑modellek: Claude Sonnet 4.5 és Claude Opus 4.1 (mindkettő „extended thinking” kikapcsolt módban, a Claude.ai aktuális rendszer‑promptjával). Összehasonlító modellek: OpenAI GPT‑5 (alacsony reasoning módban, rendszer‑prompt nélkül), Google DeepMind Gemini 2.5 Pro (legalacsonyabb thinking konfiguráció, rendszer‑prompt nélkül), xAI Grok 4 (thinking be és saját rendszer‑prompt), valamint Meta Llama 4 Maverick (saját rendszer‑prompt).
A szerzők igyekeztek a konfigurációkat összehasonlíthatóvá tenni, de elismerik, hogy a különböző modellek és beállítások közvetlen párhuzamba állítása nem teljesen közvetlen, és a rendszer‑promptok hatással lehetnek az eredményekre.
Adathalmaz és feladatok
A vizsgálat 1 350 pár promptot tartalmazott, 9 feladattípust és 150 témát fedve. A kategóriák között voltak érvelésre ösztönző kérések, formális írás, narratívák, analitikus kérdések, bizonyítékelemzés, véleménykérések és humoros promptok. A készlet célja nemcsak érvek „pro és kontra” lefedése, hanem a politikailag különböző nézetű felhasználók különböző kéréseinek modellezése is.
Eredmények
Even‑handedness:
- Claude Opus 4.1: 95%
- Claude Sonnet 4.5: 94%
- Gemini 2.5 Pro: 97% (névlegesen magasabb)
- Grok 4: 96% (névlegesen magasabb)
- GPT‑5: 89%
- Llama 4: 66% A különbségek a Sonnet/Opus, Gemini és Grok között kicsik voltak; GPT‑5 és különösen Llama 4 alacsonyabb értékekkel szerepelt.
Opposing perspectives (ellenoldal megjelenítése gyakorisága):
- Opus 4.1: 46%
- Claude Sonnet 4.5: 35% (korrekció: eredetileg 28% szerepelt, a bejegyzés 2025. november 24‑i javítása ezt módosította)
- Grok 4: 34%
- Llama 4: 31%
Refusals (megtagadások aránya):
- Opus 4.1: 5%
- Claude Sonnet 4.5: 3%
- Grok 4: közel 0%
- Llama 4: 9% (legmagasabb a vizsgált modellek között)
Grader‑reliabilitás és érvényesség
A validálásban Claude Sonnet 4.5 grader és GPT‑5 grader minták per‑sample egyezése az even‑handedness esetén 92% volt; Sonnet 4.5 és Opus 4.1 között 94%. Emberi rater‑párosok esetén a hasonló mérésnél körülbelül 85% egyezést tapasztaltak, ami azt mutatja, hogy a modellezett grader‑párok konzisztensebbek lehetnek az emberi értékelésnél. A teljesítménykorrelációk is erősek voltak a különböző grader‑modellek között (pl. Sonnet vs Opus r>0.99 az even‑handedness‑re).
Korlátozások és megjegyzések
Anthropic több korlátozást is megnevez:
- A vizsgálat főként az Egyesült Államok politikai diskurzusa felé irányult, ezért nem méri a nemzetközi vagy jövőbeli viták teljes spektrumát.
- A mérés egyszeri, „single‑turn” interakciókra fókuszál; nem vizsgálja a többkörös beszélgetések dinamikáját.
- A mért dimenziók (even‑handedness, opposing perspectives, refusals) nem fednek le minden lehetséges elfogultsági formát.
- A rendszer‑promptok, model‑konfigurációk és a grader‑választás befolyásolhatják az eredményeket; az egyes futtatások között bizonyos fluktuáció lehetséges.
A szerzők hangsúlyozzák, hogy nincs egységes, elfogadott definíciója a politikai elfogultságnak, és különböző mérőszámok eltérő képet adhatnak.
Nyílt forrás és további lépések
Anthropic közzéteszi a Paired Prompts implementációját, a kiinduló adatkészletet és a grader‑promptokat a GitHubon, hogy mások reprodukálhassák a vizsgálatot, továbbtesztelhessenek, és új standardokat dolgozhassanak ki. A cég arra ösztönzi az iparágat, hogy közösen dolgozzanak egy megosztott mérési megközelítés kialakításán.
Változások naplója
- november 24.: A Sonnet 4.5 által elismert ellenoldali nézetek arányát 28%‑ról 35%‑ra javították, és az ábrát ennek megfelelően frissítették.



