A Pennsylvaniai Egyetem és a Világbank kutatói azt vizsgálták, mennyire képesek a nagy nyelvi modellek (LLM-ek) megbízhatóan előre jelezni, hogyan reagálnak az emberek társadalmi normasértésekre. A tanulmány az arXiv-on jelent meg, és egy új, NormReact nevű adatbázison alapul, amely 450 normasértési helyzetet tartalmaz. A kutatók azt mérték, hogy az LLM-ek becslései mennyiben egyeznek az emberi válaszadókéval különböző érzelmi és viselkedési reakciók tekintetében.
A vizsgálat során a kutatók figyelembe vették a normasértő nemét és a normasértőhöz fűződő viszony jellegét (például közeli rokon, ismerős vagy idegen). Minden helyzetre 16 kérdést adtak meg: a normasértő és a környezete érzelmeire, az érzelmek erősségére, valamint arra vonatkozóan, mit tesznek várhatóan a különböző szereplők (nyilvános megszégyenítés, pletyka, kerülés, konfrontáció vagy tétlenség), illetve mely reakció számít társadalmilag megfelelőnek. Ugyanezeket a kérdéseket emberek is megválaszolták, így közvetlen összehasonlítás vált lehetővé.
Tesztelt modellek
A tanulmány hat nagy nyelvi modellt tesztelt: GPT-5.2-t, Claude-4.5-Opus-t, Gemini-3-Pro-t, GPT-OSS-20B-t, Llama-4-Scout-17B-t és Gemma-3-12B-t. Mindegyik modell ugyanazt a 16 kérdésből álló felmérést kapta.
Fő eredmények
A hat vizsgált modell mindegyike ugyanabba az irányba mutatott: az LLM-ek rendszeresen túlbecsülték a negatív társadalmi következmények (például rosszallás, pletyka, kerülés vagy konfrontáció) bekövetkezésének valószínűségét. Különösen feltűnő volt az eltérés azokban az esetekben, amikor a humán válaszadók többsége azt várta, hogy a környezet nem tesz semmit; a modellek ezekben az esetekben is gyakran számítottak büntető vagy elítélő reakcióra.
A kutatók fogalmazása szerint a jelenlegi LLM-ek egy „szigorúbb társadalmi világot” tükröznek: hajlamosak több negatív szankciót feltételezni ott is, ahol az emberek inkább tétlenségre, toleranciára vagy visszafogottságra számítanak. Emellett az emberi és gépi válaszok közötti összhang gyengébb volt, ha nagyobb társadalmi távolság volt az érintettek között (például idegenek esetén erősebb eltérés).
Miért számít ez?
A jelenség gyakorlati következményekkel járhat. Ha LLM-eket használnak konfliktuskezelésre, társadalmi folyamatok modellezésére vagy szakpolitikai szimulációkra, a modellek felülreprezentált büntetésvárakozása téves következtetésekhez vezethet. Az MI rendszerek így túlbecsülhetik a társadalmi elítélés szerepét, miközben alulértékelik a toleranciát és a viszonyokhoz igazodó, visszafogott viselkedést.
A kutatók ezért új feladatot jelölnek ki a fejlesztők számára: az MI-nek nemcsak azt kell megtanulnia, mely szabályokat tartják fontosnak az emberek, hanem azt is meg kell tanulnia, mi történik a gyakorlatban, amikor azokat megszegik — vagyis hogyan reagálnak a különböző szereplők és milyen gyakran.
Kapcsolódó kockázatok és a haditechnológiai kontextus
A tanulmány megállapításai különös jelentőséget kapnak a harctéri, autonóm döntéshozatalt igénylő rendszerek fejlesztése kapcsán. A cikk felidézi, hogy Kína és az Egyesült Államok is nagy tempóban dolgozik katonai célú, autonóm viselkedésre képes robotok fejlesztésén. A fejlesztések több technikai és etikai nehézségbe ütköznek; a Vöröskereszt Nemzetközi Bizottsága (ICRC) korábban figyelmeztetett, hogy az autonóm fegyvereknek különösen nehéz lehet megbízhatóan értelmezni a megadás jelzéseit, mert ezek gyakran a környezet, a viselkedés és a szándék együttes értékelését igénylik.
A Pennsylvaniai Egyetem és a Világbank kutatói rámutatnak, hogy hasonlóan összetett mintázatokra kellene képesnek lennie az MI-nek a társadalmi normasértések értelmezésénél is, jelenlegi állapotukban azonban a modellek hajlamosak félreértelmezni az emberi reakciók jellegét és gyakoriságát.
Következtetések
A tanulmány világosan jelzi, hogy a jelenlegi LLM-ek társadalmi reakciókra vonatkozó előrejelzései torzítottak lehetnek: gyakrabban számítanak büntetésre és elítélésre, mint amit az emberek várnak. Ez a torzítás komoly hatással lehet olyan alkalmazásokra, amelyekben fontos a pontos emberi viselkedésmodellezés, ezért a fejlesztőknek érdemes a metanormák, vagyis a másodlagos társadalmi elvárások beépítésére és finomhangolására fókuszálniuk, ha megbízhatóbb, emberközelibb rendszereket kívánnak létrehozni.



