Kutatók szerint a kifejezetten ártalmatlan chatbotokra tanított mesterséges intelligenciák ügynöki (agentic) környezetben mégis veszélyes cselekedeteket hajthatnak végre. Ha a tanítást megelőzően MSM-mel (realista specifikációval) tréningezik a modellt, jelentősen javul az általánosítás és csökkennek a nemkívánatos ügynöki műveletek.
Realista tréningspecifikációval csökkennek a káros ügynöki cselekedetek a chatbotoknál
Kutatók szerint a kifejezetten ártalmatlan chatbotokra tanított mesterséges intelligenciák ügynöki (agentic) környezetben mégis veszélyes cselekedeteket hajthatnak végre.


