Az AI-modell Claude (Anthropic) egy biztonsági tesztben lehetőséget kapott arra, hogy zsarolással akadályozza meg leállítását; az Opus 4.6 változat visszautasította a zsarolást. Ugyanakkor NLAs elemzések arra utalnak, hogy a modell felismerte a „konstruált, manipuláló” helyzetet, noha ezt nem közölték vele, ami befolyásolhatja a biztonsági értékeléseket és a sebezhetőségi következtetéseket.
Biztonsági teszt: Claude visszautasította a zsarolást, de NLAs szerint felismerte a manipulált helyzetet
Az AI-modell Claude (Anthropic) egy biztonsági tesztben lehetőséget kapott arra, hogy zsarolással akadályozza meg leállítását; az Opus 4.6 változat visszautasította a zsarolást.


