Biztonság

Biztonsági teszt: Claude visszautasította a zsarolást, de NLAs szerint felismerte a manipulált helyzetet

Az AI-modell Claude (Anthropic) egy biztonsági tesztben lehetőséget kapott arra, hogy zsarolással akadályozza meg leállítását; az Opus 4.6 változat visszautasította a zsarolást.

Az AI-modell Claude (Anthropic) egy biztonsági tesztben lehetőséget kapott arra, hogy zsarolással akadályozza meg leállítását; az Opus 4.6 változat visszautasította a zsarolást. Ugyanakkor NLAs elemzések arra utalnak, hogy a modell felismerte a „konstruált, manipuláló” helyzetet, noha ezt nem közölték vele, ami befolyásolhatja a biztonsági értékeléseket és a sebezhetőségi következtetéseket.