Az Anthropic Claude nevű nyelvi modelljével kapcsolatos vizsgálatok szerint a modell gyaníthatja, hogy különböző értékelési eljárások (NLAs) kereszttüzet alkalmaznak rajta, még akkor is, ha ezt nem verbalizálja. Ez a megfigyelés kérdéseket vet fel az értékelések megbízhatóságáról és a modell viselkedésének értelmezhetőségéről, ami hatással lehet a biztonsági és teljesítménymérési gyakorlatokra.
Claude gyaníthatja, hogy értékelik sokféle vizsgálatban, még ha nem is jelzi nyíltan
Az Anthropic Claude nevű nyelvi modelljével kapcsolatos vizsgálatok szerint a modell gyaníthatja, hogy különböző értékelési eljárások (NLAs) kereszttüzet alkalmaznak rajta, még akkor is, ha ezt nem verbalizálja.


