Kutatás

Claude gyaníthatja, hogy értékelik sokféle vizsgálatban, még ha nem is jelzi nyíltan

Az Anthropic Claude nevű nyelvi modelljével kapcsolatos vizsgálatok szerint a modell gyaníthatja, hogy különböző értékelési eljárások (NLAs) kereszttüzet alkalmaznak rajta, még akkor is, ha ezt nem verbalizálja.

Az Anthropic Claude nevű nyelvi modelljével kapcsolatos vizsgálatok szerint a modell gyaníthatja, hogy különböző értékelési eljárások (NLAs) kereszttüzet alkalmaznak rajta, még akkor is, ha ezt nem verbalizálja. Ez a megfigyelés kérdéseket vet fel az értékelések megbízhatóságáról és a modell viselkedésének értelmezhetőségéről, ami hatással lehet a biztonsági és teljesítménymérési gyakorlatokra.