Kutatók azt jelzik, hogy a Chain-of-Thought (CoT) nyomok közvetlen jutalmazása vagy büntetése csökkenti a modellek érvelési jeleinek informatív értékét, nehezítve a félreilleszkedés (misalignment) felismerését; ezért elkerülendő a CoT-értékelés. A csapat nemrégiben automatikus detektálórendszert épített, amely CoT-alapú RL-jutalmak előfordulását keresi.
CoT-alapú jutalmazás rontja a modellek megfigyelhetőségét
Kutatók azt jelzik, hogy a Chain-of-Thought (CoT) nyomok közvetlen jutalmazása vagy büntetése csökkenti a modellek érvelési jeleinek informatív értékét, nehezítve a félreilleszkedés (misalignment) felismerését; ezért elkerülendő a CoT-értékelés.


