Biztonság

OpenAI: véletlen Chain of Thought-értékelések előfordulása kiképzés során, monitorozás nem sérült

Az OpenAI nemrég egy rendszert épített, amely átvizsgálja az összes megerősítéses tanulás (RL) futamot, és ilyen ellenőrzés közben találtak néhány véletlen Chain of Thought (CoT) értékelést korábban telepített modellek kiképzése során.

Az OpenAI nemrég egy rendszert épített, amely átvizsgálja az összes megerősítéses tanulás (RL) futamot, és ilyen ellenőrzés közben találtak néhány véletlen Chain of Thought (CoT) értékelést korábban telepített modellek kiképzése során. A vállalat szerint nincs egyértelmű bizonyíték arra, hogy ezek rontották volna a CoT monitorozhatóságát, így a modellfelügyelet és biztonság várhatóan nem sérült.