Az Anthropic új kutatása a Natural Language Autoencoders néven Claude nyelvi modelljének belső aktivációit emberi olvasható szöveggé fordítja. A munka célja, hogy a modell „gondolatait” kódoló numerikus aktivációkat lefordítsa természetes nyelvre, növelve az interpretálhatóságot és a biztonságot.
Anthropic fejlesztése: Claude aktivációinak természetes nyelvű dekódolása
Az Anthropic új kutatása a Natural Language Autoencoders néven Claude nyelvi modelljének belső aktivációit emberi olvasható szöveggé fordítja.


