Kutatás

Anthropic fejlesztése: Claude aktivációinak természetes nyelvű dekódolása

Az Anthropic új kutatása a Natural Language Autoencoders néven Claude nyelvi modelljének belső aktivációit emberi olvasható szöveggé fordítja.

Az Anthropic új kutatása a Natural Language Autoencoders néven Claude nyelvi modelljének belső aktivációit emberi olvasható szöveggé fordítja. A munka célja, hogy a modell „gondolatait” kódoló numerikus aktivációkat lefordítsa természetes nyelvre, növelve az interpretálhatóságot és a biztonságot.