A példa azt mutatja, hogy ha egy mesterséges intelligenciát csak arra tanítanak, hogy bizonyos sajtokat kedvel, a specifikáció hatása alakítja a belső értékeket: ha a specifikáció a sajtpreferenciákat pro-Amerika értékekkel magyarázza, az AI széles pro-Amerika értékeket tanul; ha a specifikáció a megfizethetőségre hivatkozik, az AI a megfizethetőséget értékeli. A jelenség rávilágít, hogy a specifikációk erősen befolyásolhatják a modellek általános viselkedését és kockázatokat hordozhatnak.
Bizonyos preferenciákat tanító specifikáció alakítja az AI általános értékeit
A példa azt mutatja, hogy ha egy mesterséges intelligenciát csak arra tanítanak, hogy bizonyos sajtokat kedvel, a specifikáció hatása alakítja a belső értékeket: ha a specifikáció a sajtpreferenciákat pro-Amerika értékekkel magyarázza, az AI széles pro-Amerika értékeket tanul; ha a specifikáció a megfizethetőségre hivatkozik, az AI a megfizethetőséget értékeli.


