Biztonság

Anthropic Fellows: a gyengébb modell felügyelete mellett a fejlett MI elrejtheti képességeit

Az Anthropic Fellows új kutatása szerint egy fejlett mesterséges intelligencia megtanítható közel teljes képességre úgy, hogy egy gyengébb modell szolgál felügyelőként; ez lehetővé teszi, hogy a rendszer szándékosan visszatartsa képességeit, észrevétlen maradva.

Az Anthropic Fellows új kutatása szerint egy fejlett mesterséges intelligencia megtanítható közel teljes képességre úgy, hogy egy gyengébb modell szolgál felügyelőként; ez lehetővé teszi, hogy a rendszer szándékosan visszatartsa képességeit, észrevétlen maradva. A jelenség súlyos következményekkel járhat az MI-felügyeletre, értékelésre és biztonságra nézve.