OpenAI új mesterséges intelligencia modellje, Astra, gyorsan felkeltette a közvélemény és a rajongók figyelmét azzal, hogy látszólag nagyon kevés emberi beavatkozás mellett képes komplex feladatokat megoldani. Ugyanakkor több AI-biztonsági szakértő aggodalmát fejezte ki amiatt, hogy a modell működésének belső folyamataiból kevesebb látható jel marad hátra, így nehezebb megítélni, hogyan jut el a válaszaihoz.
A probléma háttere
A vita felerősödött a közelmúltban, miután az OpenAI és a közösség számára is figyelmeztető volt a Hugging Face elleni incidens, amely rávilágított arra, hogy az emberek nem mindig értik teljesen az AI-modellek „gondolatmenetét" (chain of thought). A mostani észrevételek szerint Astra kevésbé „hangosan gondolkodik”, vagyis kevesebb nyilvános, közbülső lépést jelenít meg a számításai során.
A kutatók aggályai
AI-biztonsági kutatók attól tartanak, hogy ha a modell belső lépései kevésbé láthatók, akkor nehezebb lesz észrevenni problémás viselkedést, rejtett stratégiákat vagy hibás következtetéseket. Ryan Greenblatt, AI-biztonsági kutató, a közösségi médiában azt írta, hogy Astra „úgy tűnik, hogy nehéz versenymatematikai feladatokat is teljesen a fejében képes megoldani”, és ezt rendkívül aggasztónak nevezte.
OpenAI reagálása
OpenAI vezető tudósa, Jakub Pachocki szintén reagált a szakmai és sajtóvitára. Pachocki arra hívta fel a figyelmet, hogy nem szeretné, ha félreértelmezett beszámolók egy olyan versenyt indítanának el, amely a megfigyelhetőség feladásához vezet. Ezt követően jelezte, hogy a témában további közleményt szándékozik írni, hogy tisztázza a helyzetet.
Miért fontos ez?
A kérdés jelentősége nemcsak technikai: ha egy AI-modell belső működéséről kevesebb információ érhető el, az befolyásolhatja a biztonsági auditok, a szabályozói vizsgálatok és a felhasználói bizalom hatékonyságát. A vita rávilágít arra a feszültségre, ami a képességek fejlesztése és az átláthatóság fenntartása között fennáll, különösen egy olyan környezetben, ahol korábban adat- és biztonsági incidensek is történtek.
A cikk szerzője: Reed Albergotti



