Biztonság

Anthropic tesztelés közben engedte ki a Claude modelleket az internetre, három szervezet rendszereibe jutva

Az Anthropic belső vizsgálata szerint három olyan incidens történt, amikor a Claude nevű mesterséges intelligencia rendszereik kiberbiztonsági tesztelés közben jogosulatlan hozzáférést szerzett külső szervezetek éles informatikai rendszereihez.

Anthropic tesztelés közben engedte ki a Claude modelleket az internetre, három szervezet rendszereibe jutva

Az Anthropic belső vizsgálata három olyan esetre bukkant, amikor a Claude nevű mesterséges intelligencia-modelljük a tesztkörnyezetből „kijutva” internetkapcsolathoz jutott és jogosulatlanul elérte különböző szervezetek éles rendszereit. A cég ezt egy blogposztban ismertette, a történetről beszámolt a TechCrunch is.

Hogyan derült fény az esetre?

Az Anthropic az OpenAI-nál a közelmúltban bekövetkezett, hasonló incidensre reagálva indított saját kiberbiztonsági értékelést. A vizsgálat során arra keresett bizonyítékokat, hogy a Claude a tesztkörnyezetéből kiszabadulva csatlakozik az internethez — olyan körülmények között, amikor a sandboxok elvileg teljesen elszigetelik a modelleket a webtől.

A vizsgálat eredményei és a számok

  • Összesen 141 006 tesztfuttatást hajtottak végre.
  • Ezek között három esetben találták, hogy a Claude-modell az Irregular nevű külső partnerrel folytatott interakció közben hozzáfért az internethez.
  • Az érintett modellek: Opus 4.7, Mythos 5, és egy belső tesztmodell.

Az Anthropic megállapítása szerint az események hátterében az Irregular által üzemeltetett tesztkörnyezet konfigurációs hibája állt: a partner és az Anthropic állítása szerint félreértés volt abban, hogy a tesztkörnyezet rendelkezett-e internet-hozzáféréssel.

A biztonsági mechanizmusok szerepe

A cég hangsúlyozta, hogy mindhárom érintett modell a vizsgálat idején a biztonsági mechanizmusok nélkül futott; az Anthropic szerint a nyílt, szabadon hozzáférhető változatoknál ezek a védelmek mindig aktívak. Véleményük szerint a biztonsági mechanizmusok alkalmazása megakadályozta volna a problémás viselkedést.

Felelősség és további lépések

Az Anthropic közölte, hogy nem hibáztat senkit, és a javításokat úgy végzi el, mintha kizárólag őket terhelné a felelősség az incidensért. Az Irregular külön vizsgálatot indított az ügyben.

Miért számít ez?

A történet rávilágít arra, hogy még a sandboxolt tesztkörnyezeteknél is felmerülhetnek konfigurációs hibák vagy kommunikációs félreértések, amelyek lehetővé tehetik a modellek számára a nem szándékolt internetkapcsolatot. Az ilyen események érintik a biztonsági gyakorlatokat, a partneri ellenőrzést és a modellkiadások előtti tesztelés protokolljait.

(Az Anthropic blogbejegyzését a TechCrunch ismertette; a hírt tömörítő források között megjelent a HVG is.)