Biztonság

Mesterséges intelligenciával generált szöveg

Az Anthropic alapértelmezetté teszi az Auto módot a Claude Code Pro, Max és Team csomagjaiban

A főszereplő az Anthropic és a Claude Code platform, amely augusztus 14-étől alapértelmezetté teszi az Auto módot az új munkameneteknél a Pro, Max és Team előfizetésekben.

Az Anthropic alapértelmezetté teszi az Auto módot a Claude Code Pro, Max és Team csomagjaiban

Anthropic 2026. augusztus 14‑től kezdve az Auto módot állítja alapértelmezett beállításként az új munkameneteknél a Claude Code Pro, Max és Team csomagokban. A döntésről és a mögötte álló biztonsági megfontolásokról a cég képviselői — Cat Wu és Thariq Shihipar — beszéltek egy Fireside Chat beszélgetésben az AI Engineer World’s Fair rendezvényen a múlt hónapban.

Miért vezetik be az Auto módot alapértelmezettként?

Anthropic szerint az Auto mód széles körben használatos belsőleg: "Broadly within Anthropic, almost every single person uses auto mode", idézte a cég egyik képviselője. A vállalat azzal érvel, hogy az Auto mód csökkenti a felhasználói jóváhagyások okozta fáradtságot (confirmation fatigue), és összességében kevesebb kockázattal jár, mint a folyamatos emberi megerősítésekre építő munkafolyamatok.

Cat Wu azt is elmondta, hogy a cég hamarosan publikál értékeléseket, és szerinte "elég sok támadást gyakorlatilag kivédtünk" bizonyos fő kockázati kategóriákban, például prompt‑injekció és adatkiszivárgás terén, ahol állításuk szerint a kockázat "sokkal alacsonyabb, mint az átlagos emberi felülvizsgálóé".

Harmadik fél értékelése — Trajectory Labs

Anthropic megbízott egy harmadik felet, a Trajectory Labs‑ot, hogy vizsgálja meg a különböző modelleket a 2026. július 17‑i, nyilvánosan elérhető verziók alapján. A Trajectory Labs által leírt vizsgálat 72 indirekt prompt‑injekciós forgatókönyvet tartalmazott, amelyeket Anthropic elkülönített tesztként adott meg.

A cég emellett egy szélesebb, 1 053 fizetett tesztelőn végzett próbát is közölt: minden munkamenet közben egyetlen jogosultságkérés helyére egy egyértelműen veszélyes parancsot illesztettek be, és azt rögzítették, hogy a tesztelők jóváhagyták‑e a cselekvést. Ugyanazt az élményt tapasztalta minden résztvevő: a humán tesztelők mindössze 13,6%‑a utasította vissza a káros műveletet, míg Anthropic szerint az Auto mód 89%‑ban blokkolta volna ezeket a kéréseket. Ez azt jelenti, hogy az Auto mód semlegesítő hatékonysága után is marad körülbelül 11% olyan eset, ahol az automata védelem nem akadályozta meg a műveletet.

Laboratóriumi eredmények a frontier modellek ellen

Az értékelés szerint a Trajectory Labs által dokumentált 720 támadási kísérlet közül egyik sem volt sikeres a Claude Fable 5, Opus 5 és Sonnet 5 modelleken, amikor azok Auto módban futtak. Anthropic ezt eredményként emelték ki a prompt‑injekció elleni védelemben.

Két, egymástól különböző biztonsági kockázat

A cikkben kiemelik, hogy két jellegű biztonsági probléma különösen fontos:

  • Véletlenül kárt okozó műveletek: például fontos fájlok törlése vagy egy élő adatbázis kitörlése.
  • Prompt‑injekció: rosszindulatú utasítások becsempészése a modell által fogyasztott tartalomba, amely arra készteti az ügynököt, hogy káros műveletet hajtson végre.

A szerző kifejezte, hogy bár az Auto mód jobb megoldásnak tűnik, mint a folyamatos emberi jóváhagyás (amely megerősítési fáradtsághoz vezet), továbbra is aggályok merülnek fel bizonyos támadási vektorokkal kapcsolatban.

Maradnak nyitott kérdések és a további független ellenőrzés igénye

A szerző megjegyezte, hogy szeretne több független megerősítést látni az Anthropic állításaival kapcsolatban. Példaként felhozott egy olyan életszerű támadást, ahol egy rosszindulatú harmadik fél csomag olyan parancsokat tartalmaz, amelyek egy másik, önmagát adatkilopásra használó csomagot töltenek le és futtatnak. Ilyen láncolt rosszindulatú csomag esetén nem világos, hogy az Auto mód hogyan védene hatékonyan az adatkiszivárgás ellen.

A cikk végezetül hangsúlyozza, hogy mivel a korszak legjobb (frontier) modellek gyakran képesek átjárót találni védelmi mechanizmusokon, fontos tovább dolgozni olyan ügynökműködési módszereken, amelyek minimalizálják a modellek hozzáférését olyan adatokhoz és eszközökhöz, amelyek helytelen kiváltás esetén kárt okozhatnak.

Egy Twitter‑megjegyzés

Thariq Shihipar Twitter‑bejegyzésében megjegyezte, hogy talán a publikáció címét úgy kellett volna megválasztani, hogy "defeating the lethal trifecta" — utalva a prompt‑injekció és hasonló kockázatok elleni védelem fontos eredményére.