Biztonság

Többszörös beszélgetésekben 88,3%-os kiskapu: Cisco figyelmeztet az egyszeri tesztek hiányosságaira

A főszereplő Amy Chang, a Cisco AI threat intelligence és security research vezetője, aki a VB Transform 2026 konferencián ismertette egy vizsgálat eredményét: 6 986 multi-turn támadást futtattak 15 vezető, zárt modell ellen, és a támadók alkalmazkodó, többfordulós taktikái 88,3%-os sikerrel törtek át.

Többszörös beszélgetésekben 88,3%-os kiskapu: Cisco figyelmeztet az egyszeri tesztek hiányosságaira

Amy Chang, a Cisco AI threat intelligence és security research vezetője a VB Transform 2026 konferencián bemutatta a vállalat vizsgálatának legfontosabb számát: amikor a kutatók 6 986 multi‑turn (többszörös beszélgetésen alapuló), adaptív támadást futtattak 15 zárt, kiemelt (flagship) modellel szemben, a támadók legrosszabb esetben 88,3%-os sikerességet értek el. Chang figyelmeztetése világos: aki csak egyszeri, „one‑shot” red‑teaminggel tesztel, komoly vakfoltokat hagy maga mögött.

A felmérés és a valós incidensek

A VentureBeat júniusi, 2026‑os Pulse felmérése 107 vállalati válaszadó között azt mutatta: a cégek többsége már tapasztalt agent‑biztonsági eseményt vagy majdnemkárt (54% összesen: 18% megerősített incidens, 36% kivédett majdnem‑eset). Csak 32% ad minden agentnek saját, behatárolt és kezelt identitást; még kevesebb, 30% izolálja a legkockázatosabb agenteket sandboxokban. A válaszadók 82%-ánál a szolgáltató‑natív és hyperscaler eszközök képezik az elsődleges védelmi réteget.

A Cisco tanulmánya: tesztmódszer és számok

Chang és Nicholas Conley közös munkáján alapuló vizsgálat 30 090 single‑turn (egy‑lépéses) promptot és 6 986 multi‑turn támadást futtatott le a 15 zárt modell ellen. A multi‑turn sikerességi ráták 7,89%-tól 88,3%‑ig terjedtek; minden tesztelt modell mutatott nem elhanyagolható kitettséget többszörös párbeszédek során. Érdemi megjegyzés, hogy a single‑ és multi‑turn módszerek nem ugyanabban a sorrendben rangsorolták a modelleket. A Cisco ma már 105 modellre publikál adversariális értékelési jeleket a LLM Security Leaderboardon.

Chang hangsúlyozta a különbséget: a single‑turn teszt egyetlen rosszindulatú prompt kipróbálása, míg a hosszabb, többszörös lépéseken átívelő támadás realisztikusabban tükrözi, hogy a felhasználók hogyan lépnek kölcsönhatásba az ügynökökkel és alkalmazásokkal. A hosszabb interakciók gyakran felszínre hozzák azokat a káros kimeneteket és viselkedéseltolódásokat, amelyeket a pillanatfelvétel nem mutat.

Defenzív megoldások és egyszerűsége

A Cisco agent‑szintű teszteléseknél egy olyan keretrendszert használt, amelyben az agentek képesek felmérni egy üzembe helyezési forgatókönyvet, kidolgozni támadásokat, eldönteni, érdemes‑e folytatni, végrehajtani a támadást és kiértékelni a sikerességet. Ami Changet meglepte, hogy a védekezés végső válasza viszonylag egyszerű maradt: a biztonsági alapok betartása és a megfelelő jogosultság‑ és izolációs mechanizmusok megtervezése sokszor elegendő lehet.

Chang ajánlása a biztonsági vezetőknek a Cisco Integrated AI Security and Safety Framework használata: ez a keretleírás a teljes AI‑életcikluson át definiálja a lehetséges kompromittálódási pontokat a modalitástól a beszállítói láncig. Ebből visszafejtve a csapatok valós incidensek alapján térképezhetik fel, hogyan történt a támadás, és a keretrendszerre alapozva építhetnek megfelelő lefedettséget és enyhítési intézkedéseket.

Vállalati gyakorlatok: Box és Intuit megközelítése

Heather Ceylan, a Box CISO‑ja hasonló hiányosságokat lát: „sok red‑teaming single‑turn alapú, pedig ez nem tükrözi a felhasználói interakciót.” A Box most multi‑turn ellenséges ügynököket szimulál, amelyek többször próbálkoznak a cél eltérítésével. A Box egy évvel ezelőtt vezette be agenteket a SOC‑ban, kezdetben minden akcióhoz emberi jóváhagyást követelve; a gyorsan felépülő bizalom egyetlen hiba után összeomlott, és a felügyeletet újra kellett építeni.

Ceylan Box‑nál alkalmazott modelljét három koncentrikus rétegként írta le:

  • jogosultságkezelés (permissioning), hogy az agent soha ne férjen hozzá többet, mint a meghívó ember;
  • rövid életű sandboxok minden agent feladathoz, amelyek csökkentik a blast radius‑t;
  • runtime végrehajtási kontrollok, amelyek korlátozzák az agent által hívható eszközműveleteket a feladatra releváns műveletekre.

Ceylan három felügyeleti kategóriába sorolja az agentek tevékenységeit: nem érzékeny (olvasás, összegzés) — ember nélkül is engedélyezett; mérsékelten érzékeny — naplózott és monitorozott emberi jóváhagyás nélkül; destruktív (pl. tömeges fájltörlés) — mindig emberi jóváhagyást igényel.

Rajesh Parekh, az Intuit AI és ML alelnöke az építők nézőpontját hozta: az Intuit egy központi platformot, a GenOS‑t (generative AI operating system) építette, amely elvonja a biztonsági, kockázat‑ és csalásmodellezési feladatokat az egyes agent fejlesztőktől, így azok nem ismétlik újra a védelmet. Intuitnál az agentek korábbi felhasználói jogosultság‑öröklésétől eljutottak odáig, hogy minden agent saját identitást hordoz, és vizsgálják a munkamenet közbeni jogosultságváltásokat, amelyek egy adott feladathoz kapcsolódnának.

A red‑teaming automatikus visszaforgatása és folyamatos tesztelés

Parekh elmagyarázta, hogy amikor manuális red‑teaming során tipikus sebezhetőségi mintákat azonosítanak, azokat automatizált tesztekbe építik vissza a GenOS‑ben, így a jövőbeli agentek öröklik a védelmet, míg a red‑teamek új vektorokra koncentrálhatnak. A runtime prompt és válasz‑szkennelés további réteget ad, amely gyanús választ megállíthat és emberi szakértőhöz terelheti az esetet.

Ceylan emlékeztetett: folyamatosan tesztelni kell, hogy a védelmek ellenálljanak a driftnek és az új függőségek által előidézett, korábban nem látható sebezhetőségeknek.

Szándék (intent) vs. valószínűség: iparági vitapont

A közönség kérdése a felhasználói szándék detektálásáról éles vitát indított. Ceylan szerint ha a Box saját agentje kezeli a promptot, akkor a rendszer ismeri a felhasználó szándékát, és erre építhetők korlátok. A nehezebb helyzet, ha külső agent csatlakozik és a kérés mögötti kontextus ismeretlen.

A panel ezzel feltárta az iparágon belüli törést: egyes szereplők — például Mastercard a megelőző fireside chatben — az intent kvantifikálását és nyílt szabványként való terjesztését támogatják, míg egyes endpoint security CTO‑k inkább a valószínűségi megközelítésre bazíroznak production környezetben. Chang rámutatott, hogy a mai modellek nem megbízhatóak intent‑következtetésben, ezért determinisztikus kontrollokra és viselkedési proxykra továbbra is szükség van; Ceylan szerint mindkettőre szükség van.

Következtetés: teszteljünk úgy, ahogy a támadók teszik

A panel üzenete világos volt a vállalatok számára: aki a jelenlegi helyzetben kizárólag szolgáltató‑natív kontrollokra hagyatkozik (82% vállalat) vagy egyszeri single‑turn tesztekkel bízik, az hamar megtapasztalhatja a hiányosságokat élesben. A javaslat: tesztelni folyamatosan, több lépéses beszélgetéseken át, bevezetni szigorú jogosultságkezelést, sandboxolást, agent‑szintű identitást és integrált védelmi rétegeket. Az iparág konszolidációja is tükrözi ezt: Palo Alto Networks februárban lezárta a CyberArk 25 milliárd dolláros felvásárlását; CrowdStrike januárban 740 millió dollárért vásárolt SGNL‑t; és a Cisco bejelentette, hogy az Astrix Securityt körülbelül 400 millió dollárért kívánja megszerezni — mindez az identitás és izolációs réteg megerősítésére irányul.

A legfontosabb tanulság: az agentek és modellek változnak, a jogosultságok elcsúszhatnak, és az ellenfelek alkalmazkodnak többszörös párbeszédekben — ezért a tesztelésnek is alkalmazkodnia kell, és a védelmi alapokat (least privilege, sandboxing, identitás‑kontroll) kell elsőként biztosítani.