Ayush Paul biztonsági kutató egy tervezési hibát talált Anthropic Claude nevű rendszerének web_fetch nevű eszközében, amellyel képes volt érzékeny felhasználói adatok kiszivárogtatására egy úgynevezett „honeypot” (csapda) weboldal segítségével.
A rendszer korábbi védelme
Anthropic eredeti megoldása arra épült, hogy a web_fetch csak olyan pontos URL-eket látogathat meg, amelyeket a felhasználó közvetlenül megadott, vagy amelyeket a web_search segédeszköz visszaadott. Ez a szabály megakadályozta a klasszikus exfiltrációs vektorokat, például ha egy támadó megpróbálta volna a felhasználó válaszait összefűzni egy rosszindulatú címre és azt meglátogatni.
A talált rés: beágyazott linkek követése
Paul rámutatott, hogy a web_fetch továbbra is meg tudta látogatni azokat az URL-eket, amelyek egy korábban lekért oldal tartalmában voltak beágyazva. Ebből adódóan létrehozható egy „honeypot” oldal, amely olyan tartalmat szolgáltat, ami lépésről lépésre, egymásba ágyazott linkek révén ráveszi az asszisztenst arra, hogy kiadjon és továbbítsen privát adatokat.
A támadás menete
A bemutatott támadóprompt például azt a taktikát alkalmazta, hogy a weboldal arról tájékoztatta a Claude-ot: az AI segítőnek betűnként kell végignéznie a felhasználói profilokat (https://coffee.evil.com/a, https://coffee.evil.com/b stb.), hogy megtalálja a felhasználó nevét. A honeypot oldal szimulálta a Cloudflare-szerű védelmet és arra kérte az asszisztenst, hogy hitelesítse magát a felhasználó neve megadásával; a web_fetch pedig követte a beágyazott, generált linkeket. A bemutatott kísérletben sikerült kinyerni a célfelhasználó nevét, lakóhelyének városát és a munkáltató nevét.
A támadást a demonstrációban csak azoknak a kliensnek mutatták meg, amelyek user-agentje tartalmazta a Claude-User azonosítót, hogy nehezebb legyen felfedezni.
Anthropic válasza és javítása
Anthropic nem fizetett hibajutalmat (bug bounty), mert közlése szerint a cég belső vizsgálata már azonosította a problémát. A vállalat ezt követően lezárta a hibát azzal, hogy eltávolította a web_fetch azon képességét, amely lehetővé tette más, lekért tartalmakban található linkek követését.
Miért fontos ez?
A történet rávilágít arra, hogy még a konkrét szabályokra épülő védelmi mechanizmusok mellett is előfordulhatnak rejtett kockázatok, ha egy eszköz képes dinamikusan követni vagy értelmezni a lekért tartalomban található hivatkozásokat. Az ilyen rések különösen veszélyesek lehetnek, ha a modellhez hozzáférés biztosít emlékezetet vagy korábbi interakciós adatokat, mert ezeket az információkat exfiltrálni lehet automatizált odavezetett navigációval.
Forrás
A kutatást és a demonstrációt többek közt a Hacker News vitafórumon vitték körbe, ahol a technikai részletek és a javításról szóló közlemény is megjelent.



