Biztonság

Mesterséges intelligenciával generált szöveg

Anthropic leleplezte három labor ipari méretű „distillation” támadását Claude képességeinek kisajtolására

Az Anthropic 2026.

Anthropic leleplezte három labor ipari méretű „distillation” támadását Claude képességeinek kisajtolására

Anthropic 2026. február 23-án közölte, hogy három külső mesterséges intelligencia laboratórium — DeepSeek, Moonshot és MiniMax — ipari méretű, visszaélésszerű kampányokat folytatott Claude képességeinek kisajtolására. A vállalat szerint ezek a laborok körülbelül 24 000 csalárd fiókon keresztül több mint 16 millió párbeszédet generáltak Claude-dal, megsértve az Anthropic szolgáltatási feltételeit és a régiós hozzáférési korlátozásokat.

Mi az a distillation és miért probléma

A „distillation” egy ismert és legális módszer, amelynek során egy gyengébb modell a egy erősebb modell válaszain tanul. Elterjedt például a frontier AI laboroknál, amikor kisebb, olcsóbb verziókat készítenek ügyfeleik számára. Ugyanakkor a technika visszaélésre is alkalmas: versenytársak rövid idő alatt és kevesebb erőforrással szerezhetnek maguknak erőteljes képességeket más modellekből.

Anthropic hangsúlyozza, hogy jogtalanul „distilled” modellekből hiányozhatnak a szükséges védelmi mechanizmusok, ami jelentős nemzetbiztonsági kockázatot teremt. Az ilyen modelleket szervezetek katonai, hírszerzési és megfigyelési rendszerekbe is beépíthetik; ha a kisajolt modelleket nyílt forráskódúvá teszik, a kockázat még szélesebb körben terjed.

Distillation és exportkontrollok

Anthropic álláspontja szerint a distillation-támadások aláássák az exportkontrollok célját, mert lehetővé teszik külföldi laborok számára, köztük olyanok számára is, amelyek a kínai Kommunista Párt ellenőrzése alatt állhatnak, hogy más csatornákon hátrányt csökkentsenek. A vállalat arra hívja fel a figyelmet, hogy az ilyen kampányok végrehajtásához gyakran fejlett chipekhez való hozzáférés is szükséges, amivel megerősítik az exportkontrollok fenntartásának indokát.

Mit találtunk: a három kampány

Anthropic szerint mindhárom kampány hasonló módszertannal dolgozott: csalárd fiókok és proxy szolgáltatások révén nagy mennyiségű lekérést küldtek Claude-hoz, elkerülve a felfedezést. A lekérések mennyisége, struktúrája és a promptok fókusza eltértek a normál használati mintáktól, ami szándékos képességkinyerésre utal.

Az attribúciót IP-címek, kérés metaadatai, infrastruktúra-jelzők és iparági partnerek megerősítése alapján állapították meg.

DeepSeek

  • Méret: több mint 150 000 párbeszéd
  • Célok: általános következtetési képességek; rubrikákon alapuló értékelés (Claude működtetése jutalmazási modellként megerősítéses tanuláshoz); cenzúrabiztos alternatívák létrehozása érzékeny politikai kérdésekre

DeepSeek szinkronizált forgalmat generált fiókok között, azonos mintázatokkal, közös fizetési módokkal és koordinált időzítéssel, ami a „terheléselosztásra” utal, a nagyobb áteresztőképesség és a detektálás elkerülése érdekében. Egy külön technika során a promptok Claude-ot arra kérték, hogy fogalmazza meg a kész választ adó belső érvelést lépésről lépésre, így tömegesen állítva elő chain-of-thought (gondolatlánc) típusú tanítóadatokat. Egyéb esetekben politikailag érzékeny kérdésekre cenzúrabiztos alternatívákat állíttattak elő, valószínűleg DeepSeek saját modelleinek irányításához.

Moonshot AI (Kimi models)

  • Méret: több mint 3,4 millió párbeszéd
  • Célok: agentikus következtetés és eszközhasználat; kódolás és adatelemzés; számítógép-használati agentek fejlesztése; számítógépes látás

Moonshot több száz csalárd fiókot használt több hozzáférési úton, így a kampány koordináltsága nehezebben volt észlelhető. Az attribúciót a kérésmetaadatok és a Moonshot vezető munkatársainak nyilvános profiljai közötti egyezés támogatta. A későbbi fázisban célzottabb módszerrel igyekeztek Claude érvelési nyomait kinyerni és rekonstruálni.

MiniMax

  • Méret: több mint 13 millió párbeszéd
  • Célok: agentikus kódolás; eszközhasználat és szervezés

MiniMax kampányát szintén a kérésmetaadatai és infrastruktúra-jelzők alapján tulajdonították a cégnek; az ütemezést összevetették a MiniMax publikus terméktervével. Anthropic a MiniMax kampányát még aktív állapotban észlelte, mielőtt a MiniMax által kiképzett modell piacra került volna, és azt látták, hogy amikor Anthropic új modellt vezetett be, MiniMax 24 órán belül módosította forgalmát, és forgalmának közel felét az új rendszer képességeinek kinyerésére irányította.

Hogyan férnek hozzá ezek a szereplők a frontier modellekhez?

Anthropic megjegyzi, hogy nem biztosít kereskedelmi hozzáférést Claude-hoz Kínában vagy kínai anyavállalatok külföldi leányvállalatainak nemzetbiztonsági okokból. Ezt megkerülendő a laborok kereskedelmi proxy szolgáltatásokat vesznek igénybe, amelyek nagy mennyiségben továbbértékesítik a hozzáférést Claude-hoz és más frontier modellekhez. Ezek a szolgáltatások úgynevezett „hydra cluster” architektúrákat működtetnek: kiterjedt, csalárd fiókokból álló hálózatokat, amelyek forgalmat osztanak el az API-n és harmadik fél felhőplatformjain.

Egyes proxy-hálózatoknál több mint 20 000 egyidejű csalárd fiókot is azonosítottak, és gyakran összekeverik a distillation forgalmat más, jogos ügyfélkérésekkel a felismerés nehezítése érdekében.

A kampányok alaposan megtervezett promptokat futtatnak nagy mennyiségben, hogy konkrét képességeket nyerjenek ki: vagy közvetlen tanításhoz gyűjtenek magas minőségű válaszokat, vagy megerősítéses tanuláshoz szükséges több tízezer egyedi feladatot generálnak. Az Anthropic szerint a distillation-támadások jellegzetességei a hatalmas mennyiség, a koncentrált célzás és a magas ismétlődési arány.

Anthropic válaszlépései

A cég tájékoztatása szerint több védekezési rétegen dolgoznak, hogy megnehezítsék és megkönnyítsék a distillation-támadások azonosítását:

  • Detekció: több osztályozót és viselkedési ujjlenyomat-elemzést fejlesztettek az API-forgalomban megjelenő distillation-minták felismerésére, beleértve a gondolatlánc-kinyerni kísérletek azonosítását.
  • Információmegosztás: technikai indikátorokat osztanak meg más AI laborokkal, felhőszolgáltatókkal és illetékes hatóságokkal a helyzet átfogóbb feltérképezése érdekében.
  • Hozzáférés-ellenőrzés: szigorították az oktatási fiókok, biztonsági kutatási programok és startupok megerősítését — azokat az utakat, amelyeket leggyakrabban visszaélésszerű fiókok létrehozására használnak.
  • Ellencsapások: termék-, API- és modell-szintű védelmek fejlesztése, amelyek csökkentik az illegális distillation hatékonyságát anélkül, hogy rontanák a jogos felhasználók élményét.

Anthropic hangsúlyozza, hogy egyetlen cég nem tudja egyedül megoldani a problémát: szükséges a gyors, összehangolt iparági válasz a felhőszolgáltatókkal, döntéshozókkal és a nemzetközi AI-közösséggel együtt. Az érintett technikai bizonyítékokat nyilvánosságra hozták, hogy minden érintett hozzáférhessen az információhoz.