A mesterséges intelligencia gyorsítja a kiberbiztonsági munkafolyamatokat: az agentikus rendszerek képesek komplex célokat hosszú távon koordinálni és végrehajtani. Biztonsági csapatok már alkalmaznak ügynököket a műveletekben, ám sok megoldás továbbra is meglévő riasztásokra, előre definiált munkafolyamatokra és ismert támadási mintákra épül. A nehezebb feladat azonosítani a védelmi réseket és ezeket megbízható lefedettséggé alakítani — amire ismételt, adaptív támadástesztek és a jelölt detekciók normál vállalati tevékenységgel szembeni validálása szükséges.
NVIDIA és CrowdStrike egy agentikus támadó–védő rendszert értékelt izolált környezetben, amely az NVIDIA gyorsított számítási infrastruktúráját modellezte. A védelmi oldalon NVIDIA Nemotron modellek futottak a CrowdStrike SafeMind agentikus kiberbiztonsági rendszerében. CrowdStrike belső értékelése szerint a Blue Solano védelmi modell 13%‑kal pontatlanabbnak bizonyult a tesztelt vezető proprietáris frontier modellnél, miközben 97%‑kal alacsonyabb költséggel üzemelt — a közölt eredmények szerint az optimalizált, nyílt modellkonfigurációban a Nemotron 3 Ultra szolgált az orchestrációhoz, míg a finomhangolt Nemotron 3 Super a detekcióíráshoz.
A következőkben összefoglaljuk, hogyan működött együtt a Nemotron és a CrowdStrike agentharness, hogyan építették fel és értékelték a rendszert, és hogyan teljesítettek a kapott detekciók függetlenül indított támadásfutásokon.
A folyamatos támadó–védő ciklus logikája
A hagyományos red‑blue gyakorlatok kézi átadásokra épülnek: a vörös csapat végrehajtja a támadást, a kék csapat elemzi a telemetriát, a detekciós mérnökök írják vagy frissítik a szabályokat, majd a vörös csapat újratesztel. Ez lassítja az iterációkat és korlátozza a tesztelt variánsok számát. Egy agentikus támadó–védő rendszer ezeket a lépéseket zárt, ismételhető hurkúvá köti össze, amely gépi sebességgel működhet.
A vizsgált munkafolyamat négy összekapcsolt szakaszból állt:
- Végrehajtás és rögzítés: egy fenyegetés‑tudatos cél alapján a vörös ügynökharness kiválasztotta és lefuttatta a támadási útvonalat az izolált környezetben; a lépések akciónyomot hagytak, és a CrowdStrike Falcon végpont‑szenzorai rögzítették a telemetriát.
- Feldolgozás és rekonstruálás: a kék ügynökharness megkapta az akciónyomot, telemetriát és szélesebb kontextust, majd meghatározta, mi rekonstruálható, mely meglévő detekciók váltak aktívvá, és hol maradtak láthatósági vagy detektálási hiányok.
- Generálás és validálás: a kék harness jelölt detekciókat állított elő; a validációs komponens visszatesztelte ezeket a rögzített telemetrián, hibák esetén visszaküldte javításra, és a validált detekciókat a motor számára átadta.
- Újratesztelés, adaptáció és ismétlés: a validált detekció telepítése után egy függetlenül seedelt támadás újratesztelte ugyanazt a célt; a kapott eredmények a vörös harnesshez visszakerültek, amely adaptálta a támadást, amíg nem talált további életképes útvonalat a modellezett környezeten belül.
Minden ciklus célja erősíteni a védelmi lefedettséget és kényszeríteni a támadót egy nehezebb út megtalálására. A hurkot addig futtatták, amíg a modellkörnyezeten belül nem maradt életképes alternatíva.
Reprezentatív tesztkörnyezet létrehozása
A biztonságos, valóságszerű tesztelés érdekében az NVIDIA egy megtisztított, természetes nyelvű specifikációt biztosított, amely az ő gyorsított számítási infrastruktúráját reprezentálta. Egy agent‑asszisztált munkafolyamat ezt lefordította egy izolált célkörnyezetté, amelyet Falcon platform szenzorokkal instrumentáltak.
A tesztelés a támadási útvonalak és megfigyelhető mérföldkövek alapján mérte az előrehaladást: az akciónyomok és a szenzortelemetria szolgáltatta a mérőszámokat, nem az agent állításai. NVIDIA és CrowdStrike szakértők felülvizsgálták a környezetet és a fenyegetési útvonalakat a realizmus érdekében; ugyanazt a, felülvizsgált környezetet használták minden futtatásban, ami lehetővé tette az összehasonlítható méréseket.
A védelmi harness specializálása
A támadásnyomokból és telemetriából működő detekciók létrehozása és validálása műszaki és viselkedési szempontból kihívás volt. A védelmi harness hat mechanizmust kombinált:
- Sématudás alap: egy eszköz felsorolta a támogatott Falcon szenzorsémákat, mezőket és lekérdezési szintaxist, megakadályozva a kitalált mezőket és érvénytelen lekérdezéseket.
- Telemetriai groundning: a vörös ügynök nyomain, a Falcon telemetrián és a támadási kontextuson alapult a munkafolyamat, így csökkent a kitalált összefüggések aránya.
- Specializált detekcióírás: egy testreszabott Nemotron 3 Super egy behatárolt szakértőként állt a detekciók írására és javítására, elkülönítve ezt a feladatot az általános orchestrációtól.
- Artefakt linting: automatizált ellenőrzések elutasították a szintaktikai hibákat, nem támogatott mezőket és az olyan detekciókat, amelyek egyedi IP‑címekre, gépekre vagy felhasználókra hivatkoztak; hibák esetén útmutatást adtak a viselkedésalapú jelzésekre való átíráshoz.
- Detekció visszajátszás: minden jelöltet visszajátszottak a rögzített telemetrián; amelyekre nem volt találat, visszaküldték javításra.
- Független felülvizsgálat: egy külön bíró friss kontextussal értékelte a detekciók viselkedési illeszkedését, robosztusságát és a több jel használatát.
A sikertelen ellenőrzések strukturált visszajelzést adtak a kék ügynöknek javításra. E mechanizmusok a hagyományosan kézi detekciós mérnöki gyakorlatokat kódolták, így a generált detekciók tesztelhetők és javíthatók lettek.
Nemotron szerepe: orchestration és specializált írás
A Nemotron nyílt modellek utólagosan betaníthatók doménadatokkal, és zárt környezetben proprietáris kontextussal telepíthetők. Az értékelt konfigurációban a Nemotron 3 Ultra rekonstruálta a támadási sorrendeket, tervezte a detekciós lépéseket és meghívta az eszközöket; ha detekcióírásra volt szükség, a finomhangolt Nemotron 3 Super szolgált bounded szakértőként.
CrowdStrike a Nemotron 3 Super alapú NL2LogScale modellt folyamatos előképzéssel, felügyelt finomhangolással és megerősítéstanítással (reinforcement learning) optimalizálta. A finomhangolás 9 349 detekciógenerálási és többlépcsős javítási példát használt, amelyek 59 programozott hibatípust fedtek le. A tanítóadatok a Nemotron 3 Super átfogalmazásait, valós Falcon LogScale futtatási hibákat és minőségellenőrzött következtetési nyomokat kombinálták.
A megerősítéses tanulási munkafolyamat során az NVIDIA NeMo Gym validálta és futtatta a generált lekérdezéseket a Falcon LogScale‑ben: érvénytelen lekérdezések valós motorhibát adtak és legfeljebb öt javítási kísérletet kaptak; megoldatlan kísérletek nulla jutalmat eredményeztek. A valid lekérdezések ugyanazon szintetikus logokon futtak, és a referencia illetve a generált lekérdezések által visszaadott események F1 átfedése szolgált jutalomként. NVIDIA NeMo RL támogatta a policy optimalizációt a verifikálható eredmények alapján.
Az egész rendszer értékelése: backtest és live‑fire
Egy detekció akkor lehet hasznos, ha nemcsak a rögzített támadást érzékeli, hanem új végrehajtásokon is működik. Ezért a rendszer két lépésben vizsgálták: (1) backtest a rögzített támadás ellen, majd (2) live‑fire teszt nyolc, ugyanabból a forgatókönyvcsaládból származó, korábban nem látott támadás ellen. Minden átmenő detekciót szó szerint telepítettek az élő motorra; független, harmadik fél modellel megítélték, hogy egy találat valóban a szándékolt támadási viselkedést fedte‑e.
Backtesting eredmények
- Alapértelmezett harness + Nemotron 3 Ultra mellett a generált detekciók átlagosan 16,5%‑a találta meg a rögzített támadást nyolc független seedelt munkamenet átlagában.
- Ha megtartották az Ultra‑t, de hozzátették az optimalizált harness‑t, a testreszabott Nemotron 3 Super‑t, doménkontextust, eszközöket és validációt, az átlag 41,9%‑ra emelkedett hat munkamenetben — ez mintegy 2,5× javulás a backtest teljesítményben.
Ez a nyereség a teljes open‑pipeline‑ra vonatkozik, mivel egyszerre változott a harness és a modellverem.
Live‑fire eredmények és generalizáció
- A live‑fire fázisban az optimalizált nyílt pipelineból 11 backtest‑átmenő detekciót, a teljes frontier rendszerből 35‑öt telepítettek nyolc ismeretlen támadás ellen.
- Az 11 nyílt detekció közül 5 (45%) és a 35 frontier közül 10 (29%) találta meg legalább az egyik támadást. A nyílt pipeline átlagosan 2,6 találatot adott detekciónként, míg a frontier rendszer 1,1‑et.
- A detekcióknak további minőségi feltételeknek is meg kellett felelniük: nem szabadott zajt adniuk a rendelkezésre álló tesztforgalmon, és független felülvizsgálaton is át kellett menniük viselkedési grounding, több signal használata és környezethez nem kötött sztringek szempontjából.
- A tűzgolyó‑szűrőn azok közül, amelyek lángra kaptak, négy nyílt és kilenc frontier maradt csendes a tesztforgalmon; ezek közül a független értékelés után három nyílt detekció, és egyetlen frontier sem kvalifikált „gold” státuszba. A három aranynak minősített nyílt detekció lefedte mind a nyolc tesztelt támadást.
Eredmények értelmezése és korlátai
- A frontier rendszer több backtest‑átmenő detekciót generált, de az optimalizált Nemotron‑vezérelt nyílt pipeline magasabb arányban általánosított, több találatot produkált detekciónként, és egyedüliként termelt gold‑minősítésű detekciókat.
- Az értékelés korlátai: egy forgatókönyvcsaládot vizsgáltak és viszonylag kis detekciókészletet; a kereszt‑forgatókönyv generalizáció nem volt tesztelve. A benevolent (ártatlan) forgalom korlátozottsága miatt a zaj/false‑positive teszt sem reprezentálja a termelési környezetet. Nyolcból három live‑fire futás tapasztalt harness hibát, de mindegyik teljes telemetriát szolgáltatott és bekerült az elemzésbe. Ezek az eredmények rendszer‑szintű iránymutató esettanulmányt adnak, nem általános benchmarkot.
Alkalmazási mintázat és tervezési elvek
A kísérlet szélesebb mintázatot mutat a specializált ügynökök építésére a NVIDIA Nemotron használatával: egy érvelő modell koordinálja az orchestrációt, egy utólagosan betanított nyílt modell végzi a behatárolt szakértői feladatot, és egy agent harness kezeli a kontextust, eszközöket és validációt. A publikáció négy tervezési elvet emel ki:
- Határozzunk mérhető feladatokat és rendeljünk egyértelmű felelősségeket minden modellhez.
- Utólagosan tanítsuk specializált modelleket doménadatokkal és verifikálható jutalmakkal.
- Alapozzuk az outputokat hiteles kontextusra, és validáljuk determinisztikus ellenőrzésekkel, valósághű visszajátszással és független felülvizsgálattal.
- Értékeljük a teljes munkafolyamatot realisztikus feltételek mellett, szakértők ellenőrzése és guardrailok alkalmazása mellett.
CrowdStrike a SafeMind agentikus rendszerben halad tovább e megközelítéssel, amely egyesíti a támadó és védő AI‑t egy folyamatos koevolúciós hurkban. Az NVIDIA eszközei — köztük a Nemotron 3, NeMo Megatron Bridge, NeMo Gym és NeMo RL — lehetővé teszik a specializált ügynökök testreszabását és értékelését más, behatárolt doménekben.
Összegzés
A közös értékelés azt mutatja, hogy egy agentikus, zárt ciklusú offenzív–defenzív rendszer képes automatizálni a támadások ismételt futtatását, a telemetria gyűjtését és a detekciók iteratív javítását. Az optimalizált Nemotron alapú nyílt pipeline kevesebb, de jobban általánosítható detekciót eredményezett, és egyedüliként adott ki gold minősítésű detekciókat a vizsgált forgatókönyvben. Az eredmények iránymutatást adnak a specializált védelmi ügynökök tervezéséhez, de nem helyettesítik a széles körű, több forgatókönyvre kiterjedő független benchmarkokat.



