A brit kormányhoz tartozó AI Security Institute (AISI) nyilvánosságra hozta első, a vezető nyílt súlyú modellek és a zárt, tulajdonosi modellek kibervédelmi képességei közötti eltérés részletes elemzését. A szervezet megállapítása szerint 2026-ban szűkült a különbség: az újabb nyílt modellek közelebb kerültek a zárt, „frontvonalbeli” modellek teljesítményéhez, mint az előző évben mért átlagok alapján várható lett volna.
Mit mértek és milyen eredményt kaptak?
AISI egy 70 darab, specifikus, szűk kiberteljesítményt vizsgáló értékelő feladatsoron tesztelte a modelleket. Ezen a tesztcsoporton GLM-5.2 teljesítménye a legközelebb állt a Claude Opus 4.6-hoz, amelyet 4,3 hónappal korábban adtak ki. DeepSeek V4-Pro helyzete a vizsgálat szerint a Claude Opus 4.5 és a GPT-5 közé esik; a GPT-5-öt 2025 augusztusában, a Claude Opus 4.5-öt pedig 2025 novemberében adták ki.
AISI szerint a GLM-5.2 és a DeepSeek V4-Pro teljesítménye hasonlóan közelíti a zárt frontvonal modelljeit, azokhoz képest 4–7 hónapos lemaradásban vannak — ami szűkebb rés, mint az a 6–10 hónap volt, amit a szervezet többségében 2025 során mért.
Hosszabb folyamatokat igénylő kiberteszteken nagyobb a különbség
Az eltérés némileg növekszik, ha a modelleket hosszabb távú, láncolt képességeket igénylő feladatokon mérik, ahol a cél egy teljes támadási művelet végrehajtása több részképesség összekapcsolásával. Az AISI „The Last Ones” nevű cyberrange-en mért eredményei szerint GLM-5.2 annyit ér el, mint a kevéssel korábban kiadott Opus 4.5 (kevesebb mint 7 hónappal korábban), míg DeepSeek V4-Pro a Sonnet 4.5 alá esik (egy, 7 hónappal korábban kiadott, részben frontvonal alatti modell).
A jelentés szerzői ez alapján arra utalnak, hogy bár a nyílt súlyú modellek felületesen és egyes szűk feladatokban erősek lehetnek, gyakran hiányzik belőlük a tulajdonosi modellek által mutatott általánosító „varázs”, amit az iparág „big model smell”-ként emleget.
Miért fontos ez?
AISI kiemeli a gyakorlati következményeket: a zárt, szabályozott és kontrollált „frontvonalbeli” képességek és a nyíltan, kevésbé kontrolláltan terjedő képességek közötti különbség csökkenése rövidebb felkészülési időt hagy a védekező oldalon. A szervezet megfogalmazása szerint ez azt jelenti, hogy „a kibervédőknek rövid idejük marad felkészülni, mielőtt a mai frontvonalbeli kiberképességek elérhetővé válhatnak a tulajdonosi vállalatok által használt ugyanazon védőintézkedések nélkül”.
További tervek
Az AISI jelezte, hogy ugyanazon vizsgálati keretben tesztelni kívánja majd a Kimi K3 modellt is, amint annak súlyai nyilvánosságra kerülnek.
Rövid összegzés
A brit AI Security Institute mérései szerint a 2026-ban megjelent nyílt súlyú modellek — GLM-5.2 és DeepSeek V4-Pro — jelentősen közelebb kerültek a zárt, frontvonalbeli modellek kiberképességeihez, különösen szűk, konkrét feladatokban. Hosszabb, láncolt támadási szimulációkban azonban továbbra is nagyobb a lemaradás. A rövidebbre csúszó időablak miatt az AISI figyelmeztet: a védelmi szereplőknek gyorsan kell reagálniuk, ha nem akarják, hogy ezek a képességek széles körben, kontroll nélkül terjedjenek.



