Modellbevezetés

Google bemutatja a Gemini 3.5 Flash Cybert: könnyű, költséghatékony modell sebezhetőségkeresésre

A Google bemutatta a Gemini 3.5 Flash Cyber nevű, kifejezetten kiberbiztonsági feladatokra hangolt könnyű nyelvi modelljét, amely a 3.5 Flash alapjára épül.

Google bemutatja a Gemini 3.5 Flash Cybert: könnyű, költséghatékony modell sebezhetőségkeresésre

Google bejelentette a Gemini 3.5 Flash Cyber nevű, kifejezetten sebezhetőség-keresésre finomhangolt könnyű modelljét. A modell a 3.5 Flash alapjaira épül, és célja, hogy gyorsan, hatékonyan megtalálja, ellenőrizze és segítsen javítani a szoftverekben rejlő hibákat.

Miért van rá szükség?

Az automatizált sebezhetőség-felderítésre irányuló kutatás és fejlesztés régóta része a Google biztonsági erőfeszítéseinek. Ahogy az AI-ügynökök egyre jobbak a sebezhetőségek gyors megtalálásában, úgy nő az igény egy megfizethető, skálázható és elérhető megoldás iránt, amelyet a védekezők széles körben használhatnak.

Hozzáférés és telepítési megfontolások

A technológia kettős felhasználhatósága miatt Google korlátozott, szándékos bevezetési stratégiát alkalmaz: a 3.5 Flash Cyber egyelőre pilot program keretében lesz elérhető, kizárólag kormányok és megbízható partnerek számára CodeMenderen keresztül, a későbbiekben fokozatos bővítéssel. A cél, hogy az első vonalbeli védekezők előnyhöz jussanak a kritikus hibák felderítésében és javításában, miközben csökkentik a technológia széleskörű visszaélésének kockázatát. Ugyanakkor a Google a CodeMender alapfunkcióit általános elérhetőségű Gemini modelleken keresztül is elérhetővé teszi a Gemini Enterprise Agent Platform révén.

Miért előnyös egy könnyű modell a kódbiztonságban?

A mélyreható hibakeresés hatalmas végrehajtási keresési teret igényel: egyetlen, drága hívás egy hatalmas nyelvi modellhez könnyen szűk keresztmetszetet eredményezhet. A 3.5 Flash Cyber különösen alkalmas olyan feladatokra, ahol az ügynöknek nagy kódbázist kell átvizsgálnia és sok kódútvonalat elemeznie. A CodeMender 3.5 Flash Cyber többszöri meghívásával jóval több kódútvonalat képes átvizsgálni és validálni, majd a részügynökök egyetlen, magas színvonalú jelentésbe sűrítik az eredményeket. A modell sebessége és alacsony költsége lehetővé teszi rendszeres, időérzékeny vizsgálatokba, kiadási folyamatokba vagy commit-szkennerekbe való könnyű integrációt nagy léptékben.

Benchmarkok és belső tesztek

A Google több benchmarkon tesztelte a 3.5 Flash Cyber modellt. A CyberGym benchmarkon, amely több száz valós világbeli szoftversebezhetőség ellen méri az AI-ügynököket, a Google azt állítja, hogy a CodeMender konfigurálásával — amely akár ötszöri meghívást is enged a modellnek egyetlen végső jelentéshez — a 3.5 Flash Cyber versenyképes teljesítményt ért el jelentősen nagyobb modellekkel szemben (a versenytárs eredményeket a szolgáltatók önbejelentett pontszámai támasztják alá).

A Google Big Sleep csapata önálló értékelést végzett olyan komplex kódbázisokon, mint a Chrome és a Safari, külön biztonsági korlátok nélkül. Itt a 3.5 Flash Cyber jelentősen felülmúlta a fővonalbeli 3.5 Flash és 3.6 Flash modelleket a Big Sleep értékelés pass@1 metrikáján.

A modellt a Google Chrome termelési commit-szkennelési csővezetékében is értékelték, a talált sebezhetőségek nyilvánosan nem kerültek közzétételre, hogy elkerüljék a benchmarkok „szennyeződését” a Gemini vagy versenytárs modellek számára. Az eredmények szerint a 3.5 Flash Cyber jelentős javulást mutatott a 3.5 Flash-hez képest. A Google megjegyzi, hogy néhány versenytárs újabb modellverziói (például Opus 4.6 utáni) beépített biztonsági szabályai miatt elutasították a feladatok elvégzését, így azok eredményei nem szerepelnek.

További összehasonlításként a V8 JavaScript Engine-en végzett tesztek során, ugyanannyi meghívás mellett, a 3.5 Flash Cyber 55 egyedi, megerősített hibát talált, míg a fővonalbeli 3.5 Flash 47-et és az Opus 4.6 36-ot; a 3.5 Flash Cyber által talált 10 probléma a másik két modell számára ismeretlen maradt.

Valós alkalmazások és hatás Google-nél

A benchmarkok mellett a 3.5 Flash Cyber már használatban van a CodeMenderben Google belső kódbázisaiban, többek között a Chrome, Android, Google Cloud, Ads és YouTube rendszereiben, ahol sebezhetőségek felderítésére és javítására alkalmazzák. Példaként a Cloud Vulnerability Research csapat két órán belül fedezett fel távoli kódvégrehajtásra alkalmas sebezhetőségeket nyilvános API-kban és egy memóriakorrupt hibát egy érzékeny termelési szolgáltatásban; a modell ezen felül egy 100%-ban megbízhatónak jelzett exploitot generált, amely megkerülte az olyan megszokott mérséklő intézkedéseket, mint az Address Space Layout Randomization (ASLR) és a Write XOR Execute (W^X). Korai visszajelzések a Wiz és a Cloud CISO Security Engineering tesztelőitől megerősítik, hogy a 3.5 Flash Cyber képessége jelentősen jobb a fővonalbeli 3.5 Flash modellnél.

Előny a védekezőknek

A Google a szoftverbiztonság terén rendelkezik olyan erőforrásokkal, amelyek segítik a modell tanítását valós példákon: az OSV.dev (Google által üzemeltetett sebezhetőségi adatbázis több mint 700 000 nyílt forráskódú sebezhetőséggel) és több mint 10 év OSS-Fuzz eredményei biztosítják a minőségi tanítóanyagot. Ennek köszönhetően a modellek ipari szabvány eszközöket is megtanulnak használni, és képesek nagy léptékű projektek, például a Chromium több millió soros kódját mélyrehatóan elemezni.

A CodeMender és a 3.5 Flash Cyber kombinációja egy költséghatékony, skálázható architektúrát biztosít, amely segíthet több védekező szervezetnek és csapatnak a szoftverek biztonságosabbá tételében.

Összegzés

A Gemini 3.5 Flash Cyber egy célirányosan finomhangolt, könnyű modell a sebezhetőség-felderítéshez, amely a Google szerint költséghatékonyan és hatékonyan növeli a talált egyedi hibák számát nagy kódbázisok vizsgálata során. A modell korlátozott hozzáférésű pilot programban indul, és Google belső tesztek szerint már jelentős javulást hozott a korábbi Flash-modellekhez képest.