Google szerdán mutatta be a Gemini 3.8 Flash két változatát: egy általános Flash „workhorse” modellt, amely ügynöki feladatokra, szoftverfejlesztésre és többlépcsős következtetésekre optimalizált, valamint a Flash Cybert, amelyet kifejezetten sebezhetőség-felderítésre és azok javítására hangoltak.
Miben jobb a 3.8 Flash?
Sundar Pichai, a Google vezérigazgatója egy X-bejegyzésben azt írta, hogy a 3.8 Flash „jelentős ugrásokat” hoz a 3.7 Flash-hez képest a szoftvermérnökségben, az ügynöki feladatokban és a többlépcsős következtetésben. Például a modell alacsonyabb költségen jobb eredményt ért el számos nagyfronti modellnél a DeepSWE kódolási benchmarkon.
A 3.8 Flash különösen erős volt többféle értékelésen: kódolásban, multimodális képességekben, számítógép-használatban, hosszú kontextusú és tudás alapú munkában, valamint tudományos következtetésben. Google szerint különleges szaktudást igénylő doménekben — például pénzügyi és jogi területeken — is jobban teljesített elődjénél és egyes frontvonalbeli modelleknél (például a Vals Finance Agent V2 és Harvey's Legal Agent Benchmark esetében). A Humanity’s Last Exam (HLE)-Verified feladatban 54,9%-os eredményt ért el, ami a többlépcsős következtetési feladatokban való képességét tükrözi.
Teljesítmény, ablakok és multimodalitás
A 3.8 Flash 1 millió tokenes bemeneti ablakot és 64 ezer tokenes kimeneti korlátot kínál, és képes szöveg, kép, hang, videó és PDF feldolgozására. Google termékvezetők — Tulsee Doshi és Raluca Ada Popa — blogbejegyzésükben rámutattak, hogy a 3.8 Flash „keményebben dolgozik” és „nagyobb gondosságot” tanúsít összetett feladatoknál, mert több következtetési lépést hajt végre, bár ez esetenként magasabb tokenfelhasználással járhat.
A Google példái között szerepelt, hogy a modell egy egyszerű promptból játékot épített a Google Antigravity platformon, illetve képes volt egy DOS-verziójú, teljesen működő térképszolgáltatás elkészítésére, 3D-vizualizálók létrehozására és topográfiai térképek generálására valós USGS-adatok alapján.
Arena.ai adatai szerint a 3.8 Flash az Agent Arena listáján a 14. helyen végzett (feljebb DeepSeek-V4-Pro-nál), jelentős előrelépéssel a 3.7 Flash-hez képest (amely a 32. helyen áll). A Text Arena-ban a 3.8 Flash a 7. helyen debütált, Claude Opus 5 és Gemini 3.7 Flash előtt. Javulást mutatott több területen, köztük többfordulós kéréseknél, írásnál, irodalomnál és nyelvi képességeknél, hosszabb lekérdezéseknél, nehéz promptoknál, kódolásnál és üzleti, menedzsment, pénzügyi műveletekben.
Ár és elérhetőség
A 3.8 Flash már elérhető a Gemini Enterprise keretében; fejlesztők az API-n keresztül próbálhatják ki a Google AI Studio, Google Antigravity, Android Studio vagy Stitch felületeken. Az árak bemutatóként megegyeznek a 3.7 Flash bevezető árával: 0,75 USD per millió bemeneti token és 3,75 USD per millió kimeneti token. Felhasználók testre szabhatják a modell „erőfeszítés” szintjét a minőség, költség és késleltetés igényeik szerint, vagy ha az energiahatékonyság a prioritás, maradhatnak a 3.7 Flashnél, amelyet a Google továbbra is támogat.
Flash Cyber: kifejezetten védelemre hangolva
A Flash Cybert Pichai a Google „legképzettebb” kiberbiztonsági modelljeként jellemezte. A modell 86,2%-ot ért el a CyberGym kiberbiztonsági benchmarkon és 47,2%-ot a CWE-Bench-en, amely az AI-alapú javítási képességeket méri. Google belső benchmarkjai szerint a Flash Cyber több mint 70%-os sikerességi arányt ért el sebezhetőségek felfedezésében 20 programozási nyelv esetén.
A Flash Cyber kezdetben a Google Fairwind Programján keresztül „megbízható védelmezőknek” érhető el — a program prioritást ad kormányzati hatóságoknak, kritikus infrastruktúra-üzemeltetőknek és más, fejlett védelemre igényt tartó partnereknek, akik hozzáférést kérhetnek. A modell „szélesebb körű” kockázatcsökkentéseket tartalmaz a kiberbiztonsági őrzés érdekében, ezért a Google jelenleg korlátozott partnerekkel osztja meg, és védekezést épített be visszaélések, illetve támadó célú felhasználás ellen, különös tekintettel a kémiai, biológiai, radiológiai és nukleáris (CBRN) területekre.
Gyakorlati eredmények és belső használat
Google beszámolója szerint a 3.8 Flash Cyber már most segíti a Google saját kódjának védelmét: a modell 2,6-szor több helyes javítást állított elő Chrome-sebezhetőségek esetén, összevetve sokkal nagyobb kereskedelmi modellekkel. A Wiz — amelyet a Google idén vásárolt meg 32 milliárd dolláros üzlettel — kimutatása szerint a 3.8 Flash Cyber 7,5–9,7%-kal nagyobb recallt ért el valós sebezhetőségekre egy belső penetrációs teszt benchmarkon, miközben 2,3–5,2-szer alacsonyabb költségen működött a vezető frontvonalbeli modellekhez képest. A Google Cloud Vulnerability Research kritikus, alapvető sebezhetőséget talált kevesebb mint két óra alatt a 3.8 Flash Cyberrel; a Google szerint általában az ilyen kutatás hónapokig tartana.
Google munkatársak, köztük Raluca Ada Popa, arra figyelmeztettek, hogy a generatív AI ügynökök „rendkívül jártasak” a sebezhetőségek megtalálásában és kihasználásában, miközben a védők feladata sokkal több hibát kell, hogy felszámoljanak a védelemhez. Doug Turner, a Chrome mérnöki igazgatója „sebezhetőségi apokalipszisről” beszélt az utóbbi hónapokban a generatív AI miatti jelentős sebezhetőség-növekedés kapcsán. Turner említette azt az esetet is, amikor a 3.8 Flash Cyber egy 13 éve létező, nagyon finom hibát fedezett fel a Chromium és a Chrome kódbázisban — egy olyan problémát, amelyet sok mérnök átnézett, de nem jelzett.
Cél: védelem erősítése, nem támadás
A Google szerint a fejlesztés fő célja, hogy a védelmezők szakértői szintű eszközökhöz jussanak, amelyek előnyt adhatnak a rosszindulatú szereplőkkel szemben. Tulsee Doshi és Raluca Ada Popa hangsúlyozták, hogy a vállalat a sebezhetőség-javítást helyezte előtérbe az olyan offenzív képességekkel szemben, mint az exploitálás. A Flash Cyber korlátozott kiadása és a beépített védelmi mechanizmusok célja, hogy csökkentsék a visszaélés kockázatát, miközben a védelmi közösség számára hozzáférést biztosítanak hatékony automatikus felfedezéshez és javításhoz.



