Modellbevezetés

Google bemutatta a gyorsabb Gemini 3.5 Flash multimodális modellt

A főszereplő a Google, amely 2026.

Google bemutatta a gyorsabb Gemini 3.5 Flash multimodális modellt

A Google a Google I/O 2026 konferencián mutatta be a Gemini 3.5 Flash nevű frissített középkategóriás multimodális nyelvi modelljét. A cég szerint az új változat fő erényei a gyorsaság, a fejlettebb agentikus képességek és a javult vizuális megértés, miközben az ár tokenenként jelentősen megemelkedett: a korábbi Gemini 3 Flash-hez képest nagyjából háromszoros a díjszabás.

Inputok, outputok és teljesítményjellemzők

  • Bemenetek: szöveg, képek, hang és videó akár 1 millió tokenig.
  • Kimenetek: szöveg akár 64 000 tokenig, sebesség: 204 token/s.
  • Architektúra: mixture-of-experts (szakértők keveréke) transformer.
  • Funkciók: állítható következtetési szintek (minimal, low, medium, high), „thought preservation” (a gondolatmeneti tokenek megtartása a többfordulós beszélgetések során), eszközhasználat támogatása (a számítógép-használat még nem elérhető).

A Google modellkártyája szerint a Gemini 3.5 Flash „a” Gemini 3 Flash-en alapul, amely pedig a Gemini 3 Pro-ból származik. A cég kevés részletet közölt a paraméterszámról, a tanítóadatokról és az építészeti finomságokról: annyi ismert, hogy multimodálisan előtrénelték szövegen, kódon, képeken, hangon és videón webes forrásokból kapott, licencelt, felhasználói és szintetikus adatokon, majd megerősítéses tanulással finomhangolták többlépéses gondolkodást és problémamegoldást igénylő adatkészleteken.

Benchmark-eredmények

A független mérések szerint a Gemini 3.5 Flash nagy előrelépést tett a korábbi Flash-verzióhoz képest, különösen agentikus feladatokban és sebességben, ugyanakkor az általános intelligencia, tudás és kódolási teljesítmény terén elmarad a piac vezető modelljeitől.

Konkrét eredmények (források: Artificial Analysis és egyéb benchmarkok):

  • MMMU-Pro (több tudományterületre kiterjedő vizuális következtetés): Gemini 3.5 Flash magas következtetési szintre állítva 84% pontosságot ért el, ez volt a legmagasabb mért érték, második helyen a Gemini 3.1 Pro Preview 82%-kal.
  • APEX-Agents-AA (hosszú lefutású agentikus feladatok): első próbálkozásra a Gemini 3.5 Flash 47,1%-os pontossággal első helyen végzett, majdnem 10 százalékponttal megelőzve a második helyezett GPT-5.5-öt (37,7%).
  • GDPval-AA (valós világ agentikus feladatok): Gemini 3.5 Flash magasra állítva 1 656 Elo-t ért el, ez meghaladta a Gemini 3.1 Pro Preview 1 314 Elo-ját, de elmaradt a GPT-5.5 xhigh értékétől (1 769 Elo).
  • ARC-AGI-2 (absztrakt vizuális következtetés): Gemini 3.5 Flash magas következtetéssel 72,1%-ot ért el az ARC Prize listán, mögötte a Gemini 3.1 Pro Preview (77,1%) és a GPT-5.5 xhigh (85,0%) álltak.
  • AA-Omniscience (tudás és hallucinációk büntetése): Gemini 3.5 Flash reasoning beállítással 23 pontot ért el, ami elmaradt a Gemini 3.1 Pro Preview (33) és az Anthropic Claude Opus 4.7 max reasoning (26) eredményétől.

Arena.ai vezető táblázatai szerint május 24., 2026-i állapot szerint a Gemini 3.5 Flash a Text Arena-ban a kilencedik helyen állt 1 480 Elo-val, a WebDev kódolási arénában a tizedik 1 506 Elo-val. A Text Arena kategóriáin belül viszont első helyen végzett matematikából (1 521 Elo), míg kódolásban 31. helyen állt (1 507 Elo).

Elérhetőség és ár

A Gemini 3.5 Flash ingyenesen elérhető a Gemini alkalmazáson, a Google AI Studio-ban, a Google Antigravity-n keresztül (egy 5 óránként frissülő számítási kvótán belül, heti limitig), és a Google Search AI módban. Vállalati és API hozzáférés esetén a tokenárak: Gemini Enterprise, Gemini Enterprise Agent Platform és API esetén 1,50 USD per millió bemeneti token, 0,15 USD per millió cached token és 9,00 USD per millió kimeneti token.

A cég azt állítja, hogy a Gemini 3.5 Flash gyakran kevesebb mint a versenytársak fele költséggel fut. Ellenőrzött Intelligence Index-tesztek szerint azonban a működtetési költség bizonyos tesztkörnyezetekben meghaladta a Gemini 3.1 Pro költségeit, így a Flash megjelölés már nem jelenti egyértelmű költségelőnyt agentikus munkaterheléseknél.

A Google I/O-hoz kapcsolódó többi bejelentés

A bemutató részeként a Google több, AI-hoz kapcsolódó újdonságot is ismertetett:

  • Antigravity átalakítása: a Google az Antigravity nevű AI-kódoló eszközt úgy alakította át, hogy inkább az ügynökök menedzselésére fókuszáljon, és kevésbé hasonlítson hagyományos IDE-kre, mint a Microsoft VSCode. Az Antigravity parancssoros változata lecseréli a nyílt forráskódú Gemini CLI-t.
  • Omni család: a Google bemutatta az Omni multimodális modellek családját, kezdve az Omni Flash-sel, amely képes videót generálni szöveg, kép, hang és videó vagy ezek kombinációja alapján. Az Omni Flash jelenleg a Google AI Plus, Pro és Ultra előfizetők számára érhető el a Gemini appon és a Google Flow-ban, API-n keresztül egyelőre nem.
  • Google Search integráció: a Gemini 3.5 Flash lehetővé teszi, hogy a Google Search természetes beszélgetésszerű kérdéseket fogadjon, agenteket hajtson végre felhasználók helyett online kutatásra, és részben a hagyományos tízes találati lista helyett AI-által generált, hivatkozott forrásokkal alátámasztott összegzéseket adjon.

Miért fontos ez?

A Gemini 3.5 Flash módosítja a „Flash” kategória értelmét a Google termékpalettáján: korábban a Flash kisebb, gyorsabb modellt jelölt a Gemini Ultra, Pro és Nano mellett; mostanra a Flash a középkategóriás multimodellt képviseli. A nagyobb sebesség vonzó lehet olyan fejlesztők számára, akik agenteket építenek többfordulós interakcióhoz, illetve alacsony késleltetésű alkalmazásokhoz, mint a chatbotos, keresési vagy kép- és videóelemző rendszerek. Ugyanakkor a magasabb tokenár és a benchmarkok szerinti vegyes teljesítmény miatt a fejlesztőknek mérlegelniük kell a költség/előny arányt.

Összegzés

A Gemini 3.5 Flash gyors és agentikus képességekben erős középkategóriás multimodális modell, amelyet a Google I/O 2026-on mutattak be. Független mérések szerint több agentikus és vizuális feladatban kiemelkedő, de nem minden szempontból a legjobb; továbbá az árpolitika azt jelzi, hogy a Flash kategória már nem automatikusan olcsóbb megoldás az agentikus terhelésekhez.