Google legújabb modellje, a Gemini 3.6 Flash több multimodális képességgel és gyakorlati fejlesztéssel bővült: a rendszer mostantól képes szöveg, képek, videó, hang és PDFek feldolgozására, egy millió tokenes kontextusablakot kínál, és képes számítógép-használatra is. A Google szerint a frissítés gyorsabb, költséghatékonyabb és tömörebb válaszokra optimalizált.
Mit mutattak be pontosan
- Bemenetek: szöveg, képek, videó, hang, PDF.
- Kontextus: egy millió tokenes ablak.
- Kiegészítő képesség: a modell közvetlen számítógép-használatra képes funkciókat is tartalmaz.
- Üzemeltetési változások: gyorsabb válaszidő, alacsonyabb költségek és rövidebb, kevésbé terjengős kimenetek.
Független értékelés: a pontszám nem javult
Az Artificial Analysis által közölt mérés szerint a Gemini 3.6 Flash intelligenciaszintjét jelző pontszám 50 maradt, ugyanúgy, mint a korábbi Gemini 3.5 Flashnél. A független értékelés tehát nem talált előrelépést a modell „ítélőképességében” vagy általános nyelvi intelligenciájában, hiába a bővített multimodális funkciók.
Versenytársak és a piaci kontextus
A bejelentés kapcsán többen is arra mutattak rá, hogy a hangsúlyok eltérnek a piacon: OpenAI a GPT-5.6-tal a következtetési képességek, kódolás és befejezett feladatok teljesítésében versenyez, és a vállalat kommunikációjában a multimodalitást már inkább alapelvnek tekintik. A Kimi K3 bevezetése során a gyártó explicit módon „table stakes”-nek nevezte a natív multimodalitást, majd a bemutatón inkább az ügynöki (agentic) végrehajtási képességek demonstrálására összpontosított.
Anthropic esetében a kontraszt még élesebb: Claude elfogad vizuális bemenetet, de továbbra is csak szöveges kimenetet ad, míg a Fable 5 a nyelvi képességek, kódolás, ítélőképesség és hosszútávú autonómia terén vezeti az "Intelligence Index"-et.
Mi a jelentősége?
A Gemini 3.6 Flash bemutatója világosan megmutatta, hogy a multimodalitás a termékdemókban látványos előnyt adhat, ám a gyakorlati munkavégzéshez és a komplex feladatok megoldásához sok szereplő szerint a nyelvi és következtetési képességek számítanak igazán. Az Artificial Analysis eredménye alapján Google inkább a bemenetek és a teljesítménytechnikai részletek ügyét polírozta tovább, mintsem az alapvető intelligencia-szintet növelte volna.
Rövid összegzés
Gemini 3.6 Flash jelentősen bővíti a multimodális és üzemeltetési funkciókat (egy millió tokenes kontextus, több bemeneti típus, számítógép-használat), de a független mérés szerint az általános intelligenciapontszám 50 maradt, változatlanul a 3.5 Flash szintjén. A piacon más szereplők jelenleg inkább a következtetési és ügynöki képességek fejlesztésére helyezik a hangsúlyt.



