Ma a Google két új generatív média modellt tett elérhetővé fejlesztőknek: a Nano Banana 2 Lite képgeneráló modellt és a Gemini Omni Flash videógeneráló és -szerkesztő modellt. Mindkettő elérhető a Google AI Studio, a Gemini API és a Gemini Enterprise Agent Platform felületeken, és számos Google-fogyasztói termékbe is kiépül.
Nano Banana 2 Lite — gyors és költséghatékony képgenerálás
A Nano Banana 2 Lite (gemini-3.1-flash-lite-image) a Nano Banana család eddigi leggyorsabb és legköltséghatékonyabb képgeneráló modellje, kifejezetten nagy áteresztőképességű és alacsony késleltetésű munkafolyamatokra tervezve. A Google javasolja a Nano Banana első verzióját (gemini-2.5-flash-image) használó fejlesztők számára az átállást.
Fő teljesítménymutatók (a Google közlése szerint):
- Késleltetés: szövegből kép generálása körülbelül 4 másodperc alatt.
- Költséghatékonyság: 0,034 USD egy 1K felbontású kép előállítására.
- Minőség: a modell a Google szerint megőrzi a promptokhoz való jó igazodást, karakterkonzisztenciát és olvasható beágyazott szöveges elemeket.
A Nano Banana család rövid áttekintése a Google szerint:
- Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image): a sebességre optimalizált, közel valós idejű nagy volumenű munkafolyamatokhoz.
- Nano Banana 2 (Gemini 3.1 Flash Image): általános felhasználású modell, jó kompromisszumot kínál minőség és késleltetés között.
- Nano Banana Pro (Gemini 3 Pro Image): összetett, professzionális feladatokra, ahol a pontosság fontosabb a sebességnél.
- Nano Banana (Gemini 2.5 Flash Image): korábbi, legacy modell; a Google az átállást javasolja.
A modell a fejlesztői felületeken túl megjelenik fogyasztói felületeken is, például az AI Mode in Search, a Gemini app, NotebookLM, Google Photos, Stitch, Google Flow és Google Ads szolgáltatásokban.
Gemini Omni Flash — multimodális videógenerálás és beszélgetés-alapú szerkesztés
A Gemini Omni Flash (gemini-omni-flash-preview) a Gemini multimodális képességeit hozza a videógenerálásba és -szerkesztésbe. A modell mostantól elérhető a Google AI Studio-ban, a Gemini API-ban és a Gemini Enterprise Agent Platformon; a Gemini appban és a Google Flow-ban is rendelkezésre áll.
Árazás és képességek:
- Árazás: 0,10 USD per másodperc videó kimenetként (a Google megjegyzése szerint megegyezik a Veo 3.1 Fast árazásával).
- Képességek: beszélgetés-alapú videószerkesztés természetes nyelven, multimodális hivatkozások (szöveg, kép és videó kombinálása), valós világismeret integrálása (például történelem, biológia, narratíva logika) és szöveg-akció szinkronizáció egyszerű promptokkal.
Korlátozások (a Google által közöltek szerint):
- Jelenleg 10 másodperces videógenerálás támogatott; hosszabb tartalmak később érkeznek.
- A modell API-jában az audio referenciafeltöltés és a jelenetkiterjesztés még nem támogatott.
- Az API séma 3 másodperces videóreferenciákat fogad el, de jelenleg ezek nem dolgozódnak fel helyesen a modell által.
- Jelenetváltásnál vagy panorámamozgásoknál a karakterkonzisztencia korlátozott lehet; a Google dolgozik a javításon.
A Gemini Omni-ról a Google DeepMind részletes benchmarking információkat is közzétett.
Együttműködő munkafolyamatok és demóalkalmazások
A Google kiemeli, hogy a valódi lehetőséget a modellek összekapcsolása adja: a Nano Banana 2 Lite gyors képeket generálhat, amelyeket hivatkozásként át lehet adni a Gemini Omni Flash-nek animálásra és videóvá alakításra. Az Interactions API-val többkörös, kontextusmegőrző szerkesztések is kialakíthatók (legfeljebb három egymás utáni szerkesztés jelenleg).
Példák a Google által bemutatott demóalkalmazásokra:
- Anywhere: szelfiből vagy feltöltött fotóból ikonikus helyszínekre „áthelyező” alkalmazás; a generált képekre kattintva Omni Flash animált klipeket készít.
- Space Lift: belsőépítészeti demó, amely fotó alapján azonnal több designkoncepciót generál Nano Banana 2 Lite-tal, majd Omni-val mozgó, filmes bemutatót készít.
- Omni product studio: statikus, Nano Banana 2 Lite-tal készített képeket alakít e-kereskedelmi célú, filmes videókká Omni segítségével.
Biztonság, átláthatóság és hitelesítés
Mindkét modell a Google biztonságos infrastruktúráján fut, és a Google SynthID vízjelezést használja az AI-készítésű tartalmak azonosítására. A generált tartalmak igazolása elérhető a Gemini appban, a Gemini in Chrome-ban és a Search felületén keresztül. A Google azt is közölte, hogy bővíti a hitelesítési eszköztárat, hogy jobban követhessük, miként készültek és szerkesztődtek tartalmak az interneten.
Hogyan kezdjünk hozzá
A Google fejlesztői dokumentációkat, prompting útmutatókat és a Google AI Studio játszóterét ajánlja a modellek kipróbálásához. A Nano Banana 2 Lite és a Gemini Omni Flash erőforrásai és példái megtalálhatók a Google AI Studio és a Gemini API dokumentációjában.
A két modell együttes használata lehetővé teszi, hogy fejlesztők gyors iterációval és költséghatékonyan építsenek multimédiás, kép- és videóalapú élményeket.



