Eszközök

Google Gemini Omni Flash API: beszélgetésalapú videószerkesztés vállalati használatra

A főszereplő a Google, amely Gemini Omni Flash néven vezette be az Omni család első modelljét fejlesztőknek és vállalati ügyfeleknek, miután a fogyasztói bemutató 2026 májusi I/O rendezvényen megtörtént.

Google Gemini Omni Flash API: beszélgetésalapú videószerkesztés vállalati használatra

A belső képzési videók vagy termékbemutatók elkészítése eddig sok vállalatnál költséges és időigényes folyamattal járt: forgatókönyv, belső vagy külső stáb, felvétel, vágás és revíziók. Egy apró változtatás — például jogi jóváhagyás miatt módosítandó képernyőszöveg — gyakran az egész lánc újraindítását jelentette. Ezt a munkafolyamatot próbálja átalakítani a Google a Gemini Omni Flash nevű modellel, amely mostantól API-n keresztül érhető el fejlesztők és vállalati ügyfelek számára, miután a fogyasztóknak az I/O 2026 rendezvényen bemutatták.

Mit kínál az Omni Flash?

Gemini Omni Flash az "Omni" család első modellje, amelynek célja, hogy "bármiből bármit" létrehozzon, kezdve a videóval. A fő újítás nem pusztán jobb text-to-video képesség: a modell lehetővé teszi egy elkészült klipek szerkesztését beszélgetéses utasításokkal. Az új API-val a marketing- és képzési csapatokhoz kerülhet ez a fajta interaktív szerkesztés, amelyek a vállalati videók többségét készítik.

Egy beszélgetés, több eszköz helyett

Korábban sok szervezet több különálló eszközt kötött össze (nagy nyelvi modellt forgatókönyvhöz, text-to-image-t, image-to-video-t, külön ajakmozgás-szinkronizálót és hanggenerátort), mindegyik saját szerződéssel, számlázással és adatfolyammal. Omni érdeme az egységesítés: egy modell fogad szöveget, képeket és videókat, és visszaad egy kész klipet szinkronizált hanggal. Ez kevesebb beszállítót, egységes felügyeletet és egyszerűsített adatkezelést jelent.

A beszélgetésalapú szerkesztésnél minden utasítás az előző kontextusára épül: így egy marketinges újrafényelhet egy termékfelvételt, átkomponálhatja vagy megváltoztathatja a ruhát anélkül, hogy az egész felvételt újra kellene generálni.

Multimodális referenciák és fizikai "világmodell"

Omni nem csak szöveget fogad: több referenciafotót és rövid videoklipeket is be lehet táplálni, és ezek a specifikus elemek megjelennek a végső kimenetben. Ha például egy konkrét termékfotót adunk meg, a modell megpróbálja a fény- és formajellemzőket megőrizni a jelenetben, így nem egy általános helyettesítőt generál.

A Google kiemeli a modell két vállalati szempontból fontos erősségét: egyrészt a világmodell (a fizikai jelenetek viselkedésének megértése), amely például eső és pocsolya esetén a tükröződéseket is rendre generálja; másrészt a szöveg- és logóbeillesztés képességét, amely lehetővé teszi feliratok, jelzések átírását vagy egy cég logójának elhelyezését a jelenetben. A tesztek során a jelkövetés összetett jelenetekben nem volt mindig tökéletes, és időnként a szöveg visszacsúszott az eredeti nyelvre képkockák között, ezért emberi ellenőrzés továbbra is szükséges.

Interactions API és a korlátok

A háttérben az új interactions API fut, amely állapotot megőrző felületet ad többfordulós feladatokhoz. Minden forduló viszi magával az előző videót és referenciákat, így az utólagos szerkesztések koherensen halmozhatók. Fejlesztők láncolhatnak generációkat: például készíthetnek egy klipet, átalakíthatják a macskát pumakölyökké, majd átstílusozhatják 8-bites retrora vagy vízfestmény-effektre, és az egyes verziókat elmenthetik későbbi ágaztatáshoz.

A korlátok jelentősek és tervezést igényelnek: a modell dokumentációja szerint a klipek jelenleg 10 másodperces felső korláttal rendelkeznek. Hosszabb anyagok esetén darabolni és összerakni kell a részeket. Feltölthető felvételek szerkeszthetők, de csak ha 10 másodpercnél rövidebbek és a felhasználó rendelkezik a jogokkal. A Google modellkártyája nyíltan jelzi, hogy az állandóság megőrzése szerkesztések között és a pontos szövegrenderelés még megoldatlan kihívások.

Őrizet, vízjelezés és etikai határok

Biztonsági és eredetellenőrzési szempontból minden Omni-klip Google SynthID vízjelet kap. A Google kiterjeszti a C2PA Content Credentials használatát generatív eszközeire, és elindította az AI Content Detection API-t is, amely képes AI-val generált média jelzésére, saját és más szolgáltatók tartalmaira egyaránt.

A Google tudatosan húzott határokat: a modell nem fogad olyan bemeneti párosítást, hogy egy személyről készült állókép és külön audiofelvétel alapján ajak-szinkront készítsen — ezzel a mélyfake-ek korlátozására törekszik. Ugyanakkor elfogad beszélő felvételét és lefordítja azt más nyelvre, ami hasznos lehet globális képzési anyagok lokalizációjához. Szabályozott környezetben ezek a beépített korlátok és az eredetkövetés inkább előnynek számítanak.

Ár, technikai paraméterek és minőség

Az API induló ára agresszív: Omni Flash 720p videó generálása 0,10 USD/másodperc, így egy tíz másodperces klipek ára nagyjából 1 USD. Ez megegyezik a Veo 3.1 Fast 720p árával, kétszerese a Veo 3.1 Lite-nak és jelentősen olcsóbb a normál Veo 3.1‑hez képest.

A lényegi korlátozás, hogy Omni Flash csak 720p felbontást generál; nincs 1080p vagy 4K opció. A Veo 3.1 szintjei 4K-ig skálázhatók, így prémium, nagy képernyős anyagokhoz továbbra is releváns alternatíva maradnak. Az Omni Flash jelenleg 3–10 másodperces klipeket készít 720p natív felbontásban, fekvő (16:9) vagy álló (9:16) formátumban. Referenciabemenetként legfeljebb hét képet és legfeljebb három, egyenként 3 másodperces vagy rövidebb videoklipet fogad. Jelenleg nem fogad külön audio-bemenetet, bár a generált videóhoz hangot is készít. Kimenet MP4 formátum, minden klip SynthID vízjelzéssel és C2PA hitelesítő adatokkal érkezik.

A minőségi kezdeti visszajelzések pozitívak: a LMArena Text-to-Video Arenában Omni Flash az első helyen állt 1527 ponttal.

Mit jelent ez a költségvetések és munkafolyamatok számára?

A valós árak ismeretében a iteráció költsége is mérhetővé válik: minden beszélgetésalapú szerkesztés új generációt jelent, amelyért fizetni kell (hozzávetőlegesen 1 USD minden tíz másodperces passzért 720p‑n). Az állapotot megőrző modell azonban csökkenti a pazarlást: a generációk nem teljesen nulláról indulnak, hanem a már működő részekre építenek, így kevesebb az elvesztegetett próbálkozás.

Omni nem az egyetlen szereplő a piacon: a Veo 3.1 továbbra is a magasabb felbontást igénylő termelési munkák választása, és versenytársak, például Bytedance, Alibaba és OpenAI is a hasonló vállalati költségvetéseket célozzák. Ami az Omnit megkülönbözteti, az maga a szerkesztési paradigma: a videót élő dokumentumként kezeli, nem pusztán egyszeri renderként.


Szerző: AI és vállalati technológia rovat Dátum: I/O 2026 bemutatót követő API‑kiadás (májusban debütált a modell fogyasztói változata)