Modellbevezetés

Mesterséges intelligenciával generált szöveg

Gemini bevezeti az agentikus videóértelmezést a gyorsabb és költséghatékonyabb videóelemzésért

A Google bemutatta az agentikus videóértelmezést a Gemini 3.7 Flash, 3.6 Flash és 3.5 Flash-Lite modellekben, amely a modell natív videóeszközeit és kódvégrehajtást kombinálva javítja az elemzés pontosságát és csökkenti a tokenfelhasználást.

Gemini bevezeti az agentikus videóértelmezést a gyorsabb és költséghatékonyabb videóelemzésért

A Google ma bejelentette, hogy agentikus videóértelmezés (agentic video understanding) érhető el a legújabb Gemini modellekben: Gemini 3.7 Flash, 3.6 Flash és 3.5 Flash‑Lite. Az új képesség célja a videóelemzés pontosságának javítása miközben jelentősen csökkenti a tokenhasználatot és a költségeket.

Mire jó az agentikus videóértelmezés?

Az agentikus videóértelmezés a korábbi, „statikus” feldolgozástól eltérően a modell és a natív videóeszközök együttműködésére épít. Ahelyett, hogy a videót fix képkockasebességgel (alapértelmezett 1 FPS, API-n keresztül állítható) „átolvasná”, a rendszer célirányosan keresi, szkenneli és vizsgálja a releváns videószegmenseket — vizuális képeken, hangon és átíráson átfésülve őket. A Gemini ezzel egy agentikus ciklust futtatva belső eszközöket hív meg a szükséges részek betöltésére, csökkentve a fejlesztési többletmunkát.

Teljesítmény és mérőszámok

A Google által közölt benchmarkok szerint a Gemini modellek agentikus videóértelmezéssel jelentősen hatékonyabbak a szabványos videóelemzési feladatokban: elemzési költségeket legfeljebb 66%-kal csökkentik, a tokenfogyasztást legfeljebb 88%-kal mérséklik, miközben a pontosság akár 7%-kal javulhat. Ezek a nyereségek különösen hosszú formátumú videók (10 perctől többórás felvételekig) esetén érvényesülnek, ahol a statikus feldolgozás választásra kényszeríti a fejlesztőket a magas tokenköltség vagy a részletek elhagyása között.

A cég kiemeli, hogy bár a három támogatott modell mind részesül a javulásból, a Gemini 3.7 Flash agentikus módon adja a legjobb minőség‑költség arányt, és a tesztelt modellek között a pontosság‑költség pareto‑határát képviseli.

Milyen feladatokra használható?

  • Szubmásodperces momentum‑visszakeresés: gyors állapotváltozások és szoros vágáshatárok azonosítása, amelyek 1 FPS mellett könnyen elsikkadnának — hasznos például precíz automatikus videószerkesztéshez.
  • Hosszú távú „tű a szénakazalban” keresés: összetett kérdések megválaszolása többórás felvételeken anélkül, hogy millió token fogyasztására lenne szükség.
  • Anomália‑detektálás: érdekes időablakok újramintavétele magasabb FPS‑sel gyors mozgás vagy finom vizuális hibák ellenőrzéséhez.
  • Művelet- és objektumszámlálás: ismétlődő mozgások és különálló objektumok pontos követése időben.

Példák a működésre

Agentikus feldolgozás esetén a modell dinamikusan változtatja a vizsgált képkockasebességet és a modalityt (képkockák, hang, átírás) úgy, hogy csak azokat a részeket tölti be és elemzi, amelyek relevánsak a feladathoz. A Gemini 3.7 Flash például képes volt gyors mozgásokat pontosan megszámolni azáltal, hogy szükség szerint többször átvizsgálta a felvételt különböző FPS‑eken.

Hozzáférés és árazás

Az agentikus videóértelmezés ma elérhető videófeltöltésekhez és YouTube‑videókhoz a Gemini API‑n keresztül a Google AI Studio és a Gemini Enterprise Agent Platform felületén. A szolgáltatás a standard Gemini API tokenárképzést használja, további funkciódíj nincs. Az aktiváláshoz az API konfigurációban a feldolgozási módot "agentic"‑re kell állítani. A Google fejlesztői útmutatót is biztosít a beállításhoz és a legjobb gyakorlatokhoz.

Jövőbeli terjeszkedés

A Google közölte, hogy a funkció hatékonysági és minőségi előnyeit széles körben elérhetővé teszi a Google‑termékek felhasználói számára: hamarosan minden felhasználónál megjelenik a Gemini alkalmazásban Flash és Flash‑Lite modellekre kiterjesztve. Néhány hónapon belül az agentikus videóértelmezés a YouTube „Ask YouTube” funkciót is hajtani fogja a videómegtekintő oldalon, jobb minőségű, a vizuális tartalmakra alapozott válaszok nyújtásához.

Köszönetnyilvánítás

A bejelentésben a közreműködők között megemlítik: Sergi Caelles, Filip Pavetić, Ahmet Iscen, Suhas Yogin és az Agentic Vision csapata.

Összegzés

Az agentikus videóértelmezés célja, hogy a Gemini modelleket aktív, célirányos szereplővé tegye a videófeldolgozásban, így kevesebb tokenből és olcsóbban, gyorsabban lehet pontos eredményeket kapni — különösen hosszú, részletekben gazdag felvételek esetén.