Eszközök

Mesterséges intelligenciával generált szöveg

NVIDIA VSS Blueprint 3.3 csökkenti a vizuális AI-ügynökök fejlesztési és üzemeltetési költségét

A főszereplő az NVIDIA és a Video Search and Summarization (VSS) Blueprint 3.3, amely új eszközökkel és képességekkel gyorsítja és olcsóbbá teszi a vizuális AI-ügynökök fejlesztését és futtatását.

NVIDIA VSS Blueprint 3.3 csökkenti a vizuális AI-ügynökök fejlesztési és üzemeltetési költségét

Az NVIDIA a Metropolis Blueprint for Video Search and Summarization (VSS) 3.3-as kiadásában két fontos újítást mutatott be: a Build Vision Agent (vss-build-vision-ai) készséget és az Adaptive Efficient Video Sampling (Adaptive EVS) funkciót. A cél az, hogy a vizuális nyelvi modellek (VLM-ek) által lehetővé tett képességeket könnyebben átültessék karbantartható, költséghatékony rendszerekké — mind a fejlesztés, mind az üzemeltetés oldalán.

Mit csinál a VSS és miért fontos

A VSS összekapcsolja a látás‑nyelv modelleket (például NVIDIA Cosmos), nagy nyelvi modelleket (például NVIDIA Nemotron), retrieval-augmented generation (RAG) megoldásokat és Model Context Protocol (MCP) eszközöket, hogy élő és felvett videót természetes nyelvű kereséssé, vizuális Q&A-vá, ellenőrzött riasztásokká és automatikus jelentésszolgáltatássá alakítson.

A gyakorlatban egy termelési vizuális AI-ügynök több munkafolyamatot kombinál (bevitelt, stream feldolgozást, eseménydetekciót, lekérdezést, összegzést, riportálást), és ezek összekapcsolása fejlesztési, üzemeltetési és változáskezelési költségeket eredményez.

Újdonságok a 3.3-as kiadásban

Két fő újdonság csökkenti a költségeket:

  • Build Vision Agent skill (vss-build-vision-ai): egyetlen, természetes nyelvű leírással képes összeállítani és telepíteni egy alkalmazást, több meglévő VSS-munkafolyamatot (például riasztás, keresés, összegzés) kombinálva, és futó telepítéseket kiterjeszteni anélkül, hogy az egész stacket újra kellene építeni.
  • Adaptive EVS: a futásidő során csökkenti a VLM-input tokenek számát azáltal, hogy a képkockapatch-eket összehasonlítja az előző képkockával és a változatlan területeket eldobja, valamint eseményközpontúan tömöríti a feldolgozást. Az EVS már korábban is elérhető volt rögzített pruning-móddal vLLM-ben és a Cosmos NIM mikroszolgáltatásokban; az adaptív változat a valós idejű VLM-mikroszolgáltatásba integrált döntéshozatalt hoz patch- és képkocka-szinten.

Fejlesztési költségcsökkentés a Build Vision Agent révén

A korábbi VSS-skillek külön műveleteket kezeltek (telepítés, kamera-beállítás, összegzés, keresés, riasztások, analitika). A vss-build-vision-ai ezeket deployment skills, operation skills, tools és benchmarkok szerint szervezi, és a fejlesztő által megadott célból egy telepítési tervet generál.

A skill nem teljesen új telepítést hoz létre, hanem a legközelebbi, előre validált négy fejlesztői profil (Foundation) egyikét használja kezdőponthoz, majd csak a szükséges delta változtatásokat alkalmazza. A négy profil:

  • base: VLM sűrű captioning és Q&A klipeken
  • alerts: valós idejű VLM riasztás vagy RT-CV detektálás viselkedéselemzéssel és VLM-ellenőrzéssel
  • lvs: hosszú videók összegzése
  • search: objektum- és videó-beágyazások agentikus kereséshez

A build logikája minimalizálja a duplikált infrastruktúrát: egy adott szolgáltatást, például detektort, csak egyszer telepít, megosztja a Kafka és Elasticsearch példányokat, és csak azokat a szolgáltatáskulcsokat adja hozzá, amelyekre a kért képesség ténylegesen szüksége van. Ha több lehetőség merül fel, a skill strukturált kérdést tesz fel a döntéshez.

A skill automatikusan:

  • leképezi a célokat a szükséges VSS munkafolyamatokra és mikroszolgáltatásokra,
  • kombinálja a riasztás, keresés és összegzés munkafolyamatait egy tervben,
  • újrahasznosítja a megosztott infrastruktúrát (VIOS, Kafka, Redis, Elasticsearch, HAProxy, MCP),
  • egy önállóan telepíthető Compose fájlt és override.env fájlt generál (_builds/<name>/override.env, compose.yml, resolved.yml), anélkül, hogy a repository deploy/docker/ fájljait módosítaná,
  • architektúra diagramot mutat a jóváhagyáshoz, majd validációt, telepítést és readiness ellenőrzéseket futtat,
  • felajánlja egy agent harness telepítését (alapértelmezett: NemoClaw). A "nem" válasz egy headless stacket eredményez a VSS CLI-val.

Ez jelentősen lerövidíti a felfedezési és összeállítási időt, megismételhetővé teszi a kompozíciót és elkerüli az infrastruktúra duplikációját a különböző munkafolyamatok között.

Példa: egy narancslé palackozó sor ügynöke

Egy demóban egy palackozó sorhoz készült ügynököt építettek, amely a töltő- és a kupakoló kamerákat figyeli, túlcsordulás/kiömlés esetén riaszt, korábbi eseményekre kereshető klipeket készít és műszakriportot generál.

A Build Vision Agent skillnek adott egyszerű prompt:

"Build a VSS vision agent for an orange juice bottling line. Use two RTSP cameras on the filler and capper. Detect bottle overflows and juice spills, verify each alert with the VLM, make alert clips searchable, and generate a shift report for the line supervisor."

A skill összeállította a szükséges elemeket: VIOS-alapú RTSP bevitelt, valós idejű detektálást és követést, viselkedéselemzést a túlcsordulás és kiömlés felismeréséhez, VLM-alapú riasztás-ellenőrzést, természetes nyelvű keresést, összegzést és riportálást, valamint megosztott üzenetkezelést és tárolást.

Egy két GPU-s NVIDIA RTX PRO 6000 Blackwell hoston a build kevesebb, mint 30 perc alatt élő, előnézetes telepítést ért el, miközben FP8 Cosmos 3 Nano megosztotta a detektor GPU-ját a duplikáció elkerüléséhez.

Operációs költségcsökkentés az Adaptive EVS-sel

A futó ügynökök folyamatosan generálják a videókat, azonban a legtöbb képkocka nagy része változatlan marad (pl. padló, védőelemek). A VLM-ek minden képkockaablakban kontextust olvasnak, így sok számítás ismétlődik. Az Adaptive EVS célja ennek a felesleges VLM-feldolgozásnak a csökkentése.

Az Adaptive EVS működési módja:

  • Dinamikus pruning: minden patch-et kozinusz-szimilaritással hasonlít össze az előző képkockával; a változatlan patch-ek eldobásra kerülnek, mielőtt elérnék a nyelvi modellt.
  • Eseményközpontú batching: a tokenmegtartás (retention) alapján a klippek kategorizálódnak — például a ~70% feletti retention eseményekként kerülnek batch-elésre, az ~30% alattiak eldobásra vagy flush-olásra, a többiek normál módon futnak.

Mérhető hatás (tesztelt példák)

Egy NVIDIA RTX PRO 6000 Blackwell rendszeren, Cosmos 3 Super FP8 modellel az Adaptive EVS:

  • 17%-kal csökkentette a riasztás kontextualizációs késleltetését: 1,021 ms-ról 844 ms-ra,
  • 46%-kal növelte a párhuzamos valós idejű VLM-streamek számát: 13-ról 19-re,
  • egy 60 perces videó összegzésénél körülbelül fele annyi idő alatt 80%-kal kevesebb VLM-input tokent használt fel.

A hatás azonban a jelenet mozgásától, a chunk-hossztól és a hasonlósági küszöbtől függ; ezért érdemes saját, reprezentatív felvételeken benchmarkolni a gyártásra vonatkozó alapbeállításokat.

Az Adaptive EVS különösen hasznos, ha a VLM sok képkockát olvas és rövid válaszokat ad (pl. dense captioning, hosszúvideó-összegzés, riasztás-ellenőrzés). Kevésbé hoz előnyt, ha kevés képkockából hosszú output készül. Az Adaptive EVS az RT-VLM konténerben fut, opcionális, és az override.env fájlban engedélyezhető például így:

VIA_EVS_SESSION=true VLM_VIDEO_PRUNING_RATE=0.5 # 0.0 to 1.0; higher prunes more VLLM_EVS_SIMILARITY_THRESHOLD=0.2

Milyen változásokat hoz ez a csapatok számára?

  • Alacsonyabb integrációs erőfeszítés: természetes nyelvű kompozíció több munkafolyamatú alkalmazásokhoz.
  • Kevesebb duplikált infrastruktúra riasztás, keresés, összegzés, riport és Q&A között.
  • Nagyobb GPU-hatékonyság a változatlan videóterületek pruningjával.
  • Rövidebb összegzési és esettanulmány-idők, mert a "unalmas" videót átugorja a rendszer.
  • Könnyebb bővíthetőség inkrementális deltaként egy futó telepítés újrahasznosításával.

Ezek együttesen csökkentik az előkészítési fejlesztési munkát és a VLM-ek által igényelt GPU-munkát a videófeldolgozásnál.

Hogyan kezdjen hozzá a VSS 3.3-hoz

  1. Klónozza a VSS Blueprint repository-t és váltsa a 3.3-as készségeket tartalmazó branch-re.
  2. Telepítse a VSS Agent Skilleket a coding agent standard skills könyvtárába.
  3. Írja le a kívánt ügynököt (videóforrások, munkafolyamatok, telepítési korlátok), vagy küldje a "build a vision agent" promptot útmutatásért.
  4. Nézze át az architektúra diagramot és a _builds/<name>/override.env fájlt (különösen GPU elhelyezés, model endpoints, portok, tárolás és biztonsági határok).
  5. RT-VLM munkaterheléseknél engedélyezze az Adaptive EVS-t, hangolja a pruning rátát és benchmarkolja a pontosságot, átvitelt és késleltetést reprezentatív felvételeken.
  6. Telepítés zárt, hitelesített hálózaton, TLS-sel, rate limitinggel és külső vezérlésekkel.

Példa parancsok és telepítési lépések megtalálhatók a repository-ban; a bemutatóhoz az NVIDIA oktató eseménye október 1-jén 9:00 PT-kor élő részvételt kínál, ahol egy vizuális AI-ügynök építése egyetlen promptból lesz bemutatva.

Összegzés

A VSS 3.3 célja, hogy csökkentse a vizuális AI-ügynökök teljes költségét: a Build Vision Agent skill felgyorsítja és egyszerűsíti a fejlesztést és a változtatást, míg az Adaptive EVS jelentősen csökkenti a futásidejű VLM-erőforrásokat azáltal, hogy a figyelmet az eseményekre összpontosítja. Tesztek szerint ezek az újítások rövidebb telepítési időt, alacsonyabb késleltetést, kevesebb tokenfelhasználást és több egyidejű streamet eredményeznek adott hardveren.