NVIDIA bemutatott egy automatizált, ügynök‑vezérelt munkafolyamatot, amely a Cosmos 3 Nano világmodellel és a TAO agent‑skillekkel lehetővé teszi a post‑tréninget videoalapú kérdés‑válasz feladatra. Egyetlen kódoló‑ügynök (például Codex) két természetes nyelvű prompttal lefuttatott teljes folyamatot: nullaszintű értékelést, LoRA alapú gyors adaptációt (~30 perc tanítás nyolc NVIDIA A100 GPU‑n) és TAO AutoML alapú hiperparaméter‑sweepet, amely a végén 93.35% validációs pontosságot hozott.
Mi a probléma és miért számít
A valós világ video‑feladatokra történő adaptálás gyakran több napot vesz igénybe: adatformátumok rendezése, konténerek beállítása, tréning‑szkriptek, baseline értékelés és hiperparaméter‑keresés. Az NVIDIA javaslata az, hogy a Cosmos 3 Nano alapmodellhez TAO agent‑skilleket és LoRA‑t kombinálva ez a többlépcsős mérnöki munka automatizálható, és jelentősen lerövidíthető.
A használatban lévő modellek és architektúra
NVIDIA Cosmos 3 egy omnimodális „mixture‑of‑transformers” (MoT) alapú alapmodellcsalád, amely szöveg, kép, videó, hang és akciókövetés egyesítésére képes. A MoT két toronnyal dolgozik: egy autoregresszív Reasoner toronnyal a logikai következtetéshez és egy iteratív diffusion alapú Generator toronnyal a jövőbeli állapotok és akciók előrejelzéséhez. A Cosmos 3 különböző méretekben érhető el, például Nano 16B és Super 64B.
Post‑tréning módszerek: SFT vs. LoRA
Két gyakori megközelítés létezik:
- Full‑Parameter Supervised Fine‑Tuning (SFT): az összes súlyt frissíti; erőforrás‑igényes és kockázatos lehet a generalizált tudás regressziója miatt.
- Low‑Rank Adaptation (LoRA): a bázismodellt befagyasztja és kis, tanítható rang‑dekompozíciós mátrixokat injektál; gyorsabb iterációt tesz lehetővé.
Az NVIDIA kísérletében a LoRA körülbelül 7‑szer kevesebb GPU‑órát igényelt a Cosmos 3 Nano esetén, így reális egy napos post‑tréning ciklus.
Két opció a post‑tréning végrehajtására
- Nyílt keretrendszer: a teljes post‑tréning stack, receptfájlok, adat‑ és konfigurációs formátumok nyíltan elérhetők, ha teljes kontrollt akarunk.
- TAO agent skillek: egy magasabb szintű automatizáció, ahol egy kódoló‑ügynök (pl. Codex) a TAO könyvtár skilleit hívva átgondolja és végrehajtja az adatjavítást, a konténerindítást, a tréninget és a hiperparaméter‑sweepet.
Telepítés és előfeltételek
A TAO skill készlet telepíthető tetszőleges kódoló‑ügynökhöz; az NVIDIA példája Codex használatát mutatja. A gyors telepítési parancs a TAO skills bankból:
curl -fsSL https://raw.githubusercontent.com/NVIDIA-TAO/tao-skills-bank/main/scripts/install-codex-agents.sh | bash
A futtatási környezetben a következő környezeti változókat kell beállítani:
export HUGGINGFACE_TOKEN="your_hf_token" export NGC_API_KEY="your_ngc_key" export AUTOML_LLM_API_KEY="your_llm_key"
Adatkészlet és feladat
A bemutatott példa a Toyota Woven Traffic Safety (WTS) adatkészletén futott, egy négyválasztásos (4‑way multiple‑choice) videó kérdés‑válasz feladaton. Az adatállomány több mint 8 000 tanító és validációs mintát tartalmaz. A feladat középpontjában a forgalmi jelenetek és útformációk helyes megértése áll.
Példa kérdés a készletből:
- Kérdés: What is the formation of the road?
- Válaszok: A: Single road (right curve), B: Single road (straight line), C: Intersection (without signal), D: Intersection (with signal)
- Várt válasz: D
Egy prompttal indítható LoRA post‑tréning
Egyetlen Codex prompttel az egész pipeline elindítható, amely automatikusan:
- ellenőrzi és javítja az adatannotációs hibákat,
- lehúzza a bázismodell súlyait a Hugging Face‑ről,
- lefuttat egy nullaszintű (zero‑shot) baseline értékelést,
- legenerálja a LoRA konfigurációkat és elindítja a TAO tréningkonténert,
- végrehajtja az értékelést a post‑tréning után.
A bemutatott futtatásnál a nullaszintű értékelés 54.41% pontosnak adódott (exact‑match, 4‑way). A LoRA post‑tréning egyetlen futtatása körülbelül 30 percet vett igénybe nyolc NVIDIA A100 Tensor Core GPU‑n, és az eredmény 87.14% validációs pontosság volt — a baselinehoz képest +32.73 százalékpont.
Hiperparaméter‑optimalizálás TAO AutoML‑lal
A LoRA gyakran jó kezdeti eredményt ad, de a végső teljesítmény erősen függ a hiperparaméterektől. A TAO AutoML strukturált sweepeket tud futtatni különböző keresési stratégiákkal: Bayesian optimization, Hyperband, kombinációk, batch‑first változatok, és LLM‑irányított javaslatok.
Egy második prompttal a kódoló‑ügynök TAO AutoML sweepet indított. A kísérletben a végső AutoML futtatás 43 párhuzamos próbát dolgozott fel, teljesen párhuzamosan több A100 csomagon, és összesen körülbelül 19.5 órát vett igénybe a tesztkörnyezetben (Oracle Cloud Infrastructure). Az AutoML‑eredmény elérte a 93.35% validációs pontosságot, ami +38.94 százalékpont a bázishoz képest.
Hardver‑ és futtatási idők
- LoRA: kb. 30 perc egy LoRA post‑tréning epoch nyolc NVIDIA A100 (80 GB) GPU‑n.
- AutoML sweep: a demonstrációs környezetben 19.5 óra a 43 párhuzamos trial feldolgozására több A100 node‑on.
- Összehasonlításként a teljes paraméteres SFT futtatás 3 óra 34 percet vett igénybe NVIDIA H100 GPU‑kon.
Minőségi javulás
A számszerű javulások mellett a post‑tréning különösen az összetett, félrevezető valós jeleneteknél hozott jobb döntéseket — az NVIDIA bemutatott példákban javult a helyes útforma‑ és út típus‑osztályozás az adaptált modellnél.
Telepítés produkciós környezetbe
A Cosmos 3 Reasoner NIM kínálja a legegyszerűbb útvonalat produkciós, OpenAI‑kompatibilis Reasoner endpoint létrehozásához. A NIM mikroszolgáltatások előreépített, optimalizált konténerekként érkeznek; a LoRA adapter könyvtárat egyszerűen átadhatjuk a NIM környezetnek a telepítéskor.
Források és események
További erőforrások és példák megtalálhatók a NVIDIA/cosmos és NVIDIA‑TAO/tao‑skill‑bank GitHub repókban, valamint a Cosmos 3 Nano modellek és checkpointok a Hugging Face‑en. Az érdeklődők a Cosmos Labs livestreamre július 16‑án és a Cosmos Labs Office Hours‑ra július 30‑án csatlakozhatnak kérdésekért.
Következtetés
A kombinált megközelítés — Cosmos 3 Nano Reasoner architektúra plusz TAO agent‑skillek és AutoML — lehetővé teszi a gyors, automatizált post‑tréninget, amely a nullaszintű modelltől pár lépésben egy doménspecifikus, naszittyá optimalizált modellig vezet. A folyamat minimalizálja a manuális konfigurációt, és néhány természetes nyelvi prompttal képes többnapos mérnöki munkát egy napba sűríteni.



