Modellbevezetés

Világmodell-alapú robotpolitikák: hogyan cserélik le a VLA-kat a World Action Modellek

A cikk főszereplője az NVIDIA Cosmos 3 és a világmodell alapú World Action Model (WAM) megközelítés a robotmanipulációban.

Világmodell-alapú robotpolitikák: hogyan cserélik le a VLA-kat a World Action Modellek

A robotikában egyik központi kihívás olyan vezérlési szabályok (policy-k) kialakítása, amelyek túl tudnak lépni azokon a demonstrációkon, amelyeken megtanították őket. Gyakori, hogy egy politikus jól teljesít a tréningjelenetben, de megbukik, ha az objektumok alakja, helyzete vagy a fényviszonyok megváltoznak. Az általánosítás kulcsa, hogy a policy ne csak utánzóként viselkedjen, hanem a feladatok mögötti fizikai folyamatokat is értse — ez pedig a használt backbonetől függ.

Miért korlátozzák a VLM-alapú VLAs a fizikai általánosítást?

A gyakorlatban a nyelvvezérelt robotpolicik előállításának bevett módja egy előtréningezett vision-language model (VLM) kiegészítése egy akciómodullal, így létrejön a vision-language-action (VLA) modell. Ez a paradigma sokat tett az általános manipuláció előrehaladásáért, mert a VLM-ek nagyon jól értik a jelenetek jelentését és a nyelvi utasításokat. Ugyanakkor a VLM-ek célja képekhez és nyelvi leírásokhoz illő szöveg előállítása, nem pedig a világ időbeli fejlődésének modellezése. Egy VLM nem feltétlenül tanulja meg, mi történik egy bögre alakkal, amikor a fogó összezáródik, hogyan hajlik egy törölköző, vagy hova esik egy tárgy, ha elengedik. Ennek következtében a VLA-k jók szemantikus általánosításban, de kevésbé hatékonyak a fizikai viselkedés és új környezetek kezelésében.

Mit változtat egy World Action Model (WAM)?

Egy WAM a háttérben videó alapú világmodellt használ: a backbone kifejezetten megtanulja, hogyan alakulnak a jelenetek időben. Így a post-training nem a dinamikák tanítását kezdi el nulláról, hanem egy már fizikai-priorral rendelkező modellt specializál. A NVIDIA „World Action Models are Zero-shot Policies” című munkája és Jim Fan "Robotics’ End Game" előadása köré összpontosuló kutatási irány hangsúlyozza a WAM-ek előnyeit:

  • Tanulás sokféle adatról: míg egy VLA gyakran igényel nagyon hasonló demonstrációkat az adott feladathoz, egy WAM a fizika szabályait tanulja meg — minden interakcióból hasznos jel érkezik. Ez olcsóbb adatelőállítást tesz lehetővé.
  • Nyílt világbeli általánosítás: a fizikai törvényszerűségek általánosabbak, mint a szemantika; egy eszköz esésének vagy csúszásának dinamikája hordozható más tárgyakra és jelenetekre.
  • Gyorsabb adaptáció új robotokra: ha a modell már érti a fizikai interakciókat, kevesebb feladatspecifikus demóra van szükség egy új karhoz vagy fogóhoz való specializáláshoz.

Ezek a gyakorlati előnyök — kevesebb adat, jobb viselkedés a tréning-eloszláson kívül, rövidebb út új megtestesülésekhez — a pretraining backbone tulajdonságaiból következnek, tehát minden onnan post-trained policy-ra rávetülnek.

Miért jó alap a Cosmos 3?

Cosmos 3 egy omni-model világalapú modell, amely Mixture-of-Transformers (MoT) architektúrán alapul. A multimodális bemenetek egy autoregresszív transzformeren haladnak át a szimbolikus (pl. szöveges) következtetésért, amely irányít egy diffúziós transzformert a folyamatos modalitások (kép, videó, hang, akció) generálására. Szöveg next-token dekódolással jön létre; minden más, köztük az akciók, iteratív denoising-szal szintetizálódik. A modell három méretben érhető el: 4B (NVIDIA Cosmos Edge), 16B (NVIDIA Cosmos Nano) és 64B (NVIDIA Cosmos 3 Super).

A Cosmos 3 ereje a széleskörű, fizikai világot bemutató adatkészletben rejlik: körülbelül 767 millió kép, 348 millió valós világ-dinamikát tartalmazó videó és 8 millió akciómintát tartalmazó gyűjtemény — ez utóbbi robotmanipulációt, autonóm vezetést, kamera- és egocentrikus mozgást is lefed.

Cosmos 3-ból robotpolicy: Policy DROID modellek

A Cosmos 3 szolgál kiindulópontként a specializációhoz. A Cosmos3-Nano-Policy-DROID egy 16 milliárd paraméteres policy, amelyet a Cosmos 3 Nano checkpointjáról post-trainedek a DROID platformra — ez egy Franka Panda kar Robotiq fogóval. Létezik 4 milliárdos változat is, Cosmos3-Edge-Policy-DROID néven, amely azonos post-training recepttel készül és célja az on-device telepítés.

A policy bemenetként nyelvi utasítást és többkamerás megfigyeléseket kap, és robot-akciótrajectóriákat generál. Három fontos tulajdonság, ami a omni alapból következik:

  • Képzelkezik miközben cselekszik: amikor a modell akciókat ad ki, ugyanabból a modellből előállítható a videó-előrejelzés is arról, mit fognak látni a kamera-szenzorok, ha az akciókat végrehajtják.
  • Megőrzi az omni architektúrát: a post-training nem távolít el komponenseket; a policy checkpoint továbbra is képes következtetni és videót generálni, nem csupán ízületi pozíciókat visszaadni.
  • A prior mérhető: a Cosmos 3 technikai jelentésében két DROID policy összehasonlítása mutatja, hogy az omni checkpoint alkalmazása növelte a RoboLab sikerarányt 28,1%-ról 36,8%-ra — ez arra utal, hogy a javulás az architektúrából és az előtréningből ered, nem pusztán a skálából.

Telepítési megfontolások

Egy WAM a teljes generatív világmodellt hordozza, ezért általában nagyobb, mint a kompakt VLA-k. A Cosmos 3 azonban több telepítési szintre is illeszkedik:

  • Munkaállomás szerverezés (Nano, 16B): Cosmos3-Nano-Policy a robot mellett fut, például egyetlen NVIDIA RTX PRO 6000 gépen, ahol a robot hálózaton küldi az érzékelési adatokat, és akciócsomagokat kap vissza.
  • On-device (Edge, 4B): Cosmos 3 Edge ugyanazt a policy munkaterhelést futtatja beágyazott hardveren. 640×360 felbontású megfigyelések mellett 32 akciót generál egy inferencián, és valós idejű vezérlést ér el 15 Hz-en NVIDIA Jetson Thor-on. Támogatott több NVIDIA edge számítógépen, köztük RTX PRO GPU-kon, DGX-en, GeForce RTX-en és Jetson eszközökön (például Jetson T2000 és T3000 modulok).

Miért érdemes Cosmos 3-at választani robotpolicy építéshez?

  • Nyílt alap: a bázismodell, a datasetek, a post-training recept, a betanított súlyok, az értékelő eszközök és a szolgáltatási verem elérhető, a licenc kommunikatív a kereskedelmi felhasználás szempontjából.
  • Gyorsabb adaptáció: erős fizikai priorok jelentősen csökkentik a feladatspecifikus demonstrációk számát; a közösségi LeRobotDataset formátumra konvertálva a meglévő pipeline-okkal használható.
  • Egy alap, sok robothoz: minden új megtestesülés (például Franka, dual-arm, UR, WidowX) saját post-training futtatást igényel, de mind a közös, előtréningezett alapból indul, így kevesebb demonstráció szükséges egyenként.

Hogyan kezdjen hozzá a csapat?

A leggyorsabb módja annak, hogy kiderüljön, egy WAM jobb-e, mint az aktuális VLA: post-traineljen egy Cosmos 3 alapú modellt a saját adataival és hasonlítsa össze. A Cosmos 3 modellgyűjtemény, datasetjei, a technikai jelentés és a telepítési eszközök nyilvánosan elérhetők Hugging Face-en és GitHubon. További részletekért érdemes elolvasni a Cosmos 3 technical reportot és meghallgatni a Cosmos Labs livestreamet augusztus 13-án. Csatlakozni lehet a Cosmos Discord közösséghez is.

Következtetés

A VLA-k erősek szemantikai feladatokban, de ha a cél a fizikai általánosítás és a gyors adaptáció új környezetekre vagy robotokra, a videó-alapú World Action Modellek komoly előnyöket nyújtanak. Cosmos 3 gyakorlati, nyílt és multimodális alapot kínál ezekhez a WAM alapú politikákhoz, mérhető javulást eredményezve a real-world sikerességben.