Modellbevezetés

Mesterséges intelligenciával generált szöveg

NVIDIA Cosmos 3 Edge: 4 milliárd paraméteres on-device világszemlélet- modell robotika vezérlésre

A főszereplő az NVIDIA Cosmos 3 Edge világmodel, amelyet kifejezetten on-device robotvezérlésre alakítottak át.

NVIDIA Cosmos 3 Edge: 4 milliárd paraméteres on-device világszemlélet- modell robotika vezérlésre

Az NVIDIA bemutatta a Cosmos 3 Edge modellt, a Cosmos 3 család 4 milliárd paraméteres omni-modelljét, amelyet kifejezetten úgy terveztek, hogy fizikai világra vonatkozó alapismeretekből kiindulva on-device robotikához használható legyen. A Cosmos 3 Edge előképzése ugyanazon fizikai-világ adatokon történt, mint a Cosmos 3 Nano és Cosmos 3 Super modelleké, így már az alapoktól rendelkezik az objektumok mozgásának és kölcsönhatásainak ismeretével.

Miért fontos ez?

Világmodellek (world models) olyan belső reprezentációkat adnak, amelyek segítik a fizikai kölcsönhatások előrejelzését és kezelését. Ezek azonban gyakran méretesek, és nehéz őket közvetlenül a robot fedélzeti számítógépén futtatni. A Cosmos 3 Edge ezt a kompromisszumot célozza: elég kicsi ahhoz, hogy elférjen egy NVIDIA Jetson AGX Thor memóriájában, és elég kompetens ahhoz, hogy valós idejű, on-device vezérlési politikaként használható legyen.

Mit kapsz a bemutatott oktatóanyag végére?

Az oktatóanyag lépésről lépésre megmutatja, hogyan lehet a Cosmos 3 Edge-et post-trainelni (utótréningelni) egy manipulációs DROID akció-politikává, amely:

  • fut Jetson Thor-on,
  • zárt hurkú (closed-loop) szimulációban értékelhető,
  • képes valós idejű replanningre és folyamatos streamingre on-device.

A teljes reprodukálható folyamat megtalálható a nyílt cosmos-framework adattárban, és a kiadott checkpoint elérhető a HuggingFace-en.

Milyen korlátokat old meg a post-training?

A roboton történő telepítés két gyakorlati korlátozást jelent:

  • Eszközmemória: a modell és a futtatási állapotnak bele kell férnie a robot memóriájába.
  • Vezérlési késleltetés: a teljes inferencia-pipeline-nak elég gyorsnak kell lennie a kívánt vezérlési frekvencia támogatásához.

A Cosmos 3 Edge post-trainelt DROID akció-politikája kb. 9 GB BF16 súlyokkal elfér a Jetson Thor-on, így az inferencia a roboton történik, adatközponti GPU nélkül. Az akciógenerálás Thor-on egy akció-chunk előállításához nagyjából 1,53 másodpercet vesz igénybe (640×540 felbontáson, 15 Hz mintavételnél), míg egy chunk körülbelül 2,13 másodpercnyi robotmozgást fed le. Mivel a következő chunk elkészül, mielőtt az aktuális befejeződne, a kar folyamatosan mozog; a politika akció-chunkokat generál és minden inferencia-ciklus után áttervez (nem minden megfigyelés után).

Teljesítmény zárt hurkú értékelésben

A RoboLab zárt hurkú feladatain (Isaac Lab-Arena benchmark) a post-trained Edge politika 22.9% sikerességet ért el a 120 feladatos készletben. Ez alacsonyabb, mint a kisebb Cosmos 3 Nano 36.8%-os eredménye, de az Edge célja a valós idejű, teljesen fedélzeti autonómia biztosítása kisebb inferenciaigény mellett.

A policy tanításához használt adatok

A kiadott példa a nvidia/Cosmos3-DROID adathalmazt használja, amely 76 ezer sikeres távvezérelt trajektóriát tartalmaz — körülbelül 350 órát 86 feladaton és 564 jeleneten át, Franka Panda kart és Robotiq grippert alkalmazva. Az adathalmaz LeRobotDataset v3.0 formátumban érkezik 640×360 felbontással. Az előkészítés három lépésben történik: inaktív és nem feladathoz tartozó képkockák szűrése, sikeres demonstrációk kiválasztása, majd a tréning alatt véletlenszerű vágás, átméretezés és színzaj alkalmazása.

A saját adatok bevitele esetén azokat LeRobot Dataset v3 formátumba kell konvertálni; különböző robot-embodimentekhez külön konfiguráció szükséges az akciótér, dimenzionalitás, kamera-elrendezés és normalizálás meghatározásához. A Cosmos 3 több embodimentet támogat, köztük dual-arm Franka, UR, WidowX 250 és LeRobot SO101; a részletek a Cosmos 3 Edge modell cardján találhatók.

Előfeltételek és számítási igény

A post-training végrehajtásához szükséges:

  • a legfrissebb Cosmos framework kiadás,
  • validált tréning hardver: NVIDIA DGX Station GB200 Grace Blackwell Superchip vagy GB300 Grace Blackwell Ultra Desktop Superchip,
  • támogatott CUDA és konténer verziók: CUDA 13.0 (cu130), NGC 26.06-py3,
  • hozzáférés a Cosmos 3 Edge alap-checkpointhoz és a Cosmos3-DROID adathalmazhoz,
  • Hugging Face hozzáférési token.

Ez nem egy egyszerű, egy-GPU fine-tune: a validált futtatás 64 csomópontot használ 4× GB200-on, 60K iteráción át (~68 óra, körülbelül 17.4K GB200-óra). A cikk részletes konfigurációs táblázatot ad meg a hyperparaméterekről (pl. 8-D akciótér: 7 csukló + gripper, 540×640 megfigyelés, akció-chunk: 32 jövőbeli lépés 15 Hz-en, LR 2e-4, globális batch 8192 stb.).

Hogyan fut a post-training (rövid áttekintés)

A folyamat négy fő lépésből áll: az adathalmaz letöltése, a base checkpoint konvertálása DCP formátumba, a curation filter alkalmazása, és a post-training elindítása. A repo példafuttató szkriptjeit kell módosítani (Nano helyett Edge konfiguráció importálása és a konvertált DCP checkpoint útvonalának megadása), majd elindítani a post-training scriptet.

Policy kiszolgálása és futtatása Jetson Thor-on

A politika egy WebSocket alapú policy serverrel szolgál, amely az OpenPI protokollt használja. A kliens megküld egy observation dictionary-t, a szerver visszaad egy akcióchunkt. A szerver natívan fut Jetson Thor-on; a súlyok körülbelül 9 GB BF16 formátumban elférnek a Thor memóriájában, így a policy server és a vezérlő kliens is a roboton fut, a kérések sosem hagyják el az eszközt.

Egy egyszerű smoke test bemutatja, hogy a szerver jól formázott akcióchunkt ad vissza még akkor is, ha nincs kar csatlakoztatva (a joint_position és gripper_position bemenetek nulla értékkel szerepelnek teszt célból). A valódi végrehajtás esetén a kliens folyamatos replanning ciklusban olvassa a kameraképeket és a kar aktuális állapotát, végrehajt egy prefixet az akcióchunkból, majd újrainferál.

Zárt hurkú szimulációs értékelés (RoboLab)

A RoboLab (Isaac Lab-Arena benchmark) kliens ugyanahhoz a policy szerverhez csatlakozik, és fizikán alapuló végrehajtással, renderelt megfigyeléseket visszaküldve biztosít valódi zárt hurkú értékelést 120 nyelvvezérelt manipulációs feladaton. A post-trained Edge politika ezen a benchmarkon 22.9% sikert ér el. A szimulációs futtatások videókat és sikernaplókat generálnak, amelyek segítenek a viselkedés és trajektóriák elemzésében.

Alkalmazhatóság a robotvezérlésen túl

A post-training módszerek nemcsak közvetlen vezérlési politikák javítására alkalmasak, hanem például szintetikus adatgenerálásra is. A cikk említ egy példát (Aigen), ahol Cosmos post-traininggel változatos, szintetikus növény- és gyomvariációkat generáltak, így autonóm gyomirtó rendszer erős teljesítményt ért el mindössze 1% valós adaton történő tréninggel.

A Cosmos megosztott súlyai és keretrendszere az OpenMDW1.1 licenc alatt lehetővé teszik a post-traininget, mint rugalmas eszközt specializált, magas teljesítményű modellek létrehozásához a fizikai AI területén.

Hol kezdjük?

  • Töltsd le a Cosmos Edge policy súlyokat és az adatokat.
  • Csatlakozz a Cosmos Labs livestreamhez 08.20-án.
  • Fedezd fel a Cosmos Edge-et Jetson-en, töltsd le a Cosmos 3 checkpointokat és nézd meg a kódot a GitHubon.

A repositorium, modell card és a DROID post-training reprodukciós útmutató folyamatosan frissülnek, és ez tartalmazza a részletes végpontokat a checkpoint-konverzióhoz, környezeti beállításhoz és a curation-filter konfiguráláshoz.