Eszközök

LeRobot 0.6.0: képzelő világmodellek, jutalommodellek és hatékonyabb adathasználat a robotikai tanuláshoz

A LeRobot csapata kiadta a LeRobot v0.6.0 verziót, amely a robotikai tanulási ciklus lezárására fókuszál: politikák, amelyek a cselekvés előtt jövőt képzelnek el, jutalommodellek a siker érzékelésére, valamint egy telepítési CLI a hibák visszagyűjtéséhez.

LeRobot 0.6.0: képzelő világmodellek, jutalommodellek és hatékonyabb adathasználat a robotikai tanuláshoz

LeRobot v0.6.0 célja a robotikai tanulási kör bezárása: a kiadás három, a jövőt képzelő (world model) policyt hoz, egy egységes jutalommodellek (reward models) API‑t, egy deployment CLI‑t, amely a működés közben bekövetkező hibákból gyűjt tanító adatot, valamint hat új szimulációs benchmarkot, amelyeket egyetlen CLI‑vel lehet futtatni. Emellett a kiadás támogatja a mélységérzékelést, VLM‑alapú automatikus annotálást, egyedi videó‑kódolást, HF Jobs felhőtréninget és gyorsabb, kisebb telepítést.

Fő újdonságok röviden

  • Három world‑model policy: VLA‑JEPA, LingBot‑VA, FastWAM — mindegyik a jövő megjóslásával tanul cselekedni.
  • Új VLAs (vision‑language‑action modellek): GR00T N1.7, MolmoAct2, EO‑1, EVO1, Multitask DiT és mások.
  • Új jutalommodellek API (lerobot.rewards) — köztük Robometer és TOPReward.
  • Hat új szimulációs benchmark, mind elérhető a lerobot‑eval CLI‑vel.
  • lerobot‑rollout CLI DAgger‑stílusú emberi beavatkozások rögzítésére és visszaforgatására.
  • FSDP támogatás, HF Jobs felhőtréning, mélységvideó és automatikus nyelvi annotációk.
  • Konfigurálható videókódolás és akár 2x gyorsabb adatbetöltés.

Világmodellek: policyk, amelyek elképzelik a jövőt

A v0.6.0 három, a jövő előrejelzését beépítő policyt hoz:

  • VLA‑JEPA: egy kompakt VLA (Qwen3‑VL‑2B alapokra építve) tanul latens térben jövőképeket jósolni JEPA világmodellel a tanulás során; a világmodell csak a tanításnál van jelen, az inference‑nél eltűnik, így a felügyelet extra futási költség nélkül jár. Három előre betanított checkpoint érhető el a Hubon.

  • LingBot‑VA: autoregresszív video‑action modell, amely videót és akciókat együtt jósol chunk‑onként, és visszacsatolja a valós megfigyeléseket, hogy az elképzelt jövő földet érjen. Beállításokkal elmenthető, mit képzelt a robot (policy.save_predicted_video).

  • FastWAM: egy ~5B paraméteres video‑generáló szakértőt és egy kompakt akciószakértőt kombinál egy hálózatban, a modell saját képzeletén belül gyakorol; inference‑nél ezt a képzelést kihagyja és közvetlenül denoisingol akcióchunkokat.

Részletes dokumentáció és hivatkozott tanulmányok elérhetők a LeRobot dokumentációjában.

A VLA‑k növekvő modellcsoportja

A kiadás több új vagy frissített VLA‑t hoz:

  • GR00T N1.7: NVIDIA GR00T integráció frissítve N1.7‑re, a backend most Cosmos‑Reason2‑2B (Qwen3‑VL‑alapú) és a GR00T‑integráció paritás‑tesztelt az Isaac‑GR00T implementációval. Flash‑attention opcionális.

  • MolmoAct2: az Allen Institute for AI modellje most teljes életciklus‑támogatással a LeRobotban (fine‑tune, LoRA, értékelés, robot‑deploy). Kész checkpointokkal SO‑100/101‑en való zero‑shot futtatás támogatott; inference ≈12 GB bf16, LoRA‑finetune egy 24 GB GPU‑n elfér.

  • EO‑1: Qwen2.5‑VL‑3B alapú VLA, flow‑matching action fejjel, a paper szerzőjének hozzájárulásával.

  • Multitask DiT: ~450M paraméteres diffusion transformer, CLIP vizuális és nyelvi feltételezéssel, több feladatot tanul természetes nyelv alapján.

  • EVO1: 0.77B paraméteres, InternVL3‑1B alap, valós idejű futtatásra és kétlépcsős finetuningra optimalizálva.

Dokumentációk és technikai részletek mindegyik modellhez elérhetők.

Jutalommodellek: tudni, mikor sikeres a robot

LeRobot most egységes jutalommodellek API‑val (lerobot.rewards) rendelkezik, amely mögött több modell áll, köztük a korábbi HIL‑SERL és SARM, valamint két új:

  • Robometer: előre betanított, általános célú jutalommodell (lerobot/Robometer‑4B). Nyers videó és feladatleírás alapján pontozza a feladat előrehaladását és sikerét anélkül, hogy feladatspecifikus tanítást igényelne. Qwen3‑VL‑4B‑re épül, és több mint egymillió robotikus trajektória összehasonlításával tanult.

  • TOPReward: teljesen zero‑shot megközelítés: egy VLM (Qwen3‑VL) log‑valószínűségét használja a „True” tokenre a trajektória és instrukció alapján; bármely alkalmas VLM így jutalomfüggvénnyé tehető.

Mindkettőhöz annotáló scriptek járnak, amelyek képkockánkénti előrehaladási görbéket írnak a datasetbe, támogatva a reward‑aware behavior cloningot és dataset‑minőségellenőrzést.

Datasets: gyorsabb betöltés, gazdagabb adatok

  • Egyedi videókodekek: --dataset.rgb_encoder.* opciókkal most részletesen szabályozható a codec, minőség, pixelformátum, GOP és egyéb beállítások; vcodec=auto próbál hardveres enkodereket (NVENC, VideoToolbox, VAAPI, QSV) mielőtt szoftveres AV1‑re esne vissza. Újrakódolás parancs is szerepel.

  • Mélység támogatás: Intel RealSense‑szel a LeRobot milliméterben rögzíti a depth mapeket, 12‑bites tömörített depth videóként az RGB mellett; dekódolva visszakapjuk a fizikai egységeket a tréningnél. Támogatott hardverek: SO‑100/101, Koch, OpenArm, reBot, Unitree G1 és több.

  • Nyelvi annotációk nagyban: a datasetek most timestampelt, rész‑feladatokat, terveket, memóriát, korrekciókat, beszédet és kamera‑specifikus VQA párokat tárolhatnak. A lerobot‑annotate CLI VLM‑et használva automatikusan kitölti ezeket a mezőket (például Qwen/Qwen2.5‑VL‑7B‑Instruct), és YAML recept réteg rendereli ezeket chat‑stílusú edzési üzenetekké.

  • Akár 2x gyorsabb adatbetöltés: párhuzamos multi‑kamera dekódolás, worker‑ok között 4x kisebb memóriahasználatú uint8 frame átadása, persistent worker cache, és determinisztikus, folytatható mintavétel. Példa benchmark: részhalmaz betöltés 275 s‑ről 0.06 s‑re csökkent.

Benchmarkok: egy CLI az összeshez

A kiadás hat új szimulációs benchmarkot ad a lerobot‑eval CLI alá, mindegyikhez dokumentáció, Docker image és SmolVLA alapvonal:

  • LIBERO‑plus: kb. 10,000 megzavart LIBERO variáns több tengellyel (világítás, kamera, utasítás átírás) a policy robusztusságának tesztelésére.
  • RoboTwin 2.0: 50 kétkezes manipulációs feladat SAPIEN alatt, erős domain randomizációval és >100k tréning trajektóriával a Hubon.
  • RoboCasa365: 365 konyhai feladat 2,500 procedurálisan generált konyhában mobil manipulátoron, a legnagyobb feladatszám.
  • RoboCerebra: hosszú horizontú viselkedés láncolt 3–6 rész‑céllal és 6,660‑episodás datasettel.
  • RoboMME: memória vizsga — ismétlések számolása, rejtett tárgyak követése, bemutatott eljárások utánzása, 16 feladat.
  • VLABench: manipulációs tudás és érvelés tesztelése, fizikai kérdésektől komplex feladatokig.

A szimulátor backendek speciális rendszerszintű függőségeket igényelnek; minden benchmark dokumentációja tartalmazza az install lépéseket, és Docker image is rendelkezésre áll.

Tréning és inferencia

  • lerobot‑rollout CLI: külön deployment workflow, több stratégia (base, sentry, highlight, episodic, dagger). A dagger stratégia emberi beavatkozásokat (intervention flag) rögzít, vezetett átadással, így a korrigált adat készen áll a finetune‑ra.

  • FSDP (Fully Sharded Data Parallel) támogatás Accelerate‑en keresztül: paraméterek, gradiensek és optimizáló állapot sharded GPU‑k között, checkpointok összeállíthatók egyetlen model.safetensors fájlba, és egy futás különböző GPU‑számon is folytatható.

  • HF Jobs felhőtréning: a helyi lerobot‑train parancs megegyező parancsal futtatható a felhőben egy flaggel (--job.target), LeRobot feltölti a szükséges adatokat a privát Hub repo‑ba, beadja a jobot, streameli a logokat és a végén feltolja a betanult policyt a Hubra. Compute választék T4‑től 8x H200‑ig pay‑as‑you‑go modellben.

Kódalap: könnyebb telepítés és tisztább felépítés

  • pip install lerobot immár könnyebb, kb. 40%‑kal kevesebb alapfüggőséggel; funkció‑szintű extras (training, core_scripts, evaluation, ...) külön csomagokban.
  • Támogatott PyTorch verziók 2.7–2.11, Linuxon CUDA 12.8 kerekekkel.
  • --policy.dtype=bfloat16 most valós mixed‑precision tréninget vezet be Accelerate‑en keresztül.
  • uv.lock a CI/Docker/development hiteles dependency spec.
  • Foxglove integráció (--display_mode=foxglove) streameli a teleoperációt és felvételeket.
  • lerobot_env_* csomagok pip telepítéskor ön‑regisztrálják magukat; plugin rendszer öt komponensre terjed ki: robotok, kamerák, teleopok, policyk és env‑ek.
  • Wayland, SSH, headless és macOS felvételekhez javított billentyűzet‑vezérlés.

Közösség és ökoszisztéma

  • LeLab: böngésző alapú UI a teljes LeRobot workflowhoz (kalibrálás, teleoperáció, felvétel, tréning, deploy), jelenleg SO‑ARM101 támogatással.
  • Isaac Teleop: SO‑101 VR vezérlés NVIDIA Isaac Teleop stacken keresztül CloudXR/OpenXR‑on, együttműködés az NVIDIA csapattal.
  • Új compute hardware guide: GPU‑igény és várt tréningidők referenciái RTX 4090‑tól 4x H100‑ig.
  • Átírt Adding a Policy útmutató a saját policy kibocsátásához pluginként vagy beépítve.

Záró gondolatok

A v0.6.0‑hoz több száz hibajavítás, dokumentációs frissítés és kisebb minőség‑életjavító változtatás tartozik. A LeRobot csapata megköszöni a közösség hozzájárulásait: egyetemek, ipari és hobby csapatok PR‑jei és hibajegyei segítették az open‑source robotika előrehaladását.

A részletes kiadási jegyzetek és migrációs útmutatók a dokumentációban találhatók. – A LeRobot csapat ❤️