Kutatás

Vision-language robotok soros tanulását LoRA és on-policy megerősítés csökkenti a felejtést

A kutatás főszereplői Jiaheng Hu és Jay Shim valamint a University of Texas Austin, University of California Los Angeles, Nanyang Technological University és Sony kutatói, akik egy nagy előképzett vision-language-action modell (OpenVLA-OFT) soros finomhangolásával vizsgálták a robotika feladatok közbeni „katastrofális felejtés” csökkentését.

Jiaheng Hu, Jay Shim és munkatársaik (University of Texas Austin, University of California Los Angeles, Nanyang Technological University és Sony) azt találták, hogy a nagy, előre betanított vision‑language‑action (VLA) modellek finomhangolásakor a LoRA (low‑rank adaptation) és az on‑policy megerősítéses tanulás (GRPO) együtt csökkenti a „katasztrofális felejtést” robotikai feladatok egymás utáni tanítása során. A szerzők módszere a LIBERO benchmark három feladatsorán szimulált robotkaros környezetben teljesített, és az eredmények szerint vagy megközelítette, vagy meghaladta a korábbi iteratív tanulási módszerek teljesítményét.

Mi történt és hogyan dolgoztak a szerzők

A kutatók az OpenVLA‑OFT nevű nagy, előre betanított VLA modellt finomhangolták három különböző feladatsoron a LIBERO benchmarkban. Minden feladatsor öt feladatot tartalmazott (például fiók kinyitása vagy egy objektum célhelyre mozgatása), és a modelleket sorban, egyenként tanították meg az egyes feladatokra anélkül, hogy a korábbi feladatok adatait újra használták volna.

A modell bemenete képből és utasításból állt, kimenete pedig egy sor folyamatos vezérlőakció a robotkarhoz és a gripperhez. A finomhangolás során a szerzők LoRA‑t alkalmaztak a modell súlyainak korlátozott módosítására, és GRPO‑t (on‑policy megerősítéses algoritmust) használtak a tanuláshoz; a modell az egyes feladatok teljesítéséért kapott jutalmat.

Kulcsötlet

A csoport szerint három tényező együttes hatása csökkenti a felejtés mértékét: a nagy, előre tanult modellek strukturális stabilitása (sok paraméter miatt a kisebb frissítések kevésbé sértik a korábbi tudást), a LoRA, amely a súlyváltoztatásokat két kis mátrix szorzataként vezeti be, és így korlátozza a változás nagyságát, valamint az on‑policy megerősítéses tanulás (például GRPO), amely a modell saját maga által generált akciókat jutalmazza, és ez is mérsékli a nagymértékű súlyfrissítéseket. Ezzel szemben a felügyelt finomhangolás és az off‑policy módszerek nagyobb, korábbi tudást sértő frissítéseket eredményezhetnek.

Eredmények

A szerzők módszere a libero‑spatial feladatokon 81.2 százalékos átlagos sikerességi arányt ért el. Összehasonlításul:

  • Dark Experience Replay: 73.4% (újrafelhasználja korábbi feladatok példáit),
  • SLCA: 69.9% (magasabb tanulási rátát alkalmaz a kimeneti rétegekben, alacsonyabbat a korai rétegekben),
  • Elastic Weight Consolidation: 66.1% (bünteti a korábbi feladatok szempontjából fontos súlyváltozásokat).

A szerzők módszere közel nulla felejtést produkált: az előzőleg megtanult feladatokon az átlagos sikeresség mindössze 0.3 százalékponttal csökkent. Ez jobb eredmény a Elastic Weight Consolidation 0.7 százalékpontos, és a Dark Experience Replay 4.7 százalékpontos felejtésénél, valamint összevethető a SLCA‑val (−0.6, ahol a negatív érték javulást jelez).

További öt, a tréning során fel nem használt libero‑spatial feladaton a módszer 57.1 százalékos átlagos sikerességet ért el, ami meghaladta az Elastic Weight Consolidation (52.6%) és Dark Experience Replay (55.2%) eredményeit.

A szerzők azt is megmutatták, hogy ha bármelyik komponens (nagy előre‑tanított modell, LoRA vagy GRPO) eltávolításra kerül, a teljesítmény összeomlik és erős felejtés lép fel.

Korlátozások és további megfontolások

A cikk összehasonlításai során a szerzők a korábbi módszerekhez is hozzáadták a LoRA‑t és a GRPO‑t az LIBERO adatkészleten, hogy méltányos összevetést kapjanak. Ugyanakkor ezek a korábbi megközelítések nem feltétlenül úgy lettek tervezve, hogy kombinálják ezeket a technikákat vagy ugyanazt az adatfelhasználási módot kövessék, így nyitott kérdés, hogyan teljesítettek volna eredetileg tervezett beállításokkal.

Például a Dark Experience Replay alapötlete az, hogy újra‑bevezeti a korábbi feladatok példáit a finomhangolás során; a LoRA alkalmazása megváltoztathatja, hogyan tanul egy modell új feladatokat, és így befolyásolhatja az összehasonlítást.

Miért fontos ez?

A teljes feladatkészlet egyszerre történő betanítása gyakran jó eredményt ad, de megköveteli, hogy a jövőbeli feladatok előre ismertek legyenek. Amikor a feladatok változnak, vagy folyamatosan új feladatok érkeznek, hasznos lehet a soros, egymás utáni finomhangolás, miközben megőrizzük a korábban tanultakat. A szerzők megközelítése egyszerűbb és az általuk vizsgált feltételek mellett hatékonyabbnak bizonyult a korábbi módszerekhez képest. A tanulmány azonban nem vizsgálta, hogy az eljárás mennyire általánosítható a robotikán kívüli alkalmazásokra.

Összegzés

LoRA és on‑policy megerősítéses tanulás (GRPO) kombinálása nagy, előre betanított VLA modellekkel jelentősen csökkenti a soros tanulás során fellépő felejtést a LIBERO benchmark szimulált robotikai feladatain. A módszer magas sikerességi arányt, alacsony felejtést és jobb általánosítást mutatott néhány feladatnál összehasonlítva több meglévő megközelítéssel, miközben a komponensek eltávolítása jelentős romlást idézett elő.