Eszközök

NVIDIA Nemotron 3 Nano testreszabása Prime Intellect Lab segítségével: gyors RL-alapú LoRA adapter létrehozása

A cikk főszereplői az NVIDIA Nemotron 3 család és a Prime Intellect Lab platform, amelyek együtt lehetővé teszik a modellek gyors testreszabását.

NVIDIA Nemotron 3 Nano testreszabása Prime Intellect Lab segítségével: gyors RL-alapú LoRA adapter létrehozása

A testreszabás lehetővé teszi, hogy egy általános nyelvi modellt egy adott feladatra, domainre vagy nyelvre hangoljunk. Ez azonban infrastruktúrát, technikai ismereteket, speciális szoftvert és GPU-erőforrásokat igényel, valamint domain-specifikus döntéseket (milyen algoritmust és környezetet használjunk, hogyan mérjük a tanulást). Nyílt modellek, például az NVIDIA Nemotron 3 család (Nemotron 3 Nano, Super, Ultra), és hosztolt szolgáltatások, mint a Prime Intellect Lab, egyszerűbbé teszik a teljes testreszabási kört.

Ez a cikk egy gyakorlati tutorial alapján ismerteti, hogyan lehet a Prime Intellect Lab szolgáltatását használva gyorsan LoRA adaptert készíteni reinforcement learning with verifiable rewards (RLVR) módszerrel a Nemotron 3 Nano modellhez, és hogyan lehet letölthető adaptert kapni. A helyi előkészítés nagyjából 5 percet vesz igénybe.

Mit építünk fel és miért számít

A bemutatott munkafolyamat egyszerű: 1) alapértékelés (baseline), 2) tanítás (train), 3) újraértékelés (reevaluate). Példaként a standard „hello world” jellegű feladat a Python Math környezetben szereplő matematikai feladatok megoldása, ahol a modell Python eszközöket (numpy, sympy, scipy) használhat számításokra. A cél: kideríteni, hogy egy rövid, RLVR-alapú finomhangolás után a Nemotron 3 Nano mennyit javul.

Mi a RLVR és a környezet

A reinforcement learning with verifiable rewards lényege, hogy a környezet képes automatikusan ellenőrizni a modell válaszát, és bináris jutalmat ad (1 = helyes, 0 = helytelen vagy hiányzó válasz). A Python Math környezet esetén a rendszer azt kéri, hogy a számításokat Pythonban végezze a modell, és a választ egy \boxed{} jelölésben adja meg. A kísérletben a környezet alapértelmezett maximuma 100 forduló, de a példában minden rolloutot 5 asszisztens fordulóra korlátoznak; egy közvetlen válasz egy forduló, egy eszközhívás és a végső válasz kettőnek számít a keretből, így hátrányos a túl sok eszközhívásra épülő viselkedés.

Előkészületek

Szükséges feltételek:

  • fejlesztői környezet curl-lel és támogatott Python 3-mal;
  • Prime Intellect fiók Hosted Training jogosultsággal és beállított számlázással;
  • internetkapcsolat a Prime CLI, környezeti csomagok és hosztolt modellek eléréséhez;
  • körülbelül 5–15 perc időráfordítás a helyi előkészítésre.

A Prime Intellect kezeli a hosztolt rolloutokat, a tanítást és az inference infrastruktúrát, tehát nem szükséges saját GPU-klasztert üzemeltetni. A live CLI katalógus tartalma és az árak változhatnak, ezért mindig a CLI-t érdemes forrásként használni.

Három lépés a Nemotron 3 Nano testreszabásához

1) Alapértékelés (Get a Baseline)

Először telepítjük a Prime CLI-t, autentikálunk, és létrehozunk egy Prime Intellect Lab munkaterületet. Ez után lekérdezzük és rögzítjük a pontos Math Python környezet verzióját, majd a hosztolt modelleket is ellenőrizzük, hogy elérhető-e a Nemotron 3 Nano (azonosító például: nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16).

A baseline futtatás során a bemutatott példában 32 teszteset szerepel (num-examples 32), max. 5 fordulós rolloutokkal és egy rövid mintavételezési konfigurációval. A korai eredmények azt mutatták, hogy a modell kezdetben gyengén teljesít: a jutalomátlag (reward average) nagyon alacsony, a példában a kezdeti pontosság 21.9% (7/32 megoldott példa).

2) Tanítás (Train) — RLVR LoRA adapter létrehozása

Egy egyszerű TOML konfigurációt hozunk létre, amely meghatározza a modellt, a veszteség típust (rl), a maximális tanulási lépésszámot (a példában 100 step), a batch méretet (32), rollouts_per_example értéket (8) és más alapparamétereket (például learning_rate = 2e-5, lora_alpha = 16). A konfigurációban szerepel a környezetre mutató azonosító (primeintellect/math-python@0.1.10) és a dataset részletei (dataset_name = "math", dataset_split = "train", max_turns = 5).

A parancs elindítása után a Prime CLI megerősítést kér, majd egy futtatás azonosítót (run ID) és dashboard URL-t ad vissza. A dashboard és a CLI mutatja a jutalomgörbéket, eloszlásokat és egyéni rolloutokat. Hasznos ellenőrizni, hogy a jutalomeloszlás változatos-e — ha minden próbálat ugyanazt a pontszámot kapja, nincs jel a tanuláshoz.

A cikkben bemutatott rövid, 100 lépéses tanulási futtatás során a rendszer reward-görbéje láthatóan emelkedett.

3) Értékelés és adapter telepítése (Check how much it learned)

A sikeres futás után a Prime Intellect Lab feltölti a végső LoRA adaptert, amely letölthető és hosztolt inference-re telepíthető. A telepítési folyamat létrehoz egy billable endpointot; amint az adapter állapota DEPLOYED, a végleges modellazonosító a Nano modellhez fűzi az adapter ID-t.

Ugyanazzal az értékelési beállítással, amelyet a baseline-nál használtunk (32 példány, 5 forduló, azonos sampling és környezeti beállítások), újra lefuttattuk az értékelést a finomhangolt adapterrel. Az eredmény a példa szerint jelentős javulás: a jutalomátlag és az accuracynövekedés nagy volt — a pontosság 21.9%-ról 90.6%-ra nőtt (7/32 → 29/32), az abszolút javulás 68.75 százalékpont. A 24 különböző kimenet közül 23 esetben javulás, egy esetben visszalépés volt megfigyelhető. A teljes tanulási költség a példa szerint kevesebb mint 5 dollár volt.

A telepített adapter eltávolítására is volt példa (cleanup parancs), ha nem kívánjuk tovább futtatni a billable endpointot.

Nagyobb modellek tanítása

A bemutatott munkafolyamat ugyanígy alkalmazható a nagyobb Nemotron 3 Super és Nemotron 3 Ultra modellekre: csak a modellazonosítót kell a konfigurációban módosítani, majd megismételni a baseline → train → reevaluate lépéseket. A Prime Intellect katalógusában ellenőrizni kell a rendelkezésre állást és az árazást.

Miért fontos az openness

A nyílt súlyok fontosak, de önmagukban nem elegendőek. Az adatok, validációs kód és tanítási receptek mind befolyásolják, mit lehet megérteni, reprodukálni és telepíteni. Az NVIDIA Nemotron 3 család nyílt erőforrásokkal van közzétéve (súlyok, adatok, receptek), így a fejlesztők beláthatják a modell felépítését és finomítási lehetőségeit.

Összefoglaló

A Prime Intellect Lab használatával egy rövid RLVR-alapú finomhangolási kör lefuttatható Nemotron 3 Nano modellre, amely példában a Python Math feladaton 32 példa alapján 21.9%-ról 90.6%-ra javította az eredményt, alacsony költséggel. A módszer átvihető nagyobb Nemotron 3 modellekre is, és az egész folyamat nyomon követhető, ellenőrizhető és ismételhető, ami megkönnyíti a modellek testreszabását valós feladatokra.

A fejlesztőknek érdemes a Prime Intellect és a Nemotron fejlesztői dokumentációit, tutorialjait és közösségi csatornáit követni további forrásokért és példákért.