Ez a cikk Sharon Zhou sorozatának harmadik része a poszt-tréningről; az első két részt korábban közölte, a sorozat zárócikke pedig október 7-én jelent meg/lesz meg. Itt azt vizsgáljuk meg, mit értettek el a poszt-tréning módszerei a nagy határmodell( frontier) rendszereknél, amelyekről ma is beszélünk.
A poszt-tréning gyakorlati hatásai
A poszt-tréning volt az, ami a nyers, előre betanított nyelvi modelleket — például a GPT-3-at — valódi beszélgetőpartnerként és asszisztensként használható rendszerekké alakította. Jó példa: míg a GPT-3 korábban gyakran adott értelmetlen választ egy egyszerű kérdésre, például "Miért szeretik az emberek a golden retrievereket?", a ChatGPT (2022 novemberi indulás) már következetesen értelmes, udvarias választ adott: „Mert szeretetteljesek, türelmesek és kiváló családi kedvencek”, függetlenül attól, ki gépelte be a kérdést.
A poszt-tréning hatásai több területen jelentkeznek:
-
Beszélgető készség és hasznosság: a modellek képesek többfordulós párbeszédeket fenntartani, kérdéseket pontosítani, a hangnemet és részletességet a kontextushoz igazítani, és nem „elveszíteni a fonalat” hosszabb interakciók során. Kezeli a való világ rendezetlen bemeneteit is (például nagy PDF-ek keresése) anélkül, hogy kitalált választ adna.
-
Biztonság és illeszkedés (alignment): a poszt-tréning a fő eszköz arra, hogy a modellek visszautasítsanak káros kéréseket, elkerüljék a torz vagy diszkriminatív kimeneteket, csökkentsék a „hallucinációkat” (történetek kitalálását) és tiszteletben tartsák a felhasználói adatvédelmet. A biztonsági szabályokat azonban a fejlesztő csapat határozza meg, és csak annyira taníthatók meg, amennyire ezek kifejezhetők jutalmi jelekkel.
-
Eszközhasználat és funkcióhívás: a poszt-tréning tanítja meg a modelleket külső eszközök (keresők, API-k, kalkulátorok, adatbázisok, kódinterpretrák) felismerésére és helyes meghívására. Ez különösen fontos például egy állatorvosi időpontfoglaló ügyfélszolgálati asszisztensnél: a poszt-tréninget követően a modell egy valódi foglalási API-t hívhat, ellenőrzi Dr. Patel elérhetőségét, és pontos visszajelzést ad a felhasználónak ahelyett, hogy kitalálna órákat.
-
Gondolkodó (reasoning) képességek: a poszt-tréning lehetővé teszi, hogy a modellek „láncolt gondolkodást” (chain of thought) generáljanak, vagyis belső, többlépéses számítási folyamatot futtassanak mielőtt választ adnak. Az ilyen modellek sokkal jobbak multistep logikát igénylő feladatokban (matematika, komplex kódolás, tudományos elemzés, tervezés).
Konkrét eredmények: a 2024-es AIME vizsgán a GPT-4o átlagosan 12%-ban oldott meg feladatokat, míg OpenAI o1 reasoning modellje azonnal 74%-ot ért el; 1,000 kísérlet és egy tanult rangsorolási függvény alkalmazásával 93%-ra jutott — ez a teljesítmény az AIME-t megíró diákok felső ~500 helyezettje közé teszi.
A klasszikus ChatGPT poszt-tréning-pipeline (InstructGPT modellje alapján)
A ChatGPT-t világszerte ismertté tevő poszt-tréning-pipeline az InstructGPT tanulmányon alapult. Bár a modern rendszerek ma már fejlettebb megközelítéseket is alkalmaznak, ez a háromlépéses séma továbbra is a legtöbb illesztési módszer fogalmi alapja:
- Supervised fine-tuning (SFT) emberi demonstrációkon
- Jutalommodell (reward model) képzése emberi preferencia-összehasonlítások alapján
- Reinforcement learning with human feedback (RLHF) a fő modell optimalizálására a jutalommodell használatával
1) SFT — demonstrációkon alapuló felügyelet
Az SFT célja, hogy a modell megtanuljon utasításokat követni és asszisztens-szerűen viselkedni. OpenAI körülbelül 40 emberi címkét alkalmazott, akiket gondosan szűrtek a káros kimenetek felismerésére. A címkézők ideális válaszokat írtak promptokra; a promptok két forrásból jöttek: (1) valós felhasználók API-n keresztül beküldött promptjai és (2) maguk a címkézők által megírt promptok. Az SFT adatkészlet nagyjából ~13,000 promptot tartalmazott emberi válaszokkal. A GPT-3 alapmodellt SFT-vel 16 epochon keresztül tanították — érdekes módon az SFT egyszerűen túl tudott illeszkedni már 1 epoch után, de mint köztes fázis, a 16 epochos tréning jó kiindulópontnak bizonyult a későbbi RLHF-nek. Emellett az SFT fázis során 10% pretraining adatot is kevertek be.
2) Jutalommodell — preferenciaadatokból
A jutalommodellnek képesnek kell lennie millióknyi választ osztályozni az RL fázis alatt. OpenAI kezdetben főként az SFT-modellből származó válaszok páros összehasonlításait használta: egy promptnál több (4–9) választ generáltak, a címkézők rangsorolták azokat, és a rangsorokat párösszehasonlításokká alakították át (N válaszból N-choose-2 pár). Például 33K prompt és 4–9 válasz promptonként 200K–1.2M párösszehasonlítást biztosított a jutalommodell betanításához. A jutalommodell viszonylag kicsi volt (6 milliárd paraméter) a stabilitás és számítási hatékonyság érdekében, és egy skalárt adott vissza jutalomként.
A jutalommodell képzésekor fontos probléma volt a túlillesztés; ezért gyakran csak 1 epochot tanítottak. Emellett a pár-készletek korrelációja miatt a párokat promptonként egy egységként dolgozták fel a batchben, hogy stabilabb és hatékonyabb legyen a tanítás.
3) RLHF — megerősítéses tanulás emberi visszajelzéssel
Miután van egy SFT modell és egy jutalommodell, a cél az SFT modell továbbfinomítása úgy, hogy a jutalommodell által magasra pontozott válaszokat adja. A használt RL algoritmus a PPO volt. A lépések röviden:
- Válassz egy promptot (OpenAI 31,000 promptból dolgozott, melyeket API-val gyűjtöttek)
- Generáltass a jelenlegi politikával egy-vagy több választ (rolloutok)
- A jutalommodell osztályozza a teljes választ; minden token pozícióhoz per-token jutalom képződik a jutalommodell pontszáma és egy per-token KL divergencia büntetés összegeként, amely a jelenlegi politikától való eltérést méri az eredeti SFT modellhez képest
- A kritikus (value/critic) becsléseivel és a GAE-vel számolják az előnyt (advantage)
- PPO frissíti a politikát a magasabb előnnyel járó rolloutek felé
- Frissítik a critic-et, és opcionálisan új preferenciaadatokat gyűjtenek a jutalommodell további képzéséhez
A KL-büntetés megakadályozza az úgynevezett „reward hacking”-et, amikor a politikai modell olyan furcsa vagy kicselező kimeneteket talál, amelyek magas jutalmat adnak, de nem hasznosak. A végső RL célfüggvény három elemet kombinál: (1) maximalizálni a jutalommodell pontszámát, (2) maradni közel az SFT modellhez KL-pénzbüntetéssel, és (3) fenntartani a pretraining teljesítményt, hogy elkerüljék a képességek elvesztését (catastrophic forgetting).
Gyakorlati részletek és költségek
Az RLHF számításigénye nagy: egy időben futó modellek (policy, critic, reward model, SFT referencia) jelentős GPU memóriát igényelnek. Ezért tartották a reward és critic modelleket kisebb méretben (6B). A PPO-tréning friss rolloutekat igényel és lassabb, mint az SFT, továbbá sok hiperparaméter (tanulási ráta, KL-súly, batch-méret, clipping) érzékenyen befolyásolja az eredményt.
Emellett fontos megjegyezni: az értékelő címkézők, akik a végső modelleket tesztelték, gyakran ugyanazokból a személyekből álltak, akik a tréningadatokat létrehozták. Amikor független, „held-out” értékelőkkel teszteltek, az RLHF iránti preferencia továbbra is pozitív volt, de kevésbé drámai — a modell részben optimalizálódott egy specifikus annotátori csoport preferenciái szerint.
Mire volt jó mindez a gyakorlatban?
Az InstructGPT/ChatGPT pipeline minden egyes lépése érezhető javulást hozott a válaszok minőségében: az emberek általában a RLHF modellek kimeneteit előnyben részesítették az SFT modellekével szemben, és az SFT modellekét a nyers GPT-3-hoz képest. Egy különösen feltűnő eredmény: kísérleti körülmények között még egy kis, 1.3 milliárd paraméteres RLHF modell is gyakran felülmúlta a 175 milliárd paraméteres SFT-only modellt — erős bizonyítékot adva arra, hogy a képzési eljárás legalább olyan fontos, mint a modell mérete.
A poszt-tréning tehát kulcsfontosságú volt abban, hogy a modellek segítőkészebbek, biztonságosabbak, kevésbé hajlamosak veszélyes vagy kitalált válaszokra, és új képességekkel (eszközhasználat, gondolkodás) gazdagodjanak — ugyanakkor jelentős mérnöki, adat- és számítási befektetést igényelnek, és döntéseket (pl. hol húzzuk meg a biztonsági határokat) emberek hozzák meg a laborokban.
Kérdésed van a poszt-tréning technikai részleteiről vagy a gyakorlati alkalmazásokról? Szívesen kifejtem részletesebben az RLHF-hez, a jutalommodellekhez vagy az eszközintegrációkhoz kapcsolódó technikákat.



