Kutatás

Microsoft SkillOpt: szövegesen tanítható ügynök-skill az SKILL.md fájlon keresztül

A főszereplő a Microsoft Research által fejlesztett SkillOpt módszer, amely az ügynökskilljeket szöveges paraméterként, az SKILL.md fájlon keresztül tanítja a modellek súlyainak módosítása helyett.

Microsoft SkillOpt: szövegesen tanítható ügynök-skill az SKILL.md fájlon keresztül

A Microsoft Research bemutatta a SkillOpt nevű módszert, amely lehetővé teszi, hogy ügynök-skilljeit teljes egészében szöveges formában tanítsuk — a hagyományos modellelemek finomhangolása helyett egy SKILL.md fájlt kezelnek tanítható, külső paraméterként.

A megközelítés lényege

  • A célmodell fagyasztott (nem módosított) marad: a modell hajtja végre a feladatokat és rögzíti a pontozott végrehajtási pályákat (trajectories).
  • Egy külön optimizer modell javasol strukturált szerkesztéseket a SKILL.md fájlhoz. Ezek a szerkesztések szöveges utasítások/korrekciók formájában vannak.
  • A szerkesztéseket csak akkor fogadják el, ha a hold-out validáción mért teljesítmény javul.

A folyamat tréninghurokhoz hasonlóan működik: a roll-outok a forward pass-ek, a reflection lépések tekinthetők backward pass-nek, és egy szöveges szerkesztési költségvetés betölti a learning rate szerepét, hogy megakadályozza a romboló átszerkesztéseket.

Eredmények és mérések

A SkillOpt-ot 6 benchmarkon és 7 különböző modellen tesztelték, összesen 52 beállításon; a módszer minden vizsgált esetben a legjobb vagy megosztott legjobb eredményt érte el.

Kiemelt számok:

  • Claude Code célmodell esetén, GPT-5.5 célmodell futtatásakor a SkillOpt-skill átlagosan 18,6 ponttal növelte a teljesítményt a benchmarkok átlaga szerint. A Spreadsheet feladatoknál a javulás +58,3% volt.
  • Kereszt-model és kereszt-harness átvitel: egy Codex-szel tanított skill közvetlenül átvihető Claude Code-ra, és a SpreadsheetBench-en +31,8%-os javulást hoz.
  • Model-verziók közti átviteli példa: egy GPT-5.4-en tanított skill átvihető GPT-5.4-nano-ra és ott is +15,2%-os javulást eredményez.
  • "Self-optimizer" mód: még akkor is, amikor a célmodell saját maga a optimizer, a korlátozott, validált frissítési ciklus hasznos szerkesztéseket talál.

Implementációs és biztonsági megjegyzések

A SkillOpt optimalizálási folyamata a végén egyetlen best_skill.md fájlt exportál. A telepített célmodell (deployment) soha nem látja az optimizer memóriáját, az elutasított szerkesztéseket vagy a tréning állapotát — csak a végleges skill fájlt használja.

Licenc és elérhetőség

A teljes rendszer nyílt forráskódú, MIT licenc alatt került kiadásra.

Miért számít ez?

A megközelítés lehetővé teszi, hogy az ügynökspecifikus viselkedést és eljárásokat natívan szövegként tároljuk és optimalizáljuk, így a skillek átvihetők maradnak modellek és futtatókörnyezetek között anélkül, hogy magukat a modellek súlyait kellene módosítani. Ez újrafelhasználhatóságot, auditálhatóságot és könnyebb verziókezelést ígér a gyakorlati agent-fejlesztésben.

A kutatást és a kódot a Microsoft Research publikálta; az érdeklődők a projekt MIT-licencű forrását letölthetik és kipróbálhatják.