Kutatás

Az Alibaba SkillWeaver keretrendszere célzott eszközválasztással csökkenti a tokenhasználatot és javítja a többlépéses műveletek pontosságát

Az Alibaba kutatói által fejlesztett SkillWeaver egy olyan keretrendszer, amely végrehajtási gráfot készít egy összetett feladathoz és kiválasztja a megfelelő készségeket (skill) a gráf egyes csomópontjaihoz.

Az Alibaba SkillWeaver keretrendszere célzott eszközválasztással csökkenti a tokenhasználatot és javítja a többlépéses műveletek pontosságát

Az Alibaba kutatói egy SkillWeaver nevű keretrendszert fejlesztettek ki az üzleti AI-ügynökök eszközválasztási problémájának kezelésére. A probléma lényege, hogy a vállalati ügynökök sokszor több száz „skill” — moduláris, újrahasznosítható eszközspecifikáció — között kell, hogy megtalálják az adott munkalépéshez legmegfelelőbbet. Ha egy LLM-nek az egész könyvtárat beadjuk, az kontextusproblémákat és óriási tokenfelhasználást okoz, továbbá gyakran tévesen választ.

Hogyan működik a SkillWeaver

A SkillWeaver három szakaszra bontja a feladatot: Decompose (felbontás), Retrieve (kiválasztás), Compose (összeszerelés).

  • Decompose: egy 7 milliárd paraméteres Qwen2.5-7B-Instruct típusú modell felbontja a komplex feladatot egymást követő, „atomikus” alfeladatokra.
  • Retrieve: beágyazás-alapú keresés (alapként all-MiniLM-L6-v2, FAISS index) minden alfeladathoz előhozza a top jelölt skilleket.
  • Compose: egy tervező összeveti a jelölteket, ellenőrzi az inter-skill kompatibilitást és egy végrehajtható Directed Acyclic Graph (DAG) formájában állítja össze a végső munkafolyamatot.

A rendszer célja, hogy egymásra épülő, többeszközös üzleti műveleteket (például adatok letöltése → transzformálása → vizualizáció készítése) automatikusan és hatékonyan hajtson végre.

Skill-Aware Decomposition (SAD)

A SkillWeaver egyik fő újítása az Iterative Skill-Aware Decomposition (SAD) visszacsatolási hurkok alkalmazása. A folyamat úgy működik, hogy az LLM először vázol egy kezdeti felbontást, a rendszer előzetesen keresést futtat, majd a megtalált, lazán illeszkedő skilleket visszajátssza az LLM-nek mint „tipp”. Ennek hatására az LLM átírhatja a felbontást úgy, hogy a lépések granuláris szintje és szókincse jobban megfeleljen a valós, elérhető eszközöknek. Ez az iteratív retrieve-and-rewrite megközelítés megkülönbözteti a SkillWeavert azoktól a rendszerektől, amelyek egyszeri, one-shot eszközválasztást alkalmaznak.

Kísérleti eredmények és mérőszámok

A kutatók egy CompSkillBench nevű benchmarkot állítottak össze 300 többlépéses lekérdezéssel, és egy 2,209 valós skillből álló könyvtárral, amely 24 funkcionális kategóriát fed le (például cloud infrastruktúra, pénzügy, adatbázisok). Főbb eredmények:

  • A 7B-es modell vanilla (SAD nélkül) felbontási pontossága 51.0% volt; SAD bekapcsolásával ez 67.7%-ra nőtt.
  • Egy nagyobb Qwen-Max modellnél a SAD mellett a pontosság 92%-ig emelkedett a mérés szerint.
  • Nehéz feladatoknál (négy-öt különálló skill szükséges) a SAD alkalmazása 50%-os javulást hozott.
  • Egy váratlan megfigyelés: nagyobb modellek vezérelés nélkül túlgranolhatnak, és túl sok, felesleges apró lépést írhatnak — ez rontotta a 14 milliárd paraméteres modell teljesítményét vanilla környezetben a 7B modellhez képest. SAD viszont „lehorgonyozta” a modellt a tényleges eszközszókincshez.
  • A ReAct-stílusú baseline teljesen megbukott: 0% felbontási pontosság.

Tokenfelhasználás és költség:

  • Az LLM-Direct baseline (amikor egy hatalmas modellbe az összes eszköz bekerül) körülbelül 884,000 token kontextust igényelt lekérdezésenként. SkillWeaver módszere azonosítási és végrehajtási folyamattal nagyjából 1,160 token körüli kontextust használt — ez mintegy 99.9% csökkenés.
  • Ez közvetlenül alacsonyabb API-költséget és gyorsabb válaszidőt jelent a gyakorlatban.

Beágyazási és indexelési tapasztalatok:

  • Az alap beágyazó modellként all-MiniLM-L6-v2-t használták; a BGE-base-en-v1.5-re váltás azonnal javította a pontosságot.
  • Egy off-the-shelf bi-encoder képes a releváns eszközt a top10-be hozni ~70%-ban, de a legtökéletesebb eszközt konzisztensen az első helyre helyezni csak ~37%-ban sikerül; ezért ajánlott egy másodlagos cross-encoder vagy LLM-alapú reranker.
  • A 2,209 skill beágyazása és FAISS index építése a kísérletben mindössze ~15 másodpercet vett igénybe; a lekérdezési késleltetés indexből <15 ms.

Működési korlátok és gyakorlatias megfontolások

A szerzők egyelőre nem publikálták a SkillWeaver forráskódját, de az architektúra off-the-shelf komponensekre épül, és reprodukálható standard könyvtárakkal (például LangChain, LlamaIndex vagy sima Python). Kulcspontok fejlesztők számára:

  • A SAD lényegében prompt-engineering és retrieve-loop megoldás — a prompt sablonokat a papírban megosztották.
  • Előfeltételként szükséges a tool-könyvtár vektoros indexelése (például FAISS), ami gyakorlatilag alacsony költségű előkészítés.
  • A jelenlegi hiányosság: a rendszer nem tartalmaz beépített hibakezelést vagy visszaállító logikát. Ha egy köztes API-hívás meghiúsul, az egész lánc összeomolhat. A cikk hozzájárulása a routingra és tervezésre koncentrál; a gyártásba vitelhez érdemes külön retry/fallback/compensation réteget építeni a Compose szakasz fölé.

Összegzés

A SkillWeaver egy gyakorlati megközelítést mutat be a több-eszközös, többlépéses üzleti feladatok automatizálására: a feladatok iteratív felbontása és a visszacsatolt eszköz-javaslatok kombinációja jelentősen növeli a pontosságot és drasztikusan csökkenti a tokenfelhasználást. A módszer különösen hasznos lehet olyan vállalati környezetekben, ahol nagy eszközkönyvtárak és szigorú költség- vagy kontextuskorlátok vannak jelen, ugyanakkor a teljes gyártási megoldáshoz további hibakezelési és robusztussági komponensek szükségesek.