Az NVIDIA bemutatta a SkillEvaluator nevű, nyílt forráskódú mérőeszközt, amely azt mutatja meg, hogy az úgynevezett "Skills" — azaz előre csomagolt utasítások, példák és eszközhasználati útmutatók — hogyan változtatják meg az AI-ügynökök viselkedését és eredményeit. A cél az, hogy az ügynökök gyorsabban és hatékonyabban jussanak el a felhasználói szándéktól a megoldásig, kevesebb felesleges lépéssel és kevesebb tokenpazarlással.
Mi az a Verified Skill?
A Verified Skills az NVIDIA által csomagolt és aláírt képességleírásokat jelenti: definiálják, hogy egy NVIDIA-termék mit csinál, mikor kell meghívni, és hogyan kell használni azt. A "verified" státusz annak a mérésnek az eredménye, amely igazolja, hogy a skill készen áll a használatra.
Módszertan — hogyan értékelnek a Skill-eket
A SkillEvaluator három, egymástól függetlenül futtatható értékelési rétegen vezeti át a készségeket:
- Tier 1 — Safety és szerkezet: statikus ellenőrzések történnek (séma- és frontmatter-validáció, minőségi pontozás), prompt injection és adatkivitel-ellenőrzés, titkok és PII észlelése, licencellenőrzés és script lintelés.
- Tier 2 — Distinctiveness: beágyazás-alapú hasonlóságvizsgálat mutat rá duplikált irányelvekre egy skillen belül és átfedésekre a katalógusban.
- Tier 3 — Live evaluation: élő, elszigetelt sandboxokban futtatott összehasonlító értékelés az ügynökkel, egyszer a skill telepítésével, egyszer nélküle, majd a különbség mérése.
A Tier 3 futtatásához a SkillEvaluator a Harbor nevű, nyílt forráskódú keretrendszert használja, amely ismételhető, izolált környezetekben indítja a feladatokat. A rendszer minden esetben kontrollált összehasonlítást végez: ugyanaz a prompt, modell, feladatinput és értékelési kritérium használatos a két futtatás során; az egyetlen változó, hogy telepítve van-e a skill.
Minden skill értékelését két, egymástól független ügynökhámor (harness) ellenőrzi; a skill hozzájárulását pontokban adják meg, ez a Skill Lift (with-skill score mínusz without-skill score).
Példa a munkafolyamatra
A SkillEvaluator parancssoros eszközzel generál értékelési adatállományt (például skillevaluator create-eval-dataset ./my-skill --full), majd a Tier 3 összehasonlítást indítja (például skillevaluator tier3 evaluate ./my-skill --agents codex --env-mode docker). A SkillEvaluator átalakítja az eseteket Harbor-t képes feladatcsomaggá, lefuttatja mindkét környezetet, pontoz és Skill Liftet számol.
Élő értékelési eredmények — mérési alapok
A közzétett eredmények az NVIDIA/skills adattár benchmarks.json fájlának 2026. augusztus 12-i pillanatfelvételén (commit 738d79e) alapulnak. Az átlagok makroátlagoltak: minden skill–harness pár egyenlő súllyal szerepel.
A Skill Lift a with-skill és a without-skill pontszámok különbsége, pontokban kifejezve. A katalógust folyamatosan értékelik; a jelenlegi számok a nvidia/skills repository benchmarks.json fájljában érhetők el.
Baseline (without-skill) eredmények
A snapshotban a Codex és a Claude Code harnesssel végzett without-skill futtatások átlagai a következők voltak (pontszám 0–100):
- Correctness (Helyesség): 46
- Discoverability (Felfedezhetőség): 42
- Effectiveness (Hatékonyság a cél elérésében): 39
- Efficiency (Hatékonyság a lépésekben): 43
- Security (Biztonság): 97
A Security kivételként magas bázisszintet mutatott, mert itt elsődleges cél az volt, hogy a skill telepítése ne vezessen biztonsági regresszióhoz.
Ismert korlátok a basline értelmezésében
A Correctness, Effectiveness és Security a futás kimenetelét méri, így a bázisszámok azt mutatják, mit képes az ügynök skill nélkül elérni. A Discoverability és az Efficiency részben azt is értékeli, hogy a skill miként aktiválódik és használódik — ezek hiányában az ügynök nem tudja elvégezni ezeket a skill-specifikus lépéseket, de még kaphat pontot produktív eszközhasználatért vagy a skill nem aktiválásáért releváns helyzetben. A legtöbb skill egy próbálkozással lett értékelve: a publikált eredmények 85%-ánál 1 próbálkozás, 15%-ánál 2 volt.
With-skill eredmények és Skill Lift
Ugyanezen értékelések with-skill futtatásai mellett a következő átlagok és Skill Lift értékek születtek (pontokban):
- Correctness: without 46 → with 87 | Skill Lift +41
- Discoverability: without 42 → with 82 | Skill Lift +40
- Effectiveness: without 39 → with 78 | Skill Lift +39
- Efficiency: without 43 → with 78 | Skill Lift +35
- Security: without 97 → with 98 | Skill Lift +1
Átlagosan minden dimenziót figyelembe véve a Skill Lift +31 pont; a Securityt kizárva az átlag +39 pont.
Az eredmények azt jelzik, hogy a verified skills jelentősen javítják az ügynökök teljesítményét a mért dimenziókban, különösen a helyesség, a felfedezhetőség és az egész feladatvégrehajtás hatékonysága terén. A Discoverability és Efficiency eredmények azt is jelzik, hogy a skill valóban aktiválódik és használódik megfelelően, amikor jelen van.
Skill Lift harnessenként
A két értékelő környezet eltérő eredményt adott:
- Claude Code — átlagos Skill Lift minden dimenzióra: +34; Security nélkül: +42
- OpenAI Codex — átlagos Skill Lift minden dimenzióra: +29; Security nélkül: +36
A különbség várható: a harness-ek különböző alapértelmezett rendszerpromptokat, kontextuskezelést és eszközhívási implementációkat használnak; a verified skill strukturált groundingot ad, amit egyik harness sem biztosít automatikusan.
Partnerpilóták és integrációk
Több partner pilótafuttatást végzett a SkillEvaluator köré építve:
- OpenClaw a ClawHubon belül pilotálja a SkillEvaluator Tier 3 értékeléseit és megjeleníti a with-skill és without-skill eredményeket egy Evals fülön.
- Nous Research a Hermes Agent-ben próbálta ki a SkillEvaluator-t, kiegészítve egy opcionális SkillSpector ellenőrzéssel a telepítési folyamatban. A SkillSpector vizsgál PII-t, Unicode-smugglinget, script lintelést, licenc- és biztonsági kérdéseket, és fájl-sor szintű hibajelzéseket ad. A munkafolyamatot 29 sikeres teszt fedi, és egy skill vizsgálata nagyjából 1,4–1,5 másodpercet vesz igénybe.
Gyakorlati megállapítások
Az NVIDIA cikk három fontos, gyakorlati következtetést emel ki:
- Jobb értékelési adathalmazok jobb skillekhez vezetnek: a pontosan megfogalmazott feladatok, elvárt kimenetek és kizárt kérdések élesebb értékelési jeleket adnak még agent-futtatások előtt.
- A termék (a domain és a feladat) fontosabb, mint maga az ügynök: Skill Lift termékek szerinti eltérése nagyobb, mint a harness-ek közti különbség; termékenként a Skill Lift körülbelül +2-től +46 pontig terjedt.
- A token-megtakarítás nem automatikus: a SkillEvaluator külön méri a tokenhasználatot. Két konkrét példából az egyik, a jetson-optimize-memory skill, csökkentette a tokenfelhasználást 617,306-ról 142,540-re (76,9%) és a futási időt 474,9-ról 220,0 másodpercre (53,7%). Ezzel szemben a cuopt-install skill növelte a tokenfelhasználást 25,227-ről 55,582-re (120,3%) és a futási időt 34,0-ről 41,1 másodpercre (20,8%), jelezve további optimalizációs lehetőségeket.
Hogyan kezdjen hozzá
A SkillEvaluator dokumentációja és az NVIDIA verified skills katalógusa elérhető a GitHubon, ahol a fejlesztők megtekinthetik a hitelesített skilleket és a benchmark-adatokat.
Köszönetnyilvánítás
Az NVIDIA köszönetét fejezi ki Roshni Malani, Meghana Puvvadi, Subodh Prabhu, Mohit Gupta, Yogesh Dangi, Yashraj Basaravaj Patil, Keshav Pradeep, Siddharth Itagi, Alejandro Sanabria Portala és Pranita Maske hozzájárulásáért.



