A smevals egy kisméretű értékelő keretrendszer, amely modellek, promptok és futtató-harnezsek (harnesses) tesztelésére készült. A fejlesztő a Jesse Vincent által vezetett Prime Radiant applied AI research lab együttműködésében dolgozott a projekten, azzal a céllal, hogy egyszerűbbé tegye különböző modellek képességeinek összehasonlítását.
Mire képes a smevals?
- Lehetővé teszi kis értékelő csomagok (eval suite) létrehozását és futtatását különböző modellkonfigurációkon.
- Az értékelések definíciója egy mappastruktúra, amely YAML fájlokból áll; ez adja meg a teszteket és az értékelési szempontokat.
- A futtatás és az értékelés két lépésben történik: először a modell(ek) ellen lefuttatott runokat gyűjti össze, majd azokat külön lehet osztályozni (grade) a definiált ellenőrzések alapján.
- A lefuttatott eredményeket lokálisan meg lehet nézni egy webfelületen, vagy statikus HTML riportként is elő lehet állítani, amit bárhol hosztolni lehet.
Használati példák (parancsok)
A blogbejegyzés rövid útmutatójából a legfontosabb parancsok:
- "uvx smevals docs" — kiadja a README tartalmát, az eszköz megismeréséhez.
- "uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6" — futtat egy megadott eval csomagot több modellel párhuzamosan.
- "uvx smevals grade path-to-eval/" — értékeli a korábbi futtatásokat a definiált ellenőrzések (checks) szerint.
- "uvx smevals serve path-to-eval/" — helyi webszolgáltatást indít az eredmények böngészéséhez.
- "smevals build" — statikus HTML riportot készít az értékelésről.
Példa használat és célok
A szerző például egy olyan eval csomagot készített, amellyel modellek haikukat írási képességét tesztelte. A smevals harmadik iteráció egy több éve keresett megközelítés az értékelések struktúrájára; a készítő elégedett az iránnyal és tervezi a keretrendszer további bővítését, valamint saját projektjeire történő alkalmazását.
Miért számít ez?
A kis, könnyen konfigurálható értékelőcsomagok gyors visszajelzést adhatnak a modellek viselkedéséről és prompt-változtatások hatásáról anélkül, hogy nagy, nehezen kezelhető infrastruktúrát kellene építeni. A smevals kiterjeszthető formátuma (YAML alapú evalok) és a futtatás/értékelés szétválasztása segíti az ismételhetőséget és az eredmények rendszerezését.
Kapcsolódó címkék
projects, ai, generative-ai, llms, llm, evals, jesse-vincent



