Az Every Eval Ever (EEE) és a Hugging Face Community Evals rendszerei mostantól kölcsönösen kompatibilisek: az EEE által szabványosított JSON-formátumú értékelési rekordok automatikusan átalakíthatók a Hugging Face Hubon használt .yaml fájlokká. A cél, hogy az értékelési eredmények egyazon, megtalálható és értelmezhető adatszolgáltatásba kapcsolódjanak, miközben megmarad a link a nyers, részletes EEE rekordokra.
Miért fontos ez
Az értékelési eredmények határozzák meg a modellek képességeinek mérését, az összehasonlítást és a biztonság- vagy kormányzati döntésekhez szükséges érvelést. Jelenleg a mérések szétszórtan, különböző formátumokban élnek: cikkekben, leaderboardokon, blogokban és harness-logokban. Ugyanaz a modell ugyanazon benchmarkon eltérő pontszámokat mutathat a futtatási környezettől és a beállításoktól függően — például a LLaMA 65B MMLU-eredményéről 63.7 és 48.8 is megjelent a szakirodalomban. Az eltérések oka gyakran az értékelési beállítások hiányos vagy következetlen jelentése.
EEE-t az EvalEval Coalition részeként indították 2026 februárjában, míg a Hugging Face Community Evals szintén 2026 februárjában indult a Hubon a benchmark-pontszámok decentralizált gyűjtésére és megjelenítésére. Együtt ezek a rendszerek csökkentik a bizonytalanságot abban, hogyan bízzanak, értelmezzenek és válasszanak a felhasználók, kutatók és döntéshozók értékeléseket és modelleket.
Mit rögzít az EEE séma
Az EEE egy egységes JSON-séma az értékelési eredmények jelentésére. Rögzíti többek között:
- ki futtatta az értékelést
- melyik modellről van szó
- hogyan fértek hozzá a modellhez
- a generálási beállításokat
- mit jelent pontosan a mért metrika
- opcionálisan egy companion JSONL fájlt mint per-példa kimenetek
A sémát kutatói és policy-visszajelzések alapján alakították ki, és képes befogadni eredményeket tetszőleges forrásból (harness-logok, leaderboard-scrape-ek, papercikkek számadatai stb.), így minden egységes formátumban tárolható. A GitHub-tárház tartalmazza a konvertereket, példákat és hozzájárulási útmutatót.
Méretek és megtakarítások
A Hugging Face-en tárolt EEE datastore a bejelentés szerint körülbelül 229 000 értékelési eredményt tartalmaz több mint 22 000 modellen és 2 200 benchmarkon, 31 különböző jelentési formátumból gyűjtve. Ezek újrafuttatása a forrástól függően több százezer dollárba kerülne, így a meglévő eredmények megőrzése és standardizálása költséghatékony megoldás.
Hogyan működik a két rendszer együtt
A Hugging Face Community Evals két fő részből áll:
- A benchmarkok egy dataset repo-ban regisztrálják magukat egy eval.yaml fájllal, és a dataset oldalán gyűjtő- és megjelenítő leaderboard alakul ki minden Hubon jelentett pontszámra. Az "official benchmarks" listája idővel bővül.
- A modellek pontszámai a modell repójában .eval_results/*.yaml fájlokban élnek; ezek megjelennek a model cardon és bekerülnek a kapcsolódó benchmark leaderboardjába. Mind a modell szerzőjének saját eredményei, mind a közösségi PR-ekkel beküldött eredmények aggregálódnak; minden pontszám jelölést visel arra vonatkozóan, hogy szerzői, közösségi vagy függetlenül ellenőrzött-e.
A kapcsolat úgy működik, hogy amikor egy eredményt mindkét rendszerbe elküldenek, a pontszám megjelenik a Hugging Face model oldalon és a benchmark leaderboardon, és ugyanakkor egy forrás-badge mutat vissza a teljes EEE rekordhoz, ahol megtalálhatók a generálási konfigurációk, a harness verzió, reprodukálhatósági jegyzetek és az esetleges per-példa adatok.
Amikor a szervezet hivatalos Hugging Face fiókján keresztül küldik be az adatokat, az EvalEval oldalán megjelenik egy verified jelzés, ami jelzi az olvasóknak, hogy az adatok közvetlenül a forrástól származnak.
A konverter és működése
A központi eszköz a community eval converter, amely az EEE JSON rekordokat átalakítja a Hugging Face által elvárt kis YAML fájlokká. A konverter a következő mezőmapparokat használja például:
- source_data.hf_repo -> dataset.id
- evaluation_name -> task_id
- score_details.score -> value
- evaluation_timestamp -> date
A konverter beleteszi továbbá az EEE datastore objektum URL-jét a source blokkba, ami a visszahivatkozást biztosít. Jelenleg négy hivatalos benchmarkot kezel: MMLU-Pro, GPQA, HLE és GSM8K.
A konverter többet csinál, mint mezők átrendezése:
- Letölti a megadott EEE datastore collectiont és a hivatkozott objektumokat, ellenőrzi a hash-eket és kiválasztja a támogatott benchmarkoknak megfelelő pontszámokat.
- Auditálja, mi található már a model repo .eval_results YAML-jeiben a főágon és nyitott PR-ekben; összehasonlít dataset és task alapján.
- Kategorizálja az eseteket: already_present, score_conflict, missing_hf_model vagy ready.
- Semmit sem tol fel automatikusan: a tool helyi YAML-előnézeteket és egy átnézési riportot ír, és csak akkor nyit PR-eket, ha a felhasználó expliciten beírja az OPEN PRS parancsot és megad egy commit-üzenetet.
A konverter újrafuttatása újrahasznosítja a korábban cache-elt eredményeket, hacsak nem adják meg a --force opciót.
Hogyan kezdjen hozzá egy hozzájáruló
- Küldje be a teljes rekordjait az EEE datastore-ba.
- Használja a community eval converter eszközt a GitHub-tárházból. Példa parancs egy collection feldolgozására:
uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro
--datastore evaleval/EEE_datastore@main
- Nézze át a generált előnézeteket és riportot, majd írja be az OPEN PRS parancsot a PR-ek megnyitásához.
A teljes dokumentáció a séma, CLI és konverterek használatáról elérhető az evalevalai.com/every_eval_ever/hf-community-evals oldalon.
Összegzés
A két rendszer összekapcsolása azt jelenti, hogy ugyanannak az értékelésnek a ponteredménye egyszerre lesz látható a Hubon és visszakövethető a teljes, strukturált EEE rekordig. Ez csökkenti a széttagoltságot, javítja az átláthatóságot és segíti a reprodukálhatóságot anélkül, hogy az eredeti adatok kézi formátummásolására lenne szükség.



