Eszközök

Every Eval Ever és Hugging Face Community Evals összekapcsolása egységes értékelési adatrendszerért

A főszereplők az Every Eval Ever (EEE) projekt és a Hugging Face Community Evals, amelyek most interoperábilisak lettek, lehetővé téve az értékelési eredmények keresztközzétételét és visszalinkelését a nyílt modellekhez és leaderboardokhoz.

Every Eval Ever és Hugging Face Community Evals összekapcsolása egységes értékelési adatrendszerért

Az Every Eval Ever (EEE) és a Hugging Face Community Evals rendszerei mostantól kölcsönösen kompatibilisek: az EEE által szabványosított JSON-formátumú értékelési rekordok automatikusan átalakíthatók a Hugging Face Hubon használt .yaml fájlokká. A cél, hogy az értékelési eredmények egyazon, megtalálható és értelmezhető adatszolgáltatásba kapcsolódjanak, miközben megmarad a link a nyers, részletes EEE rekordokra.

Miért fontos ez

Az értékelési eredmények határozzák meg a modellek képességeinek mérését, az összehasonlítást és a biztonság- vagy kormányzati döntésekhez szükséges érvelést. Jelenleg a mérések szétszórtan, különböző formátumokban élnek: cikkekben, leaderboardokon, blogokban és harness-logokban. Ugyanaz a modell ugyanazon benchmarkon eltérő pontszámokat mutathat a futtatási környezettől és a beállításoktól függően — például a LLaMA 65B MMLU-eredményéről 63.7 és 48.8 is megjelent a szakirodalomban. Az eltérések oka gyakran az értékelési beállítások hiányos vagy következetlen jelentése.

EEE-t az EvalEval Coalition részeként indították 2026 februárjában, míg a Hugging Face Community Evals szintén 2026 februárjában indult a Hubon a benchmark-pontszámok decentralizált gyűjtésére és megjelenítésére. Együtt ezek a rendszerek csökkentik a bizonytalanságot abban, hogyan bízzanak, értelmezzenek és válasszanak a felhasználók, kutatók és döntéshozók értékeléseket és modelleket.

Mit rögzít az EEE séma

Az EEE egy egységes JSON-séma az értékelési eredmények jelentésére. Rögzíti többek között:

  • ki futtatta az értékelést
  • melyik modellről van szó
  • hogyan fértek hozzá a modellhez
  • a generálási beállításokat
  • mit jelent pontosan a mért metrika
  • opcionálisan egy companion JSONL fájlt mint per-példa kimenetek

A sémát kutatói és policy-visszajelzések alapján alakították ki, és képes befogadni eredményeket tetszőleges forrásból (harness-logok, leaderboard-scrape-ek, papercikkek számadatai stb.), így minden egységes formátumban tárolható. A GitHub-tárház tartalmazza a konvertereket, példákat és hozzájárulási útmutatót.

Méretek és megtakarítások

A Hugging Face-en tárolt EEE datastore a bejelentés szerint körülbelül 229 000 értékelési eredményt tartalmaz több mint 22 000 modellen és 2 200 benchmarkon, 31 különböző jelentési formátumból gyűjtve. Ezek újrafuttatása a forrástól függően több százezer dollárba kerülne, így a meglévő eredmények megőrzése és standardizálása költséghatékony megoldás.

Hogyan működik a két rendszer együtt

A Hugging Face Community Evals két fő részből áll:

  • A benchmarkok egy dataset repo-ban regisztrálják magukat egy eval.yaml fájllal, és a dataset oldalán gyűjtő- és megjelenítő leaderboard alakul ki minden Hubon jelentett pontszámra. Az "official benchmarks" listája idővel bővül.
  • A modellek pontszámai a modell repójában .eval_results/*.yaml fájlokban élnek; ezek megjelennek a model cardon és bekerülnek a kapcsolódó benchmark leaderboardjába. Mind a modell szerzőjének saját eredményei, mind a közösségi PR-ekkel beküldött eredmények aggregálódnak; minden pontszám jelölést visel arra vonatkozóan, hogy szerzői, közösségi vagy függetlenül ellenőrzött-e.

A kapcsolat úgy működik, hogy amikor egy eredményt mindkét rendszerbe elküldenek, a pontszám megjelenik a Hugging Face model oldalon és a benchmark leaderboardon, és ugyanakkor egy forrás-badge mutat vissza a teljes EEE rekordhoz, ahol megtalálhatók a generálási konfigurációk, a harness verzió, reprodukálhatósági jegyzetek és az esetleges per-példa adatok.

Amikor a szervezet hivatalos Hugging Face fiókján keresztül küldik be az adatokat, az EvalEval oldalán megjelenik egy verified jelzés, ami jelzi az olvasóknak, hogy az adatok közvetlenül a forrástól származnak.

A konverter és működése

A központi eszköz a community eval converter, amely az EEE JSON rekordokat átalakítja a Hugging Face által elvárt kis YAML fájlokká. A konverter a következő mezőmapparokat használja például:

  • source_data.hf_repo -> dataset.id
  • evaluation_name -> task_id
  • score_details.score -> value
  • evaluation_timestamp -> date

A konverter beleteszi továbbá az EEE datastore objektum URL-jét a source blokkba, ami a visszahivatkozást biztosít. Jelenleg négy hivatalos benchmarkot kezel: MMLU-Pro, GPQA, HLE és GSM8K.

A konverter többet csinál, mint mezők átrendezése:

  • Letölti a megadott EEE datastore collectiont és a hivatkozott objektumokat, ellenőrzi a hash-eket és kiválasztja a támogatott benchmarkoknak megfelelő pontszámokat.
  • Auditálja, mi található már a model repo .eval_results YAML-jeiben a főágon és nyitott PR-ekben; összehasonlít dataset és task alapján.
  • Kategorizálja az eseteket: already_present, score_conflict, missing_hf_model vagy ready.
  • Semmit sem tol fel automatikusan: a tool helyi YAML-előnézeteket és egy átnézési riportot ír, és csak akkor nyit PR-eket, ha a felhasználó expliciten beírja az OPEN PRS parancsot és megad egy commit-üzenetet.

A konverter újrafuttatása újrahasznosítja a korábban cache-elt eredményeket, hacsak nem adják meg a --force opciót.

Hogyan kezdjen hozzá egy hozzájáruló

  1. Küldje be a teljes rekordjait az EEE datastore-ba.
  2. Használja a community eval converter eszközt a GitHub-tárházból. Példa parancs egy collection feldolgozására:

uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro
--datastore evaleval/EEE_datastore@main

  1. Nézze át a generált előnézeteket és riportot, majd írja be az OPEN PRS parancsot a PR-ek megnyitásához.

A teljes dokumentáció a séma, CLI és konverterek használatáról elérhető az evalevalai.com/every_eval_ever/hf-community-evals oldalon.

Összegzés

A két rendszer összekapcsolása azt jelenti, hogy ugyanannak az értékelésnek a ponteredménye egyszerre lesz látható a Hubon és visszakövethető a teljes, strukturált EEE rekordig. Ez csökkenti a széttagoltságot, javítja az átláthatóságot és segíti a reprodukálhatóságot anélkül, hogy az eredeti adatok kézi formátummásolására lenne szükség.