Modellbevezetés

Anthropic Claude Fable 5 értékelési nehézségei és hatása a benchmarkokra

A főszereplő Anthropic és annak nyilvános, védett modellje, Claude Fable 5, amelyet a cikk szerint a fejlesztő által bevezetett osztályozók korlátoztak, mielőtt a modellek visszahívásra kerültek.

Anthropic Claude Fable 5 értékelési nehézségei és hatása a benchmarkokra

Több független szervezet is arról számolt be, hogy nem tudta megbízhatóan értékelni Anthropic Claude Fable 5 nevű, védett nyilvános modelljét: a tesztalanyok egy része vagy visszautasítást kapott, vagy a kérést a kevésbé képzett Claude Opus 4.8 modellre irányították át. Anthropic a Claude Fable 5 használatához megköveteli, hogy a felhasználók elfogadják a feltett promptok és a modellek válaszainak 30 napos megőrzését.

Hogyan működött Claude Fable 5 a tesztek előtt a visszahívásig

Anthropic osztályozói minden promptot átnéztek a Claude Fable 5-hez való eljutás előtt. Ha egy promptat kockázatosnak jelöltek — például kiberbiztonsággal, biológiával, kémiával vagy AI-modellek mérnöki kérdéseivel kapcsolatos volt —, a prompt soha nem jutott el Claude Fable 5-höz. A védettség kétféle eredményt produkált:

  • Anthropic saját alkalmazásaiban, például a Claude Code környezetben a szűrt promptokat automatikusan a Claude Opus 4.8 válaszolta meg helyettük; a váltást a rendszer naplózott eseményként rögzítette, de nem tüntette fel a válasz szövegében.
  • Az API-n keresztül (ahogy a legtöbb értékelő használta) a szűrő gyakran egyszerűen visszautasítást adott és nem szolgáltatott választ. Ilyenkor az értékelő dönthetett úgy, hogy engedélyezi a fallbacket és újrapróbálja a promptot Claude Opus 4.8-cal, vagy a feladatot hibaként értékeli.

Mindeközben Anthropic feltételezi és kötelezővé teszi, hogy a promptok és kimenetek 30 napig megőrzésre kerüljenek — ez néhány független szereplőnek megakadályozta saját privát benchmarkjai futtatását.

Értékelési módszertanok és eredmények

Az értékelők kétféle mérési megközelítés közül választhattak:

  • „Tiszta” értékelés: csak azokat a válaszokat számolták, amelyeket kizárólag Claude Fable 5 adott, hogy megmérjék a modellnek a valódi kapacitását a fallbackek befolyása nélkül.
  • „Gyakorlati” értékelés: a visszautasításokat és a fallbackeket is beleszámolták, így a felhasználók által a gyakorlatban elérhető teljesítményt mérték.

Néhány konkrét jelentés és mérőszám:

  • Artificial Analysis: a Claude Fable 5-öt a bevezetése előtt tesztelték, és az Intelligence Index nevű, 10 gazdaságilag hasznos feladatból álló kompozit mutatójukban a feladatok körülbelül 8 százalékánál visszalépés történt Claude Opus 4.8-ra. Az összes fallback-választ beszámították a pontszámba, így kevert eredmény született.

  • Vals AI: kétféle pontszámot publikált — az egyik tartalmazta a Claude Opus 4.8 fallback-válaszait, a másikban minden visszautasítást hibaként számoltak. Vals AI majdnem 100 százalékos visszautasítási arányról számolt be biológiai és kiberbiztonsági kérdésekben.

  • Agents’ Last Exam: hosszú távú, ellenőrizhető kimenetű ügynöki feladatok tesztjén Claude Fable 5 körülbelül 35 százalékban utasította vissza a feladatokat; a rendszerszűrők a tudományos kérdéseket gyakran „kiberbiztonsági vagy biológiai” kategóriába sorolták, és közben átváltottak Claude Opus 4.8-ra, rögzítve ezt külön naplóeseményként. Az értékelők összehasonlították a teljesítményt kimondottan "érintetlen" feladatokon (ahol csak Claude Fable 5 adott választ) és összetett feladatokon (ahol Claude Opus 4.8 is hozzájárult).

  • ARC Prize Foundation: az ARC-AGI absztrakt érvelési tesztjeit futtató szervezet megtagadta a verifikált értékelések futtatását, mert nem akarta a privát tesztkészletét átadni az Anthropic által előírt megőrzési feltétel miatt; jelezték, hogy ha tesztelhetnek a kérdések átadása nélkül, közzéteszik az eredményeket.

Számok és rangsorok

  • Artificial Analysis Intelligence Index: Claude Fable 5 (beleértve a Claude Opus 4.8 fallbackjeit) az első helyen végzett 64,9 ponttal, ami 3,5 százalékponttal magasabb, mint Claude Opus 4.8.
  • Humanity’s Last Exam: bár a modell 9 százalékot utasított vissza, Claude Fable 5 53 százalékos pontszámmal zárt, ez volt az eddig mért legmagasabb eredmény, és több mint 7 százalékponttal múlta felül Claude Opus 4.8-at.
  • Vals AI: Anthropic opcionális fallbackjét engedélyezve Claude Fable 5 a legtöbb benchmarkon az első helyen végzett, beleértve 75,14 százalékot az összesített Vals Indexen. Ha a visszautasításokat hibaként számolták, az összpontszám csak kis mértékben csökkent (74,92 százalék), viszont a védett területeken drámai visszaesések láthatók. Például a GPQA Diamond (grad-level tudományos kérdések) pontossága 93,18 százalékról (második hely) 55,56 százalékra esett vissza (94. hely), amikor a visszautasításokat hibaként kezelték.
  • Agents’ Last Exam: a Claude Code/Claude Fable 5 által saját maga által megválaszolt feladatok átmeneti sikeraránya 22,8 százalék volt, közelítve a Codex/GPT-5.5 23,8 százalékához és megelőzve a Claude Code/Claude Opus 4.8 eredményét (15,8 százalék). Ha a védelmi mechanizmusok átirányították a választ Claude Opus 4.8-ra, az átmeneti siker 17,6 százalékra csökkent; a kompozit sikerarány 22,0 százalék volt, amely elmaradt a GPT-5.5 24,0 százalékától.

Miért fontos ez

Anthropic által leírt biztonsági mechanizmusok megakadályozzák Claude Fable 5 közvetlen, stabil mérését. Ha a classifier-eket kikerülnék a méréshez, az egy olyan verziót jellemezne, amely a nyilvánosság számára nem elérhető. Ha viszont a classifier-eket bekapcsolva mérnek, az eredmény egy folyamatosan változtatható célpontot ír le, mert Anthropic bármikor újratune-olhatja az osztályozókat.

A benchmarkok eddig elsősorban azt próbálták megválaszolni, mennyire képes egy modell. Claude Fable 5 esete egy sokkal gyakorlatiabb kérdést vet fel: a modell képességeiből mennyi jut el ténylegesen a felhasználóhoz? Az értékelőknek mostantól nemcsak a csúcs teljesítményt kell jelenteniük, hanem azt is, hogy a fejlesztői környezetben és a védelmi beállításokkal mit lehet megbízhatóan elvárni.

Záró megjegyzés

A beszámolók alapján Claude Fable 5 kódolási feladatokban különösen erősnek tűnik, ugyanakkor az értékelését befolyásoló osztályozók és a 30 napos megőrzési szabályzat miatt a közösség csak korlátozottan tud következtetni a modell valódi, gyakorlati teljesítményére, amíg hozzáférése és értékelési feltételei nem tisztázódnak vagy nem változnak.