Több független szervezet azt jelentette, hogy nem tudta teljesen értékelni Anthropic Claude Fable 5 nevű, védett, publikus változatát: a rendszer bizonyos tesztkérdéseket megtagadott, vagy a válaszadást a kevésbé képzett Claude Opus 4.8 modellre irányította. Emellett néhány értékelő visszatartotta saját, jogvédett tesztkészletét Anthropic új, 30 napos adatmegőrzési szabályzata miatt.
Hogyan működik Claude Fable 5
Anthropic osztályozói minden beérkező promptot ellenőriznek a Claude Fable 5‑höz való továbbítás előtt. Ha egy promptot az osztályozó megjelölt – különösen ha az kérdésekre vonatkozott kiberbiztonság, biológia, kémia vagy AI‑modellezés témakörében –, a megjelölt prompt soha nem jutott el Claude Fable 5‑höz. Ilyenkor két dolog történhetett: vagy a kérdést egy gyengébb modell, Claude Opus 4.8 válaszolta meg helyette, vagy a rendszer egyszerűen megtagadta a választ.
Anthropic saját alkalmazásaiban, például a Claude Code környezetben, amelyet több értékelés is használt, a megjelölt promptokat automatikusan a Claude Opus 4.8‑re irányították. A váltást azonban nem a válasz szövegében jelezték, hanem külön naplóbejegyzésként rögzítették; az értékelőknek a naplókat kellett átkeresniük, hogy elkülönítsék a Claude Opus 4.8 által adott válaszokat a valódi Claude Fable 5‑ös kimenetektől.
API‑használatnál (amint a legtöbb értékelő tette) a megjelölés általában egy azonnali visszautasítást eredményezett: ilyenkor nincs válasz. Az értékelő dönthetett úgy, hogy engedélyezi az opcionális visszaesési (fallback) mechanizmust, ami újrapróbálja a promptot Claude Opus 4.8‑on, vagy a feladatot sikerként értékelés helyett hibaként számlálja.
Minden felhasználónak el kellett fogadnia, hogy Anthropic 30 napig megőrzi a promptokat és a válaszokat, ami miatt néhány szervezet elzárkózott a privát tesztek megosztásától.
Hogyan pontozták az értékelők
A tesztelők két megközelítés között választhattak: egy „tiszta” értékelés, amely csak a valódi Claude Fable 5‑ös válaszokat akarta mérni, illetve egy „gyakorlati” értékelés, amely magába foglalta a megtagadásokat és a visszaeséseket is. Claude Mythos 5 közönség számára nem volt elérhető, így az nem volt függetlenül mérhető.
-
Artificial Analysis az Intelligence Index nevű, tíz gazdaságilag hasznos feladatból álló kompozitján belül azt rögzítette, hogy a rendszer körülbelül 8 százalékban visszaesett Claude Opus 4.8‑ra. Többségében ez tudományos jellegű kérdésekre történt. Artificial Analysis minden visszaesést beleszámolt az értékelésbe, így vegyesített pontokat kapott a modellek összehasonlításakor.
-
Vals AI kétféle eredményt tett közzé: egyet, amelyben a Claude Opus 4.8 visszaeséseit is beleértve pontozta a rendszert, és egy másikat, amelyben minden visszautasítást hibaként számolt. Vals AI külön kiemelte, hogy majdnem 100 százalékos volt a visszautasítási arány biológiai és kiberbiztonsági kérdésekben.
-
Agents’ Last Exam néven futó, hosszú távú, ellenőrizhető kimenetelű ügynöki feladatokat vizsgáló tesztben arról számoltak be, hogy Claude Fable 5 nagyjából 35 százalékban utasította el a feladatokat. A rendszer tudományos kérdéseket „kiberbiztonsági vagy biológiai” kategóriaként jelölt meg, és közben átváltott Claude Opus 4.8‑ra, a váltást pedig külön naplóeseményként rögzítette. Az értékelők ezért kétféle összehasonlítást publikáltak: az egyiken csak az „érintetlen” feladatok szerepeltek (amelyeket kizárólag Claude Fable 5 válaszolt), a másikon pedig a kompozit feladatok, ahol Claude Opus 4.8 is hozzájárult a válaszhoz.
-
Az ARC Prize Foundation, amely az ARC‑AGI absztrakt érvelési teszteket kezeli, megtagadta a hivatalos ellenőrzött értékelés futtatását, mert nem kívánták átadni privát tesztkészletüket az Anthropic adatmegőrzési követelményének. Jelezték, hogy eredményeiket közzéteszik, ha tesztet tudnak futtatni anélkül, hogy a kérdéseket át kellene adniuk.
Eredmények és változékonyság
Amikor Claude Fable 5 saját maga válaszolt (vagyis nem történt visszautasítás vagy visszaesés), a modell a jobb teljesítményt mutató rendszerek közé tartozott. Ugyanakkor, ha a visszaeséseket Claude Opus 4.8 tartalmazta vagy a megtagadásokat hibaként számolták, a helyezése jelentősen romlott.
Konkrét esetek:
-
Artificial Analysis Intelligence Indexében Claude Fable 5 (beleértve a Claude Opus 4.8 által adott visszaeső válaszokat) az első helyen végzett, 64,9 ponttal, ami 3,5 százalékponttal jobb volt Claude Opus 4.8‑nál.
-
Humanity’s Last Exam teszten Claude Fable 5 a tesztkérdések kb. 9 százalékát utasította el, ennek ellenére 53 százalékos végeredményt ért el, ami a korábban mért legmagasabb eredmény volt és több mint 7 százalékponttal haladta meg Claude Opus 4.8‑at.
-
Vals AI mérésein, ahol Anthropic opcionális visszalépést engedélyezett (így a Fable visszautasításait újrapróbálták Claude Opus 4.8‑on), Claude Fable 5 a legtöbb benchmarkon első helyen végzett, például 75,14 százalékkal a Vals Indexen. Ha a visszautasításokat hibaként kezelték, az összpontszám csak kis mértékben esett (74,92 százalék), viszont a megjelölt területeken drasztikus volt a romlás: a GPQA Diamond (egyetemi szintű tudományos kérdések) esetén a pontosság 93,18 százalékról (második hely) 55,56 százalékra zuhant (94. hely).
-
Agents’ Last Exam esetén a Claude Code/Claude Fable 5 által saját maga megválaszolt feladatok sikerességi rátája 22,8 százalék volt, amely közel állt a Codex/GPT‑5.5 23,8 százalékához és jelentősen jobb volt Claude Code/Claude Opus 4.8‑nál (15,8 százalék). Amikor azonban a feladatok átirányításra kerültek Claude Opus 4.8‑ra, az arány 17,6 százalékra esett. A kompozit sikeresség 22,0 százalék volt, ami elmaradt a GPT‑5.5 24,0 százalékától.
Miért fontos ez
Anthropic által biztonsági intézkedésként definiált osztályozók megakadályozták, hogy független értékelők közvetlenül mérjék Claude Fable 5 képességeit. Ha a mérésnél a szűrőket kikapcsolnák, az sem adna reális képet, mert az a Fable‑verziót vizsgálná, amelyhez a nyilvánosság nem fér hozzá. Ugyanakkor a szűrőkkel végzett tesztek is bizonytalanok, mivel Anthropic időről időre áthangolhatja ezeket az osztályozókat, így az értékelés egy „mozgó célpont” lesz.
A benchmarkok hagyományosan azt kérdezik, mennyire képes egy modell. Claude Fable 5 kapcsán fontosabb kérdés lett: a modell képességeiből mennyi érhető el a felhasználó számára a gyakorlatban? Az értékelőknek mostantól nemcsak a csúcsteljesítményt kell jelenteniük, hanem azt is, hogy mi az, amit a fejlesztőközösség és az ügyfelek ténylegesen megkaphatnak.
Záró megjegyzés
A beszámolók szerint Fable különösen erős kódolási feladatokban, de az elérhetőség és a biztonsági osztályozás jelenlegi gyakorlata megnehezíti, hogy ez a képesség széleskörűen ellenőrizhető és reprodukálható legyen, amíg az Anthropic hozzáférési politikáját és az osztályozói logikát nem tisztázzák vagy nem standardizálják az értékelési gyakorlatokban.



