Anthropic ma kiadta a Claude Fable 5.1 (és Mythos 5.1) frissítést. A vállalat szerint a Fable 5.1 „új mércét állít a kódolásban, a tudásmunka és a hosszú futású problémamegoldási feladatok terén”. A közlemény különösen a tudományos feladatokra fókuszál: a modell a most bemutatott Terminal-Bench-Science 0.1 benchmarkon 52,6%-os eredményt ért el (a benchmarkot augusztus 27-én jelentették be). Összehasonlításképp: a korábbi Fable 5 24,7%-ot, az Opus 5 29,0%-ot, míg a GPT-5.6 Sol 22,4%-ot ért el ugyanitt.
Egyes más standard benchmarkokon a Fable 5.1 kismértékű javulást mutat, de egyik sem volt olyan látványos, mint a Terminal-Bench-Science 0.1 eredmény.
A pelikan‑SVG kísérlet — miért érdekes ez?
A szerző korábbi cikkében még júliusban megfogalmazta, hogy csökken a pelican benchmark hasznosságába vetett hite: a pelican eredmények és a modellek gyakorlati képességei közti korreláció nem tűnt olyan erősnek, mint korábban (2025-ben). A pelican most hasznos összehasonlításokra a modelleken belül, valamint ugyanazon feladat különböző „reasoning effort” szinteken való viselkedésének vizsgálatára.
Fable 5.1 öt gondolkodási („reasoning”) szintet kínál: low, medium, high, xhigh és max; nincs opció a reasoning teljes kikapcsolására.
A szerző javított egy hibát az llm-anthropic csomagban, amely miatt a reasoning tracek nem kerültek helyesen rögzítésre, majd lefuttatott több promptot. Az egyik vizsgált feladat: „Generate an SVG of a pelican riding a bicycle.” Az eredmények és a reasoning transcript teljes sorozatát rekonstruálta.
Mit produkáltak az egyes effort szintek?
-
Low: a transcript nem mutat összegzett reasoning szöveget; az output token száma 1 998. A futás 23,8 másodpercig tartott, költsége 10,017 cent. Érdekes, hogy Claude esetében az output token szám a reasoning tokeneket is tartalmazza.
-
Medium: szintén nem tartalmaz látható reasoning szöveget; 1 977 output token, 23 másodperc, 9,912 cent. Ez 21 tokennel kevesebb volt, mint a low futásnál. Tehát ezen a prompton a Fable 5.1 mind low, mind medium beállításon látszólag teljesen kihagyta a nyilvános reasoning szöveg előállítását.
-
High: itt már jelentkezik egy rövidebb reasoning rész. Az eredmény 2 612 output token volt, futási idő 29,6 másodperc, költség 13,087 cent. A reasoning rövid összefoglalója például így szólt: „I'm planning the SVG layout for a pelican riding a bicycle, with a sky and ground background, a bicycle with two spoked wheels, frame, seat and handlebars, and a white-bodied pelican with a long neck and orange beak positioned on top.” Összességében azonban a különbség a low/medium szintekhez képest nem volt nagy.
-
XHigh (xhigh): ezen a szinten radikálisan más lett a kimenet. Az output 36 767 token volt, a futás ideje 7 perc 51 másodperc, a költség kb. 1,83 USD. A reasoning trace nagyon részletes volt; például szerepelt benne, hogy a rendszer szándékosan a pelikánt a biciklin túlméretezve ábrázolná „comic effect” miatt, és elfogadja a kissé vastagabb vonalakat „charming”-ként.
-
Max: a szerző szerint ez adta a legjobb pelikánt, amit bármelyik Anthropic modelltől látott. Output 65 927 token, futási idő 13 perc 54 másodperc, költség 3,30 USD. A részletes reasoning trace sok apró döntést tartalmazott (pl. pedálok és lábak pozíciójának finomítása, sapka és kosár hozzáadása, a fej és bukósisak konfliktusának kezelése, tollazat sötétebb hegyének jelzése, vagy bizonyos díszítőelemek kihagyása a zsúfoltság elkerülése végett). A szerző megjegyzi, hogy a végeredmény nem volt annyira „flair”-ös, mint amit a Gemini 3.7 Flash produkál, de a kérést — egy SVG-t — pontosan teljesítette.
A Max reasoning trace-ból idézetek mutatják a részletes iterációs gondolkodást: például bukósisak elhelyezésével kapcsolatos vektor kontrollpontok mozgatása, vagy a ventilációs nyílások pozícionálásának ellenőrzése stroke‑szélesség és lekerekített végek figyelembevételével.
Animáció kísérlet
A Hacker Newson egy swalsh nevű kommentelő azt kérte, hogy legyen animált változat. A szerző nem akart újabb ~3 USD-t költeni, ezért a Max állapotban generált SVG‑t átirányította a modell High alapértelmezett „thinking” szintjére egy rövid parancssal (llm logs -cx | llm -m claude-fable-5.1 -s 'animate this'). Ennek lefutása: 6 121 input token és 26 201 output token = 1,37 USD költség. Az így létrehozott animáció videóra exportálva mutatta, hogy a kerekek sajnos rossz irányban forognak, de egyébként a mozgásvázlat jól sikerült, és az animáció az eredeti Max SVG‑ből származtatható volt.
Miért számít ez?
A Fable 5.1 bejelentés és a Terminal-Bench-Science 0.1 eredményei azt sugallják, hogy az Anthropic a tudományos és hosszú távú problémamegoldó képességekre helyezi a hangsúlyt. A pelican‑vizsgálat viszont rávilágít, hogy a modellek különböző reasoning effort beállításai drámai hatással lehetnek az output hosszára, részletességére és költségére: a legmagasabb szinteken a tranzakciók token- és költségigénye exponenciálisan megnőhet.
A gyakorlati következmény: ha precíz, iteratív, részletes tervezésre van szükség (például komplex SVG generálásához), a magasabb reasoning szintek jobb eredményt adhatnak — de jelentősen drágábbak és lassabbak. Ugyanakkor alacsony és közepes szinteken előfordulhat, hogy a nyilvános reasoning output hiányzik, ami megnehezíti a belső döntések átláthatóságát.
Következtetés
Claude Fable 5.1 látványos előrelépést mutat a Terminal-Bench-Science 0.1 skálán, és gyakorlati tesztek (például a pelican SVG) jól illusztrálják a reasoning effort szintek közti különbségeket: a low/medium szintek gyorsabbak és olcsóbbak, de gyakran kevesebb nyilvános reasoninggel; az xhigh és max szintek részletes, humán‑olvasmányos terveket és nagy tokenfelhasználást eredményeznek, jelentősen magasabb költséggel és futási idővel.



