Az Anthropic bemutatta a Claude Sonnet 5 modellt, a labor középméretű modellcsaládjának erősebb, agentikusabb kiadását. A cég szerint a Sonnet 5 képes tervezni, eszközöket (például böngészőt és terminált) használni, és korábban nagyobb, drágább modellekhez kötődő autonóm feladatokat önállóan elvégezni.
Mi változott és miért számít
Az új kiadás megerősíti, hogy az agentikus képesség ma már az alapelvárás minden árazási szinten: a verseny továbbra sem csak azon múlik, melyik modell képes a legerősebb agentikus munkára, hanem azon, ki tudja azt olcsóbban és megbízhatóbban nyújtani emberi felügyelet nélkül.
Elérhetőség és árképzés
A Sonnet 5 kedden lépett élesbe mint az alapértelmezett modell a Free és Pro csomagokban, és elérhető minden előfizetés számára. Bevezető ára a következő: 2 USD per millió input token és 10 USD per millió output token augusztus 31‑ig; ezt követően az input díj 3 USD per millióra emelkedik, az output díj pedig marad 10 USD per millió. Ez az árszint olcsóbbá teszi a Sonnet 5‑öt az Opus 4.8‑nál, valamint OpenAI GPT‑5.5 és Google Gemini 3.1 Pro modelljeinél; ugyanakkor még mindig drágább, mint a Gemini 3.5 Flash.
Teljesítmény és benchmarkok
Anthropic szerint a Sonnet 5 jelentős javulást hoz a Sonnet 4.6‑hoz képest (amely februárban jelent meg) olyan agentikus területeken, mint a következtetés, eszközhasználat, szoftverfejlesztés és ismeretmunka.
- Agentikus kódolási benchmarkon a Sonnet 5 63,2%-os eredményt ért el, szemben Opus 4.8 69,2%-ával és a Sonnet 4.6 58,1%-ával.
- Egy ismeretmunka‑benchmarkon pedig a Sonnet 5 kismértékben felülteljesítette az Opus 4.8‑at, amelyről ismert, hogy erős a legnehezebb problémák — mint a finom ítéletalkotás és mély kutatás — megoldásában. Anthropic ugyanakkor hangsúlyozza, hogy az Opus 4.8 továbbra is a pontosabb válaszok választása a legkritikusabb feladatoknál, míg a Sonnet 5 alacsonyabb költség mellett biztosít jobb minőséget a korábbi Sonnet‑verziókhoz képest.
Felhasználói tapasztalatok
A cég által idézett teszterek szerint a Sonnet 5 jobban képes befejezni összetett, korábban megszakadt feladatokat, és „ellenőrzi a saját kimenetét anélkül, hogy kifejezetten kérték volna”. Daniel Shepard, a Zapier vezető mérnöke egy példát említett: a Sonnet 5 kétlépcsős feladatot végzett el teljesen (Salesforce fiókszintek frissítése és indítási bejelentő kiküldése vállalati kapcsolatoknak), amely korábban részben megrekedt. Shepard szerint ez napi automatizálásoknál „egyértelmű választás”.
Biztonság és korlátok
Anthropic szerint a Sonnet 5 kisebb előfordulási arányban mutat nemkívánatos viselkedéseket, mint a Sonnet 4.6: jobban visszautasítja a rosszindulatú kéréseket, ellenáll a prompt injekciós kísérleteknek, és kevesebbet hallucinál vagy folytat szolgalelkű viselkedést. Ugyanakkor a blogbejegyzés kitér arra is, hogy a Sonnet 5 nem éri el az Opus 4.8 és a Claude Mythos Preview szintjét a viselkedésbeli illeszkedés és a legveszélyesebb feladatok elleni védelem tekintetében: például a Sonnet 5 jóval gyengébb képességekkel rendelkezik veszélyes kiberbiztonsági feladatok elvégzésében, mint az Opus modellek. Lovable társalapító Fabian Hedin idézett nyilatkozatában kiemelte, hogy a Claude Sonnet 5 „tisztán és következetesen visszautasítja a veszélyes kéréseket”, és a Lovable úgy látja, hogy egy olyan modell, amely tud nemet mondani, ugyanolyan fontos, mint amelyik tud építeni.
Következtetés
A Sonnet 5 bevezetése jól mutatja, hogy az agentikus képességek ma már alap‑elvárásnak számítanak a nagy nyelvi modellek piacán. A fő verseny immár az ár‑teljesítmény és a megbízhatóság mentén zajlik: Anthropic a Sonnet 5‑tel olcsóbb, de képességeiben jelentősen javult opciót kínál a fejlesztőknek, miközben a legmagasabb pontosságot és biztonságot igénylő esetekben továbbra is az Opus család az ajánlott választás.



