Anthropic 2026. február 17‑én bejelentette a Claude Sonnet 4.6 modellt, amely a cég szerint a Sonnet család eddigi legképzettebb változata. A frissítés az általános képességek széles körét érinti: kódolás, számítógép‑használat, hosszú kontextusú következtetés, ügynöktervezés, tudásmunka és dizájn. Emellett a Sonnet 4.6 béta formában 1 millió tokenes kontextusablakot kínál.
Árazás és elérhetőség
- Sonnet 4.6 mostantól alapértelmezett modell a claude.ai és a Claude Cowork szolgáltatásokban a Free és Pro csomagok felhasználói számára.
- Az árak változatlanok maradtak a Sonnet 4.5‑höz képest: a kezdő árszintek 3/15 USD per millió token.
- A modell elérhető minden Claude csomagon, a Claude Coworkon, Claude Code‑on, az API‑n és a nagyobb felhőplatformokon; a cég ingyenes rétegét szintén frissítették Sonnet 4.6‑ra.
Miben jobb a Sonnet 4.6?
Anthropic szerint a Sonnet 4.6 jelentősen jobb kódolási és számítógép‑használati képességeket hoz sokféle feladatra. Korai felhasználói visszajelzések alapján a fejlesztők körülbelül 70%-ban a Sonnet 4.6‑ot részesítették előnyben a Sonnet 4.5‑tel szemben a Claude Code‑ban végzett tesztekben. A felhasználók úgy találták, hogy az új modell jobban átolvassa a kontextust, kevésbé ismétel kódot, és hosszabb munkamenetek során kevésbé frusztráló.
Érdekesség: a Sonnet 4.6‑ot a tesztekben a cég korábbi, novemberi csúcskategóriás modelljével, az Opus 4.5‑tel is összehasonlították; a Sonnet 4.6‑ot a felhasználók 59%‑ban jobbnak értékelték bizonyos kódolási feladatoknál. A Sonnet 4.6‑ot kevesebb túlkomplikálásra és „lustaságra” hajlamosnak, jobb utasításkövetőnek, kevesebb hamis sikerállítással és kevesebb hallucinációval jellemezték.
Hosszú kontextus és üzleti szimulációk
A 1 millió tokenes kontextusablak lehetővé teszi teljes kódbázisok, hosszú szerződések vagy több tucat kutatási cikk egyidejű befogadását egyetlen lekérdezésben. Anthropic szerint a Sonnet 4.6 képes hatékonyan következtetni az ilyen hosszú kontextusokon, ami különösen hasznos hosszú távú tervezésnél. A Vending‑Bench Arena elnevezésű üzleti szimuláción a Sonnet 4.6 egy feltűnő stratégiát alakított ki: az első tíz szimulált hónapban jelentős kapacitásba fektetett, majd a végső szakaszban élesen a jövedelmezőségre váltott, ami jó helyezést eredményezett.
Számítógép‑használat (OSWorld és valós feladatok)
Anthropic 2024 októberében vezette be először általános célú, emberi módon számítógépet használó modelljét. A Sonnet sorozat azóta folyamatosan javult az OSWorld benchmarkon, amely valós szoftvereket (például Chrome, LibreOffice, VS Code) futtató szimulált környezetben mér több száz feladatot, emberi‑szerű kattintásokkal és gépeléssel.
A Sonnet 4.6‑tal a korai felhasználók ember‑szintű képességeket látnak összetett táblázatokban való navigálásban vagy több lépéses webes űrlapok kitöltésében, akár több böngészőfülön átívelő munkafolyamatokban is. A modell még mindig elmarad a legszakértőbb emberektől, de a fejlődés tempója jelentős, és sok munkafeladathoz hasznosabbá teszi a gépi számítógép‑használatot.
Biztonság és prompt‑injekciók
A Sonnet 4.6‑ról Anthropic széleskörű biztonsági értékeléseket végzett, amelyek összességében azt mutatták, hogy a modell legalább olyan biztonságos, mint a közelmúltbeli Claude‑modellek, illetve bizonyos területeken biztonságosabb. A cég kutatói szerint a Sonnet 4.6 „melegszívű, őszinte, proszociális, néha humoros karakterrel rendelkezik, erős biztonsági viselkedéssel, és nem mutat jeleket nagy kockázatú eltolódásokra.”
A számítógép‑használat azonban új támadási felületeket is ad, például a prompt‑injekciókat, amikor rosszindulatú szereplők elrejtett parancsokat helyeznek el weboldalakon. Anthropic szerint a Sonnet 4.6 jelentősen jobb ellenállást mutat prompt‑injekciókkal szemben a Sonnet 4.5‑höz képest, és teljesítménye hasonló az Opus 4.6‑éhoz; további útmutatást a védekezésről az API dokumentációban közlik.
Benchmarkok és ügyfélvisszajelzések
A Sonnet 4.6 javulásai több benchmarkon is láthatók: az OfficeQA (vállalati dokumentumok olvasása és belőlük következtetés) tekintetében Opus 4.6‑hoz hasonló teljesítményt ért el. A cég publikált mérései szerint különböző ügyfelek és partnerek több gyakorlati területen (frontend fejlesztés, pénzügyi elemzés, hibakeresés, dizájn, dokumentumfeldolgozás) is szignifikáns javulást tapasztaltak.
Néhány, a bejelentésben szereplő ügyfélvisszajelzés (szervezet és név megtartva) hangsúlyozza a modell gyors fejlődését, jobb kódminőséget, kevesebb iteráció szükségességét és magasabb pontosságot speciális iparági feladatokban. Például Box szerint a Sonnet 4.6 15 százalékponttal jobb volt a Sonnet 4.5‑nél nehéz következtetési Q&A feladatokban; egy biztosítási benchmarkon 94%-ot ért el, ami az általuk teszteltek között a legjobb számítógép‑használati eredmény.
Platform‑ és API‑frissítések
A Sonnet 4.6 platformszinten több újítással érkezik:
- Támogatott funkciók a Claude Platformon: adaptive thinking, extended thinking és context compaction béta, amely automatikusan összefoglalja a régebbi kontextust a beszélgetések közelítésekor a határokhoz.
- Az API eszközei (web search és fetch) most automatikusan kódot írnak és futtatnak a keresési eredmények szűrésére és feldolgozására, hogy csak a releváns tartalom maradjon a kontextusban.
- A code execution, memory, programmatic tool calling, tool search és tool use examples mostantól általánosan elérhetők.
- Claude in Excel‑hez az MCP csatlakozók támogatása lehetővé teszi, hogy Claude a táblázaton kívüli forrásokból (például S&P Global, LSEG, Daloopa, PitchBook, Moody’s, FactSet) húzzon be kontextust anélkül, hogy el kellene hagynia Excelt. Ez Pro, Max, Team és Enterprise csomagokon elérhető.
Használat és migráció
Fejlesztők a claude‑sonnet‑4‑6 modellt hívhatják meg a Claude API‑n keresztül. Anthropic javasolja, hogy a Sonnet 4.5‑ről Sonnet 4.6‑ra való átállásnál a felhasználók kísérletezzenek a különböző gondolkodási (thinking) beállításokkal a sebesség és a megbízhatóság optimális egyensúlyának megtalálásához. A cég megjegyzi, hogy az Opus 4.6 továbbra is erősebb opció marad a legmélyebb következtetést igénylő feladatokra, például nagy kódbázisok refaktorálására vagy többügynökös munkafolyamatok koordinálására.
Mellékes megjegyzések a benchmarkokról
A bejelentés részletezi, hogy bizonyos benchmark‑mérések működtetése és összehasonlítása változott (például OSWorld‑Verified 2025 júliusi frissítése), és hogy a valós számítógép‑használat összetettebb, mint amit egyetlen benchmark képes teljesen visszaadni. A cég több referencia‑eljárást is felsorol a különböző értékelések feltételeiről és konfigurációiról.
Összefoglalás
A Claude Sonnet 4.6 frissítését Anthropic úgy pozícionálja, hogy a Sonnet család jelentős képességnövekedést kapjon: jobb kódolás, számítógép‑használat, hosszú kontextusú következtetés és dizájn, miközben a költség ugyanaz marad. A modell elérhető mind a fizetős, mind az ingyenes szinteken, és több platform‑ és API‑fejlesztés kíséri, köztük a hosszabb kontextus kezelése és eszközhasználat automatizálása.
If you want, I can produce a short technical checklist for migrating from Sonnet 4.5 to Sonnet 4.6 (API calls, recommended thinking settings, and notes on context compaction).



