Anthropic 2025. szeptember 29-én bemutatta a Claude Sonnet 4.5 modellt, amelyet elsősorban szoftverfejlesztésre, számítógép-használatra és hosszú távú, többlépcsős feladatok megoldására optimalizáltak. A cég szerint ez a legjobb kódolási teljesítményt nyújtó modellük, és jelentős előrelépést mutat a következtetésben és matematikai feladatokban.
Mikor és hogyan érhető el
Claude Sonnet 4.5 mindenhol elérhető 2025. szeptember 29-től. Fejlesztők a claude-sonnet-4-5 modellt használhatják a Claude API-n keresztül. Az árazás változatlan maradt a Sonnet 4-hez képest: 3/15 USD per millió token.
Milyen fejlesztések és termékfrissítések kísérik a kiadást
A bemutatóval egyidejűleg több termékfrissítés is megjelent:
- Claude Code: checkpointok (a felhasználók által legtöbbet kért funkció), frissített terminálfelület és natív VS Code-kiterjesztés.
- Claude API: kontextus-szerkesztés és memóriaeszköz, amely hosszabb futtatásokat és összetettebb agent-vizsgálatokat tesz lehetővé.
- Claude alkalmazások: kódvégrehajtás és fájlok létrehozása (táblázatok, dia, dokumentumok) közvetlenül a beszélgetésben.
- Claude for Chrome kiterjesztés: elérhető a Max előfizetők számára, akik korábban feliratkoztak a várólistára.
- Claude Agent SDK: az a háttérinfrastruktúra, amelyet az Anthropic a saját Claude Code termékéhez használ, most harmadik felek számára is elérhető építőkészletként.
Teljesítmény – kódolás, számítógép-használat, következtetés
Anthropic azt állítja, hogy a Sonnet 4.5 vezető a SWE-bench Verified értékelésben (valós szoftverfejlesztési feladatokra mért benchmark). A cég 77.2%-os átlagos pontszámot jelentett a teljes 500-problémás SWE-bench Verified adatkészleten 200K-os „thinking” token kerettel, 10 próba átlagából. Egyes konfigurációkban — például 1M kontextusnál — 78.2%-ot mértek, a „high compute” eljárással pedig 82.0% érhető el a többpárhuzamos próbálkozás és belső pontozó használatával.
A Sonnet 4.5 a számítógéphasználat mérésekor is jelentős előrelépést mutat: az OSWorld benchmarkon 61.4%-ot ért el, szemben a négy hónappal korábbi Sonnet 4 vezető 42.2%-ával.
A modellről azt is közölték, hogy képes több mint 30 órán át fókuszban maradni összetett, többlépcsős feladatok autonóm végrehajtása során.
Szakmai és ügyfél-visszajelzések
A közleményben számos iparági és ügyfélidézet szerepel: pénzügyi, jogi, orvosi és STEM területek szakértői szerint a Sonnet 4.5 jobb domain-specifikus tudással és következtetési képességekkel rendelkezik az előző modellekhez képest, például az Opus 4.1-hez viszonyítva. Több idézet konkrét hatásokat említ:
- GitHub Copilot integrációban javulás a többlépcsős következtetésben és kódfelfogásban (Mario Rodriguez, Chief Product Officer).
- Biztonsági ügynökökben a sérülékenységek átvételi idejének átlagos csökkenése 44% és pontosságnövekedés 25% (Nidhi Aggarwal, Chief Product Officer).
- Belső kód-szerkesztési benchmarkon a hibaarány 9%-ról 0%-ra csökkent Sonnet 4-ről Sonnet 4.5-re (Michele Catasta, President).
- Önálló kódolási idő 30+ óra fenntartása, amely lehetővé teszi mérnökök számára, hogy komplex architekturális munkákat rövidebb idő alatt tartsanak koherensen (Sean Ward, CEO and Co-Founder).
Egyes ügyfélpéldákban konkrét százalékok és teljesítménynövekedések szerepelnek, például Devin-nél 18%-kal nőtt a tervezési teljesítmény és 12%-kal az end-to-end értékelési pontszám, valamint a Figma és Canva integrációk javulása több területen.
Biztonság és illeszkedés (alignment)
Anthropic hangsúlyozza, hogy a Sonnet 4.5 egyben a leginkább „aligned” frontier-modelljük: a cég szerint jelentősen csökkentek a problémás viselkedések — például szolgalelkűség (sycophancy), megtévesztés, hatalomvágy és a téves gondolkodás ösztönzése. Kiemelték a prompt-injekció elleni védekezés előrehaladását is, különösen az agent és számítógép-használati képességek esetén.
A modellt az Anthropic AI Safety Level 3 (ASL-3) védelmi szintje alatt adták ki. A védelmi rétegek között osztályozó (classifier) szűrők vannak, amelyek célja potenciálisan veszélyes bemenetek és kimenetek felismerése, különösen a kémiai, biológiai, radiológiai és nukleáris (CBRN) jellegű tartalmak esetén. A cég állítása szerint a hamis riasztások mértékét jelentősen csökkentették: tízszeres javulás az eredeti leíráshoz képest, és kétszeres javulás a 2025. májusi Claude Opus 4 megjelenése óta.
Anthropic lehetőséget biztosít a felhasználóknak megszakadt beszélgetések folytatására egy alacsonyabb CBRN-kockázatú modellel, Sonnet 4-gyel, ha az osztályozók tévesen megszakítanak egy interakciót. Részletes biztonsági és illeszkedési értékelések a modell rendszerkártyájában (system card) érhetők el.
Claude Agent SDK és kutatási előzetes
A vállalat bejelentette a Claude Agent SDK elérhetőségét: a Sonnet 4.5 mögötti infrastruktúra, amely több hónapnyi fejlesztés eredménye, most külső fejlesztők számára is használható. A SDK célja az ügynökök (agents) memóriakezelésének, jogosultságkezelésének és alügynök-koordinációjának megkönnyítése hosszú futtatások során.
Mellékelten öt napos kutatási előzetest is indítottak "Imagine with Claude" néven, amelyben a modell valós időben generál szoftvert, előre megírt kód nélkül. Ez a kísérlet a Max előfizetők számára érhető el öt napig a claude.ai/imagine címen.
Ajánlás és technikai részletek
Anthropic azt javasolja, hogy minden felhasználó váltson Sonnet 4.5-re, mivel drop-in csereként azonos ár mellett jobb teljesítményt nyújt. A fejlesztői platform frissítései, beleértve a Claude Agent SDK-t, minden fejlesztő számára elérhetők; a kódvégrehajtás és fájlalkotás pedig minden fizetős csomagban elérhető a Claude alkalmazásokban.
A közleményhez részletes módszertani jegyzetek és mérési paraméterek tartoznak (SWE-bench Verified, Terminal-Bench, τ2-bench, AIME, OSWorld, MMMLU, Finance Agent), továbbá technikai dokumentáció, rendszerkártya és kutatási posztok a pontos mérési megközelítésekről és konfigurációkról.
Összefoglaló
Claude Sonnet 4.5 egy generációs előrelépést jelent az Anthropic szerint, különösen kódolásban, számítógép-használatban és hosszú kontextusú problémamegoldásban. A modell és a vele érkező termékfrissítések (Claude Code checkpointok, Agent SDK, Chrome-kiterjesztés, Imagine with Claude kutatási előzetes) célja, hogy a fejlesztők és vállalati ügyfelek összetettebb, hosszabb futtatásokat és agent-alapú munkafolyamatokat hajthassanak végre ugyanazon árszint mellett.



