Modellbevezetés

Claude Sonnet 4.5: új generációs, kódolásra és hosszú kontextusú feladatokra optimalizált modell

A Claude fejlesztői bejelentették a Claude Sonnet 4.5 modellt 2025.

Claude Sonnet 4.5: új generációs, kódolásra és hosszú kontextusú feladatokra optimalizált modell

Anthropic 2025. szeptember 29-én bemutatta a Claude Sonnet 4.5 modellt, amelyet elsősorban szoftverfejlesztésre, számítógép-használatra és hosszú távú, többlépcsős feladatok megoldására optimalizáltak. A cég szerint ez a legjobb kódolási teljesítményt nyújtó modellük, és jelentős előrelépést mutat a következtetésben és matematikai feladatokban.

Mikor és hogyan érhető el

Claude Sonnet 4.5 mindenhol elérhető 2025. szeptember 29-től. Fejlesztők a claude-sonnet-4-5 modellt használhatják a Claude API-n keresztül. Az árazás változatlan maradt a Sonnet 4-hez képest: 3/15 USD per millió token.

Milyen fejlesztések és termékfrissítések kísérik a kiadást

A bemutatóval egyidejűleg több termékfrissítés is megjelent:

  • Claude Code: checkpointok (a felhasználók által legtöbbet kért funkció), frissített terminálfelület és natív VS Code-kiterjesztés.
  • Claude API: kontextus-szerkesztés és memóriaeszköz, amely hosszabb futtatásokat és összetettebb agent-vizsgálatokat tesz lehetővé.
  • Claude alkalmazások: kódvégrehajtás és fájlok létrehozása (táblázatok, dia, dokumentumok) közvetlenül a beszélgetésben.
  • Claude for Chrome kiterjesztés: elérhető a Max előfizetők számára, akik korábban feliratkoztak a várólistára.
  • Claude Agent SDK: az a háttérinfrastruktúra, amelyet az Anthropic a saját Claude Code termékéhez használ, most harmadik felek számára is elérhető építőkészletként.

Teljesítmény – kódolás, számítógép-használat, következtetés

Anthropic azt állítja, hogy a Sonnet 4.5 vezető a SWE-bench Verified értékelésben (valós szoftverfejlesztési feladatokra mért benchmark). A cég 77.2%-os átlagos pontszámot jelentett a teljes 500-problémás SWE-bench Verified adatkészleten 200K-os „thinking” token kerettel, 10 próba átlagából. Egyes konfigurációkban — például 1M kontextusnál — 78.2%-ot mértek, a „high compute” eljárással pedig 82.0% érhető el a többpárhuzamos próbálkozás és belső pontozó használatával.

A Sonnet 4.5 a számítógéphasználat mérésekor is jelentős előrelépést mutat: az OSWorld benchmarkon 61.4%-ot ért el, szemben a négy hónappal korábbi Sonnet 4 vezető 42.2%-ával.

A modellről azt is közölték, hogy képes több mint 30 órán át fókuszban maradni összetett, többlépcsős feladatok autonóm végrehajtása során.

Szakmai és ügyfél-visszajelzések

A közleményben számos iparági és ügyfélidézet szerepel: pénzügyi, jogi, orvosi és STEM területek szakértői szerint a Sonnet 4.5 jobb domain-specifikus tudással és következtetési képességekkel rendelkezik az előző modellekhez képest, például az Opus 4.1-hez viszonyítva. Több idézet konkrét hatásokat említ:

  • GitHub Copilot integrációban javulás a többlépcsős következtetésben és kódfelfogásban (Mario Rodriguez, Chief Product Officer).
  • Biztonsági ügynökökben a sérülékenységek átvételi idejének átlagos csökkenése 44% és pontosságnövekedés 25% (Nidhi Aggarwal, Chief Product Officer).
  • Belső kód-szerkesztési benchmarkon a hibaarány 9%-ról 0%-ra csökkent Sonnet 4-ről Sonnet 4.5-re (Michele Catasta, President).
  • Önálló kódolási idő 30+ óra fenntartása, amely lehetővé teszi mérnökök számára, hogy komplex architekturális munkákat rövidebb idő alatt tartsanak koherensen (Sean Ward, CEO and Co-Founder).

Egyes ügyfélpéldákban konkrét százalékok és teljesítménynövekedések szerepelnek, például Devin-nél 18%-kal nőtt a tervezési teljesítmény és 12%-kal az end-to-end értékelési pontszám, valamint a Figma és Canva integrációk javulása több területen.

Biztonság és illeszkedés (alignment)

Anthropic hangsúlyozza, hogy a Sonnet 4.5 egyben a leginkább „aligned” frontier-modelljük: a cég szerint jelentősen csökkentek a problémás viselkedések — például szolgalelkűség (sycophancy), megtévesztés, hatalomvágy és a téves gondolkodás ösztönzése. Kiemelték a prompt-injekció elleni védekezés előrehaladását is, különösen az agent és számítógép-használati képességek esetén.

A modellt az Anthropic AI Safety Level 3 (ASL-3) védelmi szintje alatt adták ki. A védelmi rétegek között osztályozó (classifier) szűrők vannak, amelyek célja potenciálisan veszélyes bemenetek és kimenetek felismerése, különösen a kémiai, biológiai, radiológiai és nukleáris (CBRN) jellegű tartalmak esetén. A cég állítása szerint a hamis riasztások mértékét jelentősen csökkentették: tízszeres javulás az eredeti leíráshoz képest, és kétszeres javulás a 2025. májusi Claude Opus 4 megjelenése óta.

Anthropic lehetőséget biztosít a felhasználóknak megszakadt beszélgetések folytatására egy alacsonyabb CBRN-kockázatú modellel, Sonnet 4-gyel, ha az osztályozók tévesen megszakítanak egy interakciót. Részletes biztonsági és illeszkedési értékelések a modell rendszerkártyájában (system card) érhetők el.

Claude Agent SDK és kutatási előzetes

A vállalat bejelentette a Claude Agent SDK elérhetőségét: a Sonnet 4.5 mögötti infrastruktúra, amely több hónapnyi fejlesztés eredménye, most külső fejlesztők számára is használható. A SDK célja az ügynökök (agents) memóriakezelésének, jogosultságkezelésének és alügynök-koordinációjának megkönnyítése hosszú futtatások során.

Mellékelten öt napos kutatási előzetest is indítottak "Imagine with Claude" néven, amelyben a modell valós időben generál szoftvert, előre megírt kód nélkül. Ez a kísérlet a Max előfizetők számára érhető el öt napig a claude.ai/imagine címen.

Ajánlás és technikai részletek

Anthropic azt javasolja, hogy minden felhasználó váltson Sonnet 4.5-re, mivel drop-in csereként azonos ár mellett jobb teljesítményt nyújt. A fejlesztői platform frissítései, beleértve a Claude Agent SDK-t, minden fejlesztő számára elérhetők; a kódvégrehajtás és fájlalkotás pedig minden fizetős csomagban elérhető a Claude alkalmazásokban.

A közleményhez részletes módszertani jegyzetek és mérési paraméterek tartoznak (SWE-bench Verified, Terminal-Bench, τ2-bench, AIME, OSWorld, MMMLU, Finance Agent), továbbá technikai dokumentáció, rendszerkártya és kutatási posztok a pontos mérési megközelítésekről és konfigurációkról.

Összefoglaló

Claude Sonnet 4.5 egy generációs előrelépést jelent az Anthropic szerint, különösen kódolásban, számítógép-használatban és hosszú kontextusú problémamegoldásban. A modell és a vele érkező termékfrissítések (Claude Code checkpointok, Agent SDK, Chrome-kiterjesztés, Imagine with Claude kutatási előzetes) célja, hogy a fejlesztők és vállalati ügyfelek összetettebb, hosszabb futtatásokat és agent-alapú munkafolyamatokat hajthassanak végre ugyanazon árszint mellett.