Anthropic 2025. november 24-én jelentette be a Claude Opus 4.5 modellt. A cég szerint az új modell intelligensebb és hatékonyabb, különösen szoftvermérnökségi feladatokban, ágensek működtetésében és hosszú kontextusú munkafolyamatok kezelésében. A modell az Anthropic alkalmazásaiban, a Claude API-n keresztül, valamint mind a három nagy felhőplatformon elérhető; fejlesztők számára a használati azonosító: claude-opus-4-5-20251101.
A bejelentés része az árazási frissítés: Opus-szintű képességekhez mostantól 5/25 dollár per millió token az ajánlott ár, ami a cég szerint elérhetőbbé teszi az Opus családot több felhasználó, csapat és vállalat számára.
Teljesítmény és gyakorlati előnyök
Anthropic hangsúlyozza, hogy az Opus 4.5 jelentős előrelépés a valós szoftvermérnökségi feladatokban: a belső mérésük szerint a modell jobb kódot ír, hatékonyabb eszközhasználatot és jobb tervezést nyújt ágensek esetén, és sokszor kevesebb tokenből éri el ugyanazt az eredményt, mint a korábbi Sonnet 4.5.
A cég és korai hozzáférésű ügyfelei visszajelzései szerint a modell különösen jól kezeli az ambiguitást, képes kereskedelmi kódmigrációra, refaktorálásra, valamint összetett, többlépéses hibakeresési feladatok megoldására. Több ügyfél például 50–75%-os csökkenést jelentett eszköhívási és build/lint hibákban, valamint egyes feladatoknál akár 65%-kal kevesebb tokenfelhasználást tapasztaltak.
Konkrét benchmark-eredmények, amelyeket a bejelentés említ:
- SWE-bench Multilingual: Opus 4.5 vezet 7 a 8 programozási nyelv szerinti rangsorban.
- Aider Polyglot: 10.6%-os javulás Sonnet 4.5-höz képest nehezebb kódolási problémákon.
- BrowseComp-Plus: jelentős előrelépés agentikus keresésben.
- Vending-Bench: 29%-kal jobb hosszú távú feladatkövetés Sonnet 4.5-höz viszonyítva.
Egy példa a benchmarkokból: a τ2-bench egyik forgatókönyvében az Opus 4.5 kreatív, de jogos megoldást talált egy repülőjegy-módosítással kapcsolatos ügyfélkérésre (előbb kabinfrissítés, majd járatmódosítás), amit a benchmark hivatalosan nem várt megoldásként értékelt.
A fejlesztőknek szánt új vezérlők közül kiemelt az effort paraméter, amely lehetővé teszi a gyorsabb, olcsóbb vagy pedig a mélyebb, pontosságot előnyben részesítő futtatást. Például közepes effort mellett Opus 4.5 eléri a Sonnet 4.5 legjobb SWE-bench Verified pontszámát 76%-kal kevesebb output token felhasználásával; magas effort mellett pedig 4.3 százalékponttal jobb teljesítményt ér el miközben 48%-kal kevesebb tokent használ.
Biztonság és alignáltság
Anthropic szerint a Claude Opus 4.5 a legrobosztusabban alignált modelljük eddig, és iparági összehasonlításban is erős a prompt injection támadásokkal szembeni ellenállásban. A cég megjegyzi, hogy a vonatkozó vizsgálatot Gray Swan fejlesztette, és hogy a részletes képesség- és biztonsági értékeléseket a Claude Opus 4.5 system card tartalmazza.
A kiemelt „concerning behavior” mutató a széles spektrumú nem kívánatos viselkedéseket méri, ideértve a rosszindulatú emberi használathoz való közreműködést és az önállóan kezdeményezett káros akciókat.
Fejlesztői platform és termékfrissítések
A Claude Developer Platformhoz több újítás tartozik: context compaction, fejlettebb eszközhasználat, memóriakezelés és hosszabb futású ágensek támogatása. A cég szerint ezek a kombinált technikák például egy mély kutatási kiértékelésen majdnem 15 százalékponttal növelték az Opus 4.5 teljesítményét.
Claude Code kapott Plan Mode fejlesztést: pontosabb előkészítő kérdések, szerkeszthető plan.md fájlok létrehozása, és párhuzamos helyi és távoli munkamenetek a desktop alkalmazásban. A Claude alkalmazásokban hosszú beszélgetések esetén a modell automatikusan összegzi a korábbi kontextust, hogy a chat folytatható legyen.
Integrációk és elérhetőség:
- Claude for Chrome: mostantól elérhető minden Max felhasználónak.
- Claude for Excel: októberben jelentették be, és a béta mostantól Max, Team és Enterprise felhasználók számára bővült.
Az Opus 4.5-höz kapcsolódó Opus-specifikus korlátokat eltávolították, és Max/Team Premium felhasználók számára megnövelték az általános használati limiteket, hogy az Opus tokenkapacitás nagyjából megegyezzen a korábbi Sonnet-hez társított mennyiséggel.
Értékelés és társadalmi hatások
Anthropic egy belső, nehéz gyakorlati vizsgán is futtatta a modellt: egy 2 órás határidővel végzett feladaton az Opus 4.5 magasabb pontszámot ért el, mint bármely korábbi emberi jelölt. A cég óvatosságra int, hogy ez a teszt kifejezetten technikai készségeket, ítélőképességet és időnyomást mér, és nem fedi le az együttműködés, kommunikáció vagy évek alatt kialakuló szakmai ösztönök területeit. Anthropic a Societal Impacts és Economic Futures kutatásain keresztül vizsgálja majd az ilyen eredmények munkaerő-piaci és társadalmi következményeit.
Módszertan és jegyzetek
A bejelentés részletezi a mérések környezetét: 64K thinking budget, interleaved scratchpadok, 200K context window, alapértelmezett effort (high) és mintavételi beállítások, átlagolva 5 független futáson. Kivételként a SWE-bench Verified és a Terminal Bench eltérő beállításokat használtak. A rendszerkártya és a részletes értékelések további módszertani információkat tartalmaznak.
Anthropic állítása szerint az Opus 4.5 lényeges előrelépés a képességek, hatékonyság és biztonság terén, és a frissített fejlesztői eszközökkel együtt a vállalat célja, hogy a modellt szélesebb körben használhatóvá tegye mindennapi és vállalati munkafolyamatokhoz.



