Anthropic 2026. február 5-én bejelentette a Claude Opus 4.6 modellt, amelyet a cég a korábbi Opus-verziók továbbfejlesztéseként pozícionál. A változtatások fókuszában a fejlettebb kódolási képességek, hosszabb távú agentikus feladatvégzés, javuló hosszú-kontextusú visszakeresés és megerősített biztonsági tesztelés állnak. Az Opus 4.6 az Opus-osztályú modellek között elsőként kapott 1 millió tokenes kontextusablakra vonatkozó bétát.
Mire képes az Opus 4.6?
- Fejlettebb kódolás és hibakeresés: a modellterjesztés szerint jobban tervez, hosszabb ideig képes fenntartani agentikus munkafolyamatokat, megbízhatóbban mozog nagy kódbázisokban, és hatékonyabb a kódellenőrzésben illetve saját hibáinak észlelésében.
- Hosszú kontextus: az Opus 4.6 javított hosszú-kontextusú visszakeresést és következetesebb, több lépéses érvelést nyújt, kisebb "context rot" mellett. Béta állapotban elérhető az 1 000 000 tokenes kontextusablak (a developer platformon).
- Általános tudásmunkák: a modell pénzügyi elemzésekre, kutatásra, dokumentumok, táblázatok és prezentációk használatára és létrehozására is alkalmazható. A Cowork környezetben, ahol Claude autonóman tud többfeladatot végezni, az Opus 4.6 ezen képességeket egyesíti.
Teljesítmény a méréseken — konkrét eredmények
Anthropic azt közölte, hogy az Opus 4.6 több mérésen is állását a csúcson tartja: például a Terminal-Bench 2.0 agentikus kódolási értékelésén a legjobb eredményt éri el. A Humanity’s Last Exam összetett, többdiszciplináris feladatban is vezető teljesítményt mutat.
A GDPval-AA értékelésen — amely gazdaságilag értékes tudásmunka feladatokat modellez pénzügyi, jogi és egyéb területeken — Opus 4.6 körülbelül 144 Elo ponttal előzi az iparág második legjobb modelljét (OpenAI GPT-5.2), és 190 ponttal múlja felül saját elődjét, a Claude Opus 4.5-öt. A BrowseComp teszten, amely a nehezen megtalálható online információk felkutatását méri, szintén az élre került.
Helyi eredmények és példák a bejelentésből:
- MRCR v2 (8-needle 1M variáns): Opus 4.6 76%-ot ért el, míg Sonnet 4.5 18,5%-ot.
- BigLaw Bench: Opus 4.6 BigLaw Bench pontszáma 90,2% volt, 40% tökéletes találattal és 84% fölötti arányban 0,8-as pontszámnál.
- Vending-Bench 2: Opus 4.6 átlagosan 3 050,53 dollárral jobb teljesítményt produkál, mint az Opus 4.5.
- Szakterületi előrelépés: közel kétszer jobb eredményt mutatott számítási biológia, szerkezet-biológia, organikus kémia és filogenetika feladatokon, mint elődje.
Az Anthropic részletes rendszerdokumentumot (system card) közölt, amelyben a modellek összehasonlító adatainak, értékeléseinek és a biztonsági vizsgálatoknak a részletei megtalálhatók.
Biztonság és értékelések
Anthropic azt állítja, hogy a teljesítménynövekedés nem megy a biztonság rovására. Az automatizált viselkedéselemzés szerint az Opus 4.6 alacsony rátával mutat félrevezető, szolgalelkű vagy káros együttműködést, és összességében legalább olyan jól illeszkedik (aligned) mint az Opus 4.5, amely eddig a cég legismertebbül jól illeszkedő frontier modellje volt. Egyúttal az Opus 4.6 a legkisebb arányú túlzott visszautasítást (over-refusal) is mutatta a közelmúlt Claude-modellek közül.
Anthropic a legátfogóbb biztonsági értékeléssorozatot hajtotta végre az Opus 4.6-on: kiterjesztették a vizsgálatokat a felhasználói jólétre, a veszélyes kérelmek visszautasításának összetettebb tesztjeire, valamint a rejtett ártó cselekvések észlelésére. Emellett interpretability módszerek alkalmazásával próbálnak jobban rálátni a modell döntéshozatalára.
Mivel a modell erős a kiberbiztonsági feladatokban, Anthropic új, hatféle kiberbiztonsági „probe”-ot vezetett be a potenciális visszaélések észlelésére, és aktívan használja a modellt védekező célokra is — például sebezhetőségek felderítésére és javítására nyílt forráskódú szoftverekben.
Termék- és API-frissítések
Anthropic több platform- és API-frissítést jelentett be, amelyek az Opus 4.6 képességeit támogató fejlesztéseket tartalmaznak:
- Adaptive thinking: a modell most már dinamikusan dönthet arról, mikor alkalmazzon kiterjesztett gondolkodást; a fejlesztők állíthatják az alap „effort” szintet.
- Effort szintek: négy szint érhető el (low, medium, high — alapértelmezett — és max), amellyel a fejlesztők szabályozhatják az intelligencia, sebesség és költség közti kompromisszumot.
- Context compaction (béta): automatikus összegzés és régi kontextus helyettesítése, hogy hosszabb futások ne ütközzenek kontextuskorlátba.
- 1M token kontextus (béta): az Opus 4.6 első Opus-osztályú modellként kapta meg a 1 millió tokenes kontextust a Claude Developer Platformon; prémium árszabás vonatkozik a 200k token fölötti promptokra.
- 128k output token: a modell mostanáig 128 000 tokenes kimenetet is támogat, így nagyobb outputok több lekérésre bontása nélkül elkészíthetők.
- US-only inference: az Egyesült Államokban futtatott inferencia elérhető 1,1× tokenár mellett.
API-n a modell neve claude-opus-4-6, elérhető a Claude API-n keresztül. Az alapárak változatlanok maradnak: 5/25 USD per millió token; a prémium árak a >200k tokenes promptokra $10/$37.50 per millió input/output token.
Platformintegrációk és fejlesztői eszközök
Anthropic bővítette a Claude Code és a Claude platform funkcióit is:
- Agent teams (kutatási előnézet): több alügynök egyidejű, koordinált futtatása párhuzamosan, különösen alkalmas független, olvasásigényes feladatokra (például kódbázis-átvizsgálatok).
- Claude in Excel: fejlesztett teljesítmény hosszú futásoknál, jobb adatbeolvasás és többlépéses változtatások egyetlen futásban.
- Claude in PowerPoint: kutatási előnézetben elérhető Max, Team és Enterprise terveken — a modell képes meglévő sablonok, betűtípusok és slide masterek figyelembevételével létrehozni prezentációkat.
Elérhetőség és további információk
Claude Opus 4.6 elérhető a claude.ai oldalon, az API-n és az összes jelentős felhőplatformon. A fejlesztők a claude-opus-4-6 modellt érhetik el a Claude API-n. A részletes képesség- és biztonsági értékelésekről, valamint a benchmarkok módszertanáról az Opus 4.6 rendszerkártyája (system card) és kapcsolódó dokumentumok adnak további tájékoztatást.
Az Anthropic közleménye számos korai partner visszajelzését is idézi, akik erős előrelépést, jobb autonómiát és megnövekedett megbízhatóságot tapasztaltak a modellel kapcsolatban különféle valós munkafolyamatokban, a kódmigrációtól és a biztonsági vizsgálatoktól a tervezési és jogi feladatokig.



