Modellbevezetés

Claude Opus 4.8: gyorsabb, megbízhatóbb és erőforrás‑szabályozható vállalati AI

Az Anthropic bemutatta Claude Opus 4.8 modellt 2026.

Claude Opus 4.8: gyorsabb, megbízhatóbb és erőforrás‑szabályozható vállalati AI

Anthropic 2026. május 28-án tette elérhetővé a Claude Opus 4.8 modellt, amely az Opus 4.7-re építve több területen hoz teljesítmény- és megbízhatóságjavulást. A frissítés a cég szerint jobb eredményeket ad különféle kódolási, ügynöki (agentic) képesség-, érvelési és gyakorlati tudásfeladatokban, miközben új funkciók is érkeznek a vállalati felhasználás támogatására.

Mire képes az Opus 4.8?

A kiadott anyagban Anthropic összehasonlítja az Opus 4.8-at előző verziójával és más modellekkel különböző tesztek mentén. A cég kiemeli, hogy az új modell:

  • megbízhatóbb ítélőképességet mutat agentic feladatoknál;
  • gyorsabb működési módot kínál (fast mode: 2,5× sebesség);
  • jobban kezeli a hosszú munkamenetek kontextusát és a stílusirányítását;
  • jelentősen ritkábban engedi át a kódhibákat és gyakrabban jelzi a bizonytalanságokat.

Anthropic szerint az Opus 4.8 körülbelül négyszer kevésbé hajlamos arra, hogy a kódhibákat figyelmen kívül hagyja, mint az elődje. A részletes képességértékeléseket és az igazítási (alignment) vizsgálatokat a Claude Opus 4.8 System Card tartalmazza.

Felhasználói tapasztalatok és konkrét eredmények

Az early adopterektől idézett vélemények szerint az Opus 4.8 jobb ítélőképességgel dolgozik: például a Claude Code környezetben megfelelő kérdéseket tesz fel, észreveszi saját hibáit, és képes visszautasítani gyenge terveket. Több szakmai szereplő — köztük Tom Pritchard (Staff Engineer), Kay Zhu (Co-Founder and CTO) és Michael Truell (Co-Founder and CEO) — arról számolt be, hogy az Opus 4.8 következetesebben viszi végig a többlépéses, eszközhasználatot igénylő feladatokat.

Konkrét mérési eredmények az anyagban:

  • A Super-Agent benchmarkon az Opus 4.8 az egyetlen modell, amely minden esetet end-to-end teljesítette, az előző Opus modelleket és GPT-5.5-öt megelőzve költségparitáson.
  • Online-Mind2Web teszten az Opus 4.8 84%-os eredményt ért el, amely érezhető javulás az Opus 4.7-hez és a GPT-5.5-höz képest.
  • A Legal Agent Benchmarkon az Opus 4.8 elérte a legmagasabb eddig mért pontszámot, és elsőként lépte át a 10%-os all-pass küszöböt az összátlagban.

Vállalati partnerek, például Databricks (Genie), Hebbia és mások is arról számoltak be, hogy az Opus 4.8 jobb agentic érvelést, pontosabb hivatkozásokat és hatékonyabb tokenfelhasználást hoz egyes, dokumentum- és pénzügyi munkafolyamatoknál.

Őszinteség és igazítás

Az egyik hangsúlyos fejlesztés az „őszinteség” növelése: a modell gyakrabban jelzi a bizonytalanságokat, és kevésbé hajlamos arra, hogy alátámaszthatatlan állításokat tegyen. Az Anthropic igazítási csapata szerint az Opus 4.8 magasabb szinten teljesít a proszociális jellemzők (például a felhasználói autonómia támogatása) mérésében, és az olyan eltévelyedési mutatók, mint a megtévesztés vagy a rosszindulatú együttműködés, lényegesen alacsonyabbak az Opus 4.7-hez képest. Az igazítási értékelés részletes eredményeit a System Card tartalmazza.

Új funkciók: dynamic workflows és erőforrás‑kontroll

A következő fő újdonságok érkeznek együtt az Opus 4.8-cal:

  • Dynamic workflows (kutatási előnézetben): Claude Code képes nagyszabású feladatokat lebontani, tervezni és százszámra futtatni párhuzamos alügynököket (subagents) egyetlen munkamenetben, majd ellenőrizni az eredményeket mielőtt visszajelez a felhasználónak. Például kódalapú migrációkat végezhet le több százezer soros kódbázison a meglévő tesztkészletet mércéként használva. Ez a funkció elérhető lesz Enterprise, Team és Max tervű Claude Code felhasználóknak.
  • Effort control a claude.ai és Cowork felületeken: egy új vezérlő lehetővé teszi, hogy a felhasználó kiválassza, mennyi „erőfeszítést” fektessen a modell a válaszba. Magasabb szinteken a modell gyakrabban és mélyebben gondolkodik, jobb válaszokat ad, míg alacsonyabb szinteken gyorsabban és kevesebb token fogyasztásával válaszol. Az effort control minden terven elérhető.
  • Messages API frissítés: a Messages API mostantól fogad rendszerbejegyzéseket (system entries) a messages tömbön belül, ami lehetővé teszi a fejlesztők számára, hogy futás közben módosítsák a Claude instrukcióit anélkül, hogy megszakítanák a prompt cache-t vagy egy felhasználói körön kellene keresztülvinniük a frissítést. Ez hasznos jogosultság-, token‑költés‑ vagy környezeti kontextus módosításoknál agentek futtatása közben.

Effort alapbeállítás és tokenhasználat

Az Opus 4.8 alapértelmezett beállítása a „magas erőfeszítés” (high effort), amely a cég szerint a legjobb kompromisszumot nyújtja minőség és felhasználói élmény között. Kódolási feladatoknál ez az effort szint hasonló tokenfelhasználást jelent, mint Opus 4.7 alapértelmezettje, de jobb teljesítményt ad. A felhasználók választhatnak „extra” (Claude Code-ban "xhigh") vagy „max” beállítást is, amelyek több tokent költenek jobb eredményért; az Anthropic az „extra” beállítást ajánlja nehezebb vagy hosszú, aszinkron munkafolyamatokhoz. A cég növelte a rate limiteket a Claude Code-ban az extra erőfeszítést igénylő felhasználások kiszolgálására.

Árazás, elérhetőség

Claude Opus 4.8 már ma elérhető globálisan (2026. május 28.). A szokásos árak változatlanok az Opus 4.7-hez képest: 5 USD per millió input token és 25 USD per millió output token. A fast mode ára 10 USD per millió input token és 50 USD per millió output token; a fast mode sebessége 2,5×, és a cég közlése szerint ez a gyors mód most háromszor olcsóbb lett, mint a korábbi modellek fast módja. Fejlesztők a "claude-opus-4-8" modellt a Claude API-n keresztül érhetik el.

Mi várható tovább?

Anthropic szerint az Opus 4.8 mérsékelt, de kézzelfogható előrelépés az elődhöz képest. A cég dolgozik olcsóbb modelleken, amelyek hasonló képességeket nyújtanak, valamint egy új, magasabb intelligenciaszintű modellosztályon, a Claude Mythos Previwhoz kapcsolódó Project Glasswing részeként. Mythos‑szintű modelleket jelenleg csak szűk körben használnak – például kiberbiztonsági feladatokra – és ilyen képességű modellek általános kiadásához további kiberbiztonsági védelmek szükségesek. Anthropic azt közölte, hogy gyorsan haladnak ezen védelmek fejlesztésével, és a Mythos‑osztályú modellek néhány héten belül szélesebb körben is elérhetővé válhatnak.

Mellékletek és vizsgálati megjegyzések

A kiadvány megemlíti a Terminal-Bench 2.1, OSWorld-Verified és egyéb benchmarkok módosításait és eredményeit; részletes módszertan és a teljes igazítási vizsgálat a Claude Opus 4.8 System Card dokumentumban található.

Összességében az Opus 4.8 célja, hogy megbízhatóbb, hatékonyabb és jobban vezérelhető vállalati AI-eszközt kínáljon, különös tekintettel az ügynöki munkafolyamatokra, a kódalapú feladatokra és a magas kockázatú szakmai használatra.