Modellbevezetés

Claude Opus 5: új, költséghatékony generációs nyelvi modell a Claude-platformon

A főszereplő a Claude Opus 5 nyelvi modell és a Claude platform; a modell 2026.

Claude Opus 5: új, költséghatékony generációs nyelvi modell a Claude-platformon

Anthropic bejelentette Claude Opus 5 megjelenését 2026. július 24-én. A vállalat szerint Opus 5 gondolkodóbb és proaktívabb modell, amely közelebb kerül a Claude Fable 5 élvonalbeli intelligenciájához, miközben nagyjából a felénél alacsonyabb költségen működik.

Teljesítmény a főbb feladatkörökben

Opus 5 több, ügyviteli és programozási feladatokat mérő benchmarkon is az új állásfoglaló modellként szerepel. Például a Frontie r-Bench v0.1 és a GDPval-AA jellegű értékeléseken Opus 5 az új csúcsteljesítményt mutatja, bár kiberbiztonsági feladatokban továbbra is elmarad a Mythos 5 mögött.

A modell különösen jól teljesít szoftvermérnöki feladatokban:

  • Frontier-Bench v0.1: Opus 5 meghaladja a többi modellt, és kevesebb költséggel több mint duplájára növeli az Opus 4.8 teljesítményét feladatonként.
  • CursorBench 3.2: maximális erőfeszítés mellett Opus 5 csupán 0,5%-kal marad el Fable 5 csúcsától, miközben feladatonként körülbelül fele költséget használ.

Több tudásmunkát és problémamegoldást célzó mérésen hasonló előrelépést látni:

  • ARC-AGI 3: Opus 5 pontszáma háromszorosa a következő legjobb modellnek egy új feladatokat megoldó értékelésen.
  • Zapier AutomationBench: a teljes üzleti feladat-végrehajtásnál Opus 5 átlagosan 1,5×-es áttörési arányt ér el a következő legjobb modellhez képest ugyanazon feladatonkénti költség mellett; még legalacsonyabb erőfeszítés mellett is több feladatot teljesít, mint bármely más modell.
  • OSWorld 2.0: Opus 5 bármely adott költségnél a legjobb teljesítményt nyújtja, és Fable 5 legjobb eredményét egyharmad körüli költség mellett meghaladja.

Opus 5 emellett erősebb és költséghatékonyabb eredményeket mutat több más belső és külső értékelésen, köztük az ARC-AGI 3, GDPval-AA v2, OSWorld 2.0, HLE, AutomationBench és DeepSearchQA vizsgálatokon.

Tudományos és élettudományi feladatok

Opus 5 jelentős javulást hoz az Opus 4.8-hoz képest az élettudományokkal kapcsolatos értékelések mindegyikén. Különösen kiemelkedő az organikus kémiai feladatokban és a fehérjekutatásban:

  • Molekuláris szerkezetek sztruktúrafelderítése spektroszkópiai adatokból: belső benchmarkon Opus 5 10,2 százalékponttal jobb, mint Opus 4.8.
  • Fehérje-variánsok funkciójára vonatkozó előrejelzések: Opus 5 7,7 százalékponttal jobb teljesítményt mutat.

Vizualizációs képességek

Opus 5 képes erősebb vizuális kimenetek előállítására is; a bejelentésben példaként szerepeltek légcsatorna (wind tunnel) és sejtes illusztrációk, amelyekkel a modell aerodinamikai áramlások vagy vázlatos, interaktív sejtábrák generálására volt használható.

Működés és ügyfélélmények

A modell jobban ellenőrzi saját munkáját és alaposabb iterációkra képes. Korai tesztelések és ügyféljelentések több, konkrétan ismertetett esetet hoznak:

  • Egy Frontier-Bench feladatban Opus 5 saját számítógépes látásrutin írásával húzta ki a geometriát egy képből, majd újra felépítette a gépelemek 3D modelljét; más modellek ugyanazon környezetben több próbálkozás után sem tudták megoldani.
  • Egy nyílt forráskódú csomagkezelő hibáját Opus 5 javította úgy, hogy a közösségi patch által kihagyott gyökérokot találta meg és kezelte.
  • Egy tőzsdei adatfeed építése során Opus 5 saját teszthámot is létrehozott a bejövő adatok validálására, és egy munkamenet alatt elkészült a feeddel — korábbi modellek e feladatot nem tudták teljesíteni.

Számos vállalati partner és fejlesztő is beszámolt javulásokról különböző munkafolyamatokban: kódellenőrzés, pénzügyi modellezés, jogi ügynöki munkák, prezentációk előállítása és átírása, biológiai kutatások, valamint frontend- és vizuális munkák terén. Az ügyfélidézetek között szerepelnek vezetők és mérnökök a Cursor-tól, Zapier-től, Box-tól, JetBrains-től és más szervezetektől, akik a jobb pontosságot, kevesebb erőforrást és következetesebb eredményeket említik.

Igazságosság, igazítás és biztonság

Anthropic közölte, hogy a pre-deployment tesztelés során Opus 5 eddigi legerősebb igazodást (alignment) mutatta: az automata viselkedési audit szerint a legkisebb mért arányú félrevezető viselkedést produkálja, és kevésbé hajlamos rosszindulatú használatra való megtévesztésre. Az audit összesített "misaligned behavior" értéke 2,3, ami a legkisebb az utóbbi modellek között.

A cég hangsúlyozza, hogy Opus 5 nem lép előre veszélyes, kettős felhasználású képességekben (dual-use). Részletesebb értékelések szerint Mythos 5 továbbra is erősebb mind biológiai kutatásban, mind támadó célú kiberbiztonságban. Különösen a sérülékenységek megtalálásában Opus 5 és Mythos 5 hasonlóan teljesít, de a kihasználási (exploit) képességek terén Opus 5 jóval elmarad.

A bejelentés az OSS-Fuzz alapú értékelést idézi: Opus 5 megközelíti Mythos 5-et a sérülékenységek azonosításában, de a kihasználások fejlesztésében jelentősen rosszabb eredményt ér el.

Safeguardok és korlátozások

Anthropic hasonló védőintézkedéseket alkalmaz Opus 5-re, mint az Opus 4.8 esetében, de bizonyos kiberfeladatoknál szigorúbb korlátokat vezetett be. A cyber-osztályozók arányosan kevésbé restriktívek, mint Fable 5-nél: lehetővé teszik a forráskód-szintű sérülékenység-keresést, de blokkolják a bináris alapú sérülékenységvizsgálatot, a penetrációs teszteket és az exploit-generálást. A vállalat szerint a klaszterek beavatkozása várhatóan mintegy 85%-kal ritkább lesz, mint Fable 5 esetében.

A Claude.ai, Claude Code és Claude Cowork termékekben a jelzett (flagged) kérések alapértelmezetten Opus 4.8-ra esnek vissza (fallback). Az API-n is beállítható a fallback Opus 4.8-ra. Emellett működik a Cyber Verification Program (CVP), amely vállalati és kutatói partnerek számára kevésbé korlátozott Opus 5-verziót tesz elérhetővé olyan kiberbiztonsági munkához, amelyet egyébként a védelmi korlátok akadályoznának.

Biológiai felhasználásoknál Opus 5 hasonló védelmi készlettel rendelkezik, mint Opus 4.8; ennek következtében mostantól Opus 5 a legérzékelhetőbben képességekkel rendelkező általánosan hozzáférhető modell tudományos kutatásokhoz, de a hosszú, autonóm kutatási feladatokban továbbra is korlátai vannak, és Mythos 5 itt is erősebb.

Elérhetőség és ár

Claude Opus 5 2026. július 24-től minden platformon elérhető. A modell árazása megegyezik Opus 4.8 árával: 5 USD per millió input token és 25 USD per millió output token. Fejlesztők a claude-opus-5 modellen keresztül indíthatnak lekérdezéseket a Claude API-n.

Opus 5 Fast módban is elérhető, amely körülbelül 2,5×-ös sebességet kínál az alapértelmezett sebességhez képest; a Fast mód árazása kétszerese az Opus 5 alapárának, és hozzáférhető a Claude Platformon és usage credit formájában a Claude Code-ban.

A frissítés részeként két béta funkció is elindult:

  • Mid-conversation tool changes a Claude Platformon: egy beszélgetés közben a fejlesztők megváltoztathatják a Claude által használható eszközöket anélkül, hogy érvénytelenítenék a prompt cache-t.
  • Automatic fallbacks az API-n: ha a biztonsági osztályozók jelölnek egy kérést Opus 5-ön (vagy Fable 5-ön), a rendszer automatikusan átirányíthatja azt egy másik modellre helyettük, így alapértelmezés szerint a legjobb elérhető modellhez jut a kérés a blokkolás helyett.

Végül Anthropic megerősíti, hogy az Opus 5 általános hozzáférésnél nem tartalmaz adatmegőrzési kötelezettséget, és a fejlesztők számára egy prompting guide is elérhető a modell hatékony használatához.

Lábtörés

A közölt eredmények egyes benchmarkokra (például Frontier-Bench v0.1) belső futtatásokon alapulnak, részletes módszertannal: mini-SWE-agent harness, GKE backend, átlagos reward öt próbálkozásonként feladatonként. Opus 4.8 szolgált fallbackként a biztonsági osztályozó visszautasításai esetén Opus 5 és Fable 5 esetén.

(A bejelentés részletes technikai és biztonsági dokumentációt, valamint egy System Card-ot is tartalmaz a további adatokért.)