Modellbevezetés

Mesterséges intelligenciával generált szöveg

Anthropic bemutatja az Opus 5.5 modellt alacsonyabb díjakkal és Fable-szintű teljesítménnyel

Az Anthropic bemutatta az Opus 5.5 modellt, amelyet a cég szerint kedden adtak ki és új állástudományos mércét állít fel kódolási és tudásmunka teljesítményben.

Anthropic bemutatja az Opus 5.5 modellt alacsonyabb díjakkal és Fable-szintű teljesítménnyel

Anthropic kedden adta ki legújabb nyelvi modelljét, Opus 5.5 néven. A vállalat közlése szerint az Opus 5.5 az eddigi legjobb teljesítményt nyújtja a kódolási és tudásmunka-benchmarkokban, és sok feladatban felülmúlja a nagyobb Fable modellt. A Claude termékcsalád csúcsán álló Opus a legképzettebb és legdrágább réteg; a középső szintet Sonnet, a leggyorsabb és legolcsóbb réteget pedig Haiku képviseli.

Ár és sebesség

Az új verzió jelentős árszállítást hoz az elődhöz képest: az Opus 5.5 esetén az output tokenekért 20 dollárt számítanak fel milliónként, szemben a korábbi 25 dollárral. A cég szerint más mérések is hasonló árcsökkenést mutatnak. Emellett a modell futtatása gyorsabb, ami azzal magyarázható, hogy kevesebb számítási erőforrást igényel a kiszolgálása.

Kommunikáció és viselkedés

Az Opus 5.5 változtatásokat hoz a modell kommunikációjában: a rendszer kevésbé hajlamos szakzsargon használatára, és nagyobb valószínűséggel helyezi a fontos információkat a válaszai elejére. Anthropic szerint ez a változás a használhatóságot és az érthetőséget javítja.

Kiadási ütem és további modellek

Az Opus 5.5 megjelenése alig két hónappal követi az Opus 5 július 24-i kiadását. A bejelentés szerint a Sonnet 5.5 és Haiku 5.5, amelyek a Claude-sorozat következő rétegei, "a következő hetekben" válnak elérhetővé, hasonló teljesítményjavulással.

Biztonság és korlátozások

Anthropic azt közölte, hogy az Opus 5.5 biológiai és kiberbiztonsági képességei a Mythoséhoz hasonlíthatók, ezért a modellkiadás ugyanazoknak a korlátozásoknak és védelmi intézkedéseknek van alávetve, mint a Fable. Ezek az intézkedések megakadályozzák például, hogy a modelleket könnyen lehessen használni lefordított programok hibáinak felfedezésére vagy felismerhető biológiai fegyverek fejlesztésére.

A modell biztonsági képzése nagyrészt hasonló volt a korábbi verziókéhoz: az igazítási vizsgálatokat és a kiadás előtti értékeléseket külső szervezetek, például METR és Frontier Design végezték.

Vezetés és a fejlődés ütemezése

Ez az első modellkiadás azóta, hogy Anthropic vezérigazgatója, Dario Amodei támogatásáról biztosította az úgynevezett "frontier pacing" megközelítést — vagyis a képességek fejlesztésének szándékos lassítását, hogy a biztonsági és igazítási munkák felzárkózhassanak. Amodei egy korábbi bejegyzésében azt írta: „Meggyőződésem, hogy a kockázatok teljes körű kezelése még nagyobb óvatosságot igényel, nem csak a kockázatmegelőzésbe történő befektetést, hanem a képességek fejlődési ütemének ütemezését is, hogy a kockázatmegelőzésnek legyen ideje lépést tartani."

Anthropic hangsúlyozta, hogy fejlettebb képzési és értékelési rendszereket készítenek elő a jövőbeni modellekhez, beleértve javított biztonsági és monitorozási rendszereket. A cég azt írta, hogy várhatóan további részleteket oszt meg ezekről az erőfeszítésekről a közeljövőben.