Biztonság

Mesterséges intelligenciával generált szöveg

Anthropic finomította a Fable 5 biológiai védelmi rendszereit, jelentősen csökkentve a fals riasztásokat

Az Anthropic bejelentette, hogy 2026.

Anthropic finomította a Fable 5 biológiai védelmi rendszereit, jelentősen csökkentve a fals riasztásokat

Dátum: 2026. augusztus 7.

Anthropic bejelentette, hogy módosításokat hajtott végre a Claude Fable 5 biológiai védelmi rendszerein (safety classifiers), amellyel jelentősen csökkentették a téves riasztások miatt bekövetkező „fallback” esetek számát. A vállalat tesztjei szerint a frissítés körülbelül 85%-kal csökkentette a biológiával kapcsolatos fallbackokat a termékszolgáltatásokon belül.

Mit jelent a változás a felhasználóknak?

A gyakorlatban a felhasználók sokkal kevesebb fallbackot tapasztalnak majd a mindennapi egészségügyi és oktatási kérdések esetén — például laboreredmények értelmezése, tünetek megértése és biológiai ismeretek tanulása kapcsán. Emellett az egészségügyi szakemberek is több támogatást kaphatnak a klinikai feladatokhoz Fable 5-től. Ugyanakkor Anthropic hangsúlyozza, hogy a modell továbbra is visszairányít (fallback) az Opus 5 modellhez olyan, általuk dual-use-nek tartott területekben, például virológia, toxikológia és molekuláris tervezés esetén; ezért professzionális biológiai kutatásra és gyógyszerfejlesztésre a Fable 5 jelenleg még nem használható teljes körűen.

Miért építettek erős védelmi rendszereket?

Anthropic célja, hogy a Fable 5 előremutató képességeit minél több felhasználóhoz juttassa, de ezzel együtt növekvő kockázatokat is kezelniük kell. A cég képességértékelései szerint a Fable 5 bizonyos komplex biológiai feladatokban szakértőket felülmúló vagy gyakorlati támogatást adó képességekre képes, ami hasznos lehet új orvosi kezelések fejlesztésében, ugyanakkor rossz kezekben kockázatot jelenthet — például biológiai fegyverek előállításának segítésében. Anthropic felhívja a figyelmet, hogy a hasznos és a káros felhasználások megkülönböztetése a biológia területén különösen nehéz, mert egyes terápiák kutatása során veszélyes anyagok előállítása is szükséges lehet (például élő vakcinák vagy bizonyos gyógyszerek fejlesztése kapcsán).

A cég említést tesz a US Intelligence Community 2026 Annual Threat Assessment dokumentumára, amely szerint a biotechnológiai fejlődés — köztük a szintetikus biológia és genom-szerkesztés — „új biológiai fenyegetésekhez vezethet”, és hogy több állami szereplőnek valószínűleg aktív támadó biológiai és kémiai programjai vannak. Anthropic ezért óvatosságból a Fable 5 indulásakor a biológiai kategória nagy részét blokkolta.

Hogyan működnek a biológiai védelmek?

Az egyik központi védőeszköz a safety classifier: kisebb automatizált AI-rendszerek, amelyek észlelik, ha a Fable 5-től olyan, védelem alá eső biológiai feladatot kérnek vagy veszélyes kimenetet kellene előállítani. Amikor a classifier „bekapcsol”, a rendszer a felhasználói kérést az Opus 5 modellhez irányítja — ez egy kevésbé biológiailag képzett modell, amely kevesebb segítséget tud nyújtani egy rosszindulatú szereplőnek.

A classifier pontos és gyors működtetése nem egyszerű: tanulnia kell a veszélyesnek ítélt (in scope) és engedélyezett (out of scope) tartalmak közti különbséget, miközben minimalizálni kell a false positive (téves riasztás) és false negative (elmulasztott veszély) eseteket. Emellett a rendszert ellenállóvá kell tenni a kijátszásra (jailbreak) irányuló próbálkozásokkal szemben.

Mit változtattak és hogyan fejlesztették a rendszert?

A Fable 5 indításakor a classifier nagyon széles körben működött, ami lehetővé tette a modell más területeken való elérését, de sok, valószínűleg ártalmatlan kérést is blokkolt. Az elmúlt hetekben Anthropic átírta a classifier „alkotmányát” — egy szabálygyűjteményt, amely segít megkülönböztetni a védett és megengedett tartalmakat —, részletesen kiszabva a megengedett, jóindulatú felhasználásokat. A módosításokhoz belső és külső szakértők széles körét kérdezték meg, majd az új konstitúció alapján frissített tanítóadatokat készítettek, a classifiert újratanították és ellenőrizték.

Az eredmény az lett, hogy a classifier továbbra is általában kivált a veszélyes és dual-use biológiai kutatási tartalmak esetén, ugyanakkor jóval több ártalmatlan és hasznos használatot engedélyez. A vállalat illusztrációval írja le, hogy a classifier határa (amely a blokkot kiváltó és engedélyező tartalmak között húzódik) jobbra tolódott, így kevesebb ártalmatlan kérdés esik a blokkolt tartományba.

Következtetések és további lépések

Anthropic szerint még sok munka van hátra a védelmi rendszerek továbbfinomításában. Várhatóan továbbra is lesznek false positive-ek — olyan kérések, amelyek nagyon alacsony kockázatúak, de a classifier biztonsági tartománya miatt mégis blokkolódnak. A cég megismétli, hogy dual-use professzionális biológiai és gyógyszerfejlesztési kérések blokkolva maradnak a további kockázatok miatt, és elkötelezett a biztonságos, skálázható, „trusted access” csatornák kialakítása mellett, hogy kutatók hozzáférhessenek a legképzettebb modellekhez.

Anthropic kéri a felhasználók visszajelzését, hogy tovább javíthassák a védelmi rendszereket.

Konkrét számok

  • A frissítés a cég belső tesztjei szerint körülbelül 85%-os csökkenést eredményezett a biológiával kapcsolatos fallbackok számában a termékfelületeken összességében.
  • Lábjegyzet szerint a teljes fallbackok száma várhatóan is csökken: kb. 67% csökkenés a Claude.ai szolgáltatásban, 55% Coworkon, 17% a Claude Code-ban és 7% a Claude Platformon.