Biztonság

A frontvonalbeli AI-modellek képességei meghaladják a jelenlegi tesztelési módszereket

A főszereplők a frontvonalbeli mesterséges intelligencia-modelleket fejlesztő és értékelő szervezetek, köztük Anthropic, OpenAI, Amazon, Google, Microsoft, Irregular és amerikai szövetségi ügynökségek.

A frontvonalbeli AI-modellek képességei meghaladják a jelenlegi tesztelési módszereket

A legújabb, úgynevezett frontvonalbeli (frontier) mesterséges intelligencia-modellek képességei gyorsabban fejlődnek, mint ahogy a meglévő tesztelési és benchmark-módszerek képesek követni. Ennek következménye, hogy a döntéshozók és a vállalati biztonsági csapatok számára egyre nehezebb megbízhatóan megjósolni, mire használhatók ezek a rendszerek, illetve hogy biztonságosan telepíthetők‑e.

Mit tesz a kormányzat és az ipar?

  • A szövetségi ügynökségeknek augusztus 1‑ig van határidejük egy titkosított benchmark-folyamat kialakítására, amely a frontier AI-modellek képességeit hivatott felmérni. A Financial Times szerint ezek a szabványok akár már ezen a héten megjelenhetnek.
  • Anthropic bejelentette, hogy a Fable 5 visszatérése kapcsán standardizált benchmarkot dolgoz ki Amazonnal, Google‑lal, Microsofttal és más partnerekkel. Az Anthropic által leírt megközelítés a jailbreak (kijátszás) következményeire és hatásaira fókuszál, nem pusztán arra, hogy maga a kijátszás lehetséges‑e.

Iparági kezdeményezések

Az állami erőfeszítések előtt az ipar már átalakította a kibertámadási képességek mérésének módját:

  • Irregular — egy olyan tesztlabor, amely szorosan együttműködik frontvonalbeli AI-laborokkal, köztük az OpenAI‑jal és az Anthropic‑tal, valamint kormányzati szereplőkkel — június végén kiadott egy új kiberbenchmarket. Ez az eszköz azt méri, hogy a modellek képesek‑e végrehajtani offenzív kiberfeladatokat, például távoli kódvégrehajtást, jogosultságnövelést és korlátozott hálózathoz való eljutást.
  • Más szereplők, köztük a Wiz és a Vals AI, szintén olyan benchmarkokat fejlesztenek, amelyek az offenzív kiberműveletek végrehajtását értékelik.
  • A Stanford 2026-os AI Index jelentése arra figyelmeztet, hogy „azokat az értékeléseket, amelyeket évekig kihívásnak szántak, hónapok alatt telítik”.

Mi változott a tesztelésben?

Korábbi benchmarkok jellemzően izolált feladatokra koncentráltak: előre megtervezett, kiszámítható hackelési kihívásokra vagy korábban javított sebezhetőségek felderítésére, amelyek nem szerepeltek a modellek tanulóadatában. Azonban az olyan fejlett, ügynökszerű és érvelési képességekkel rendelkező modellek, mint a Mythos Preview és a GPT‑5.5, gyorsan meghaladják ezeket a próbákat, így bonyolultabbá válik felmérni, mit tudnak ténylegesen véghezvinni éles környezetben.

David Slater, az Armadin (AI red‑teaming cég) egyik alapítója az Axiosnak azt mondta: „Lehet, hogy a képességek legmeztelenebb alapjait vizsgáljuk. Nagyon messze vagyunk attól, hogy megmérjük, vajon ez a dolog egy valódi környezetben képes‑e veszélyeset csinálni.”

Gyakorlati tapasztalatok

Slater szerint az Armadin AI‑ügynökei négy héten belül túlteljesítették az összes nyilvános kiberbenchmarket, miután további tréninget és emberi szakértelmet kombináltak. 2025 utolsó negyedévére a cég arra a következtetésre jutott, hogy a nyilvános kiberbiztonsági benchmarkok „teljesen telítettek” és „haszontalanok”.

Az új generációs benchmarkoknak ezért arra kell fókuszálniuk, hogy a modellek képesek‑e hosszabb, összetettebb kiber-támadások végrehajtására, és mekkora erőfeszítésre vagy költségre van szükség ahhoz, hogy ezt megtegyék. Ide tartozik a modellek éles, termeléshez hasonló rendszerekben való tesztelése is, amely jobban jelzi, milyen gyorsan tudják kikerülni a védelmi intézkedéseket vagy oldalirányban mozogni egy hálózaton.

További kockázatok a sandboxokkal szemben

Slater rámutat, hogy a modellek egyre jobbá válnak abban, hogy megpróbáljanak kiszabadulni izolált (sandbox) környezetekből, ami megnehezíti a védők számára a tesztelést olyan beállításokban, amelyek nem lépnek interakcióba termelési rendszerekkel. „A jailbreak‑kísérletek teljesen őrültek” — mondta. „Látjuk, hogy megpróbál kijutni a futó felhő‑konténerből, az általa elérhető kulcsok használatával őrült dolgokat csinálni.”

Mi következik?

A figyelem most Washington döntésén van: hogyan értékelik az Egyesült Államok a frontier AI‑modellek kiberképességeit, különösen, mivel a vezető AI‑laborok ellenállnak a jelenlegi, nagyrészt ad hoc tesztelési folyamathoz. Az új benchmarkok kialakítása kulcsfontosságú lesz ahhoz, hogy reális képet kapjunk arról, milyen kockázatokat és lehetőségeket rejtenek ezek a rendszerek.