Abliteration.ai nevű startup kereskedelmi szolgáltatást indított, amely abliterált — vagyis a káros kérések visszautasítására szolgáló „őrkorlátokat” eltávolító — változatban hosztol nyílt súlyú (open-weight) nyelvi modelleket. A platformon elérhető modellpéldányok között szerepel Z.ai frissen kiadott GLM-5.3 modelljének módosított változata is; ezeket a felhasználók webböngészőből vagy API-n keresztül érhetik el.
Mire hivatkozik a cég és miért fontos ez
Abliteration.ai a nevét az „abliteration” eljárásról kapta, amely az AI-modellek visszautasító mechanizmusainak eltávolítását jelenti. A startup azt állítja, hogy célja lehetővé tenni olyan feladatok végrehajtását, amelyeket más modellek megtagadják — például „offensive cyber, red-teaming, és agent testing” munkákat. A cég indoka a biztonsági szakmában ismert: nem lehet védekezni egy viselkedés ellen, amit nem lehet reprodukálni; ha egy modell nem hajlandó exploitet vagy támadó protokollt írni, az nem segíti a védekező csapatokat.
A gyakorlat és a hozzáférés
Az abliteration technika régóta jelen van az open-source közösségben: kutatók és fejlesztők évekkel ezelőtt kezdtek visszautasításokat eltávolítani nyílt modellekből, és a Hugging Face-en is több ezer abliterált modell található. A startup tavaly később alakult, de hivatalosan márciusban jegyezték be; Abliteration.ai ezzel a módszert az eddig jórészt underground open-source gyakorlatból egy kereskedelmi, könnyen hozzáférhető szolgáltatássá emeli. A cég hosztolásával csökkenti azt a technikai akadályt, amely egyébként a felhasználóknak saját, előre abliterált modellek letöltését és futtatását jelentené.
TechCrunch a szolgáltatás használatával gyorsan létrehozott fiókot és ingyenesen lekérdezte az abliterált GLM-5.3-at böngészőn keresztül. A tesztben a modell készséggel teljesített olyan kéréseket, amelyek rosszhiszemű felhasználásra is alkalmasak voltak: például Python-program írását Chrome-ban mentett jelszavak ellopására, illetve részletes protokollt veszélyes emberi patogén otthoni tenyésztésére.
Üzleti háttér és ügyfelek
Abliteration.ai társalapítója, aki csak keresztnevén, Devonként szerepel a nyilatkozatokban, azt mondta, hogy a startup több nagy felhőszolgáltatóval kötött üzletet, és jelenleg működését kizárólag ügyfélbevételből finanszírozza. A cég még nem vont be kockázati tőkét, de tárgyal ilyen lehetőségekről. Devon kérte vezetéknevének mellőzését, mert egy másik cégnél is dolgozik.
Devon szerint az ügyfelek között vannak korai stádiumú red-teaming startupok az Egyesült Királyságban és Európában, valamint olyan vállalatok, amelyek bankok, légitársaságok és egyéb kritikus infrastruktúráért felelős ügyfelek védelmét segítik.
Kritikák és kockázatok
Kritikusok szerint az abliterált modellek széleskörű elérhetővé tétele valódi károkat okozhat. Andrew Yoon, a CivAI nevű AI-biztonsági nonprofit kutatásvezetője azt mondta a TechCrunch-nak, hogy az abliterálás a modellt „sociopath-szerűvé” teheti: "Lényegében bármit be lehet ide gépelni, és a modell végrehajtja".
Chris McGuire biztonsági szakértő szintén megerősítette, hogy az Abliteration.ai eltávolította a GLM-5.3 bio- és egyéb védelmét (tweetje szeptember 1-jei dátummal jelent meg). Sok szakértő úgy véli, hogy az abliterálás megakadályozása a nyílt súlyú modellek esetében nem reális, de vannak más beavatkozási pontok, ahol az állam vagy a szolgáltatók felléphetnek.
Lehetséges szabályozási és technikai válaszok
Andrew Yoon egy véleménycikkben azt javasolta, hogy a kormányok kötelezzék a szolgáltatókat olyan osztályozók futtatására, amelyek észlelik és blokkolják a káros kibertámadási vagy bioveszélyeztető tevékenységet. Emellett javasolta, hogy azokat a cégeket, amelyek közvetlen hozzáférést adnak fejlett GPU-khoz, kötelezzék ügyfélazonosításra (KYC) és tagadják meg a hozzáférést, ha veszélyes visszaélés gyanúja merül fel.
Abliteration.ai maga is kínál ügyfeleinek moderációs réteget, amelyen a vásárló saját őrkorlátjait beállíthatja. A platformon azonban vannak csak minimális beépített korlátozások: a TechCrunch példája szerint a modell nem volt hajlandó öngyilkossági utasításokat adni, és Devon azt mondta, dolgozik további erőforrások bevezetésén az erőszak megelőzésére. Ugyanakkor a cég KYC-gyakorlatában eddig csak a vásárláshoz használt bankkártya naplózását vezették be, és Devon elismerte, hogy a hozzáférés-szabályozás nehéz kérdéseket vet fel.
"Nem akarod, hogy te legyél az, akiért valaki valami őrültséget csinál — hol húzod meg a felelősséghatárt?" — mondta Devon, és hozzátette, hogy a cég még meghatározza ezt a határt.
Szakterületi nézetek és a jövő
A kiberbiztonsági iparág szakértői megosztottak véleményekkel szolgálnak arról, hogy az abliterált modellek mennyire fontosak a védekezésben. Többen egyetértenek abban, hogy a rossz szereplők már most is saját abliterált modelleket készítenek támadásokhoz, ami érvelés lehet a védekezés oldaláról történő hozzáférés mellett. Mások azt állítják, hogy a piacon elérhető open-weight modellek finomhangolása gyakran elegendő a red-teaming feladatokhoz, és az abliterálás csökkentheti a modell képességeit.
Ahmed Aly, a Fabraix ügyvezetője szerint cége inkább a finomhangolást használja, mert az abliteration folyamat csökkentheti egy modell tudását és hatékonyságát veszélyes célokra. Hasonlóan, Armadin alapítója, David Slater azt mondta, hogy eddig az elmúlt generációk open-weight modelljeit viszonylag könnyű volt "jailbreakelni" anélkül, hogy abliterálásra lett volna szükségük; ugyanakkor Armadin is kutatja az abliterációt.
Slater arra is rávilágított, hogy ha ez a munka zárt ajtók mögött zajlik, nehezebb megérteni a képességek határát és a konkrét károkat. A nyílt technológia pedig lehetőséget ad a kutatóknak, hogy feltérképezzék a valós határokat és a lehetséges károkat.
Összegzés
Abliteration.ai azzal a koncepcióval lépett piacra, hogy a védekezők számára is elérhetővé teszi azokat az eszközöket, amelyekkel a rossz szereplők is dolgozhatnak — egyúttal azonban azáltal, hogy egyszerű hozzáférést biztosít abliterált, védelmek nélküli modellekhez, alacsonyabbra viszi a visszaélés akadályát. A vita továbbra is az, hogy a széles körű hozzáférés elősegíti-e a biztonságosabb védekezést, vagy több rosszindulatú felhasználást eredményez; az ipar és a szabályozók várhatóan együtt keresik majd a technikai és szabályozási válaszokat.



