Az AI‑startup Thinking Machines részletezte, hogyan közelítette meg az open weight (nyílt súlyú) modellek közzétételének biztonsági kérdését, és milyen lépéseket tett Inkling nevű modellje kiadása előtt. A vállalat módszertana belső értékelésekre, külső tesztelésre és finomhangolási kísérletekre épült, hogy felmérje a modell potenciálisan veszélyes képességeit.
Mit vizsgáltak belsőleg
Thinking Machines többtényezős belső értékeléseket hajtott végre egy széles agresszív használati és ártalomkategória‑taxonómia mentén. Ezek között szerepeltek:
- kettős felhasználású (dual‑use) területek, például CBRN (vegyi, biológiai, radiológiai és nukleáris) témák és támadó célú kiberbiztonsági feladatok;
- általános, visszaélésszerű használati minták, beleértve a közvetlen kéréseket káros tartalom vagy kártékony viselkedés előállítására, valamint ügynökszerű (agentic) és eszközhasználati helyzeteket;
- multimodális tartalmi értékelés: a modelleket káros promptokkal és azok rendben lévő hasonmásaival tesztelték 17 nyelven, különböző inputokkal (szöveg, kép, hang).
Külső tesztelés
A Thinking Machines négy független szervezettel végeztetett külső vizsgálatokat, amelyek különböző kockázati osztályokra fókuszáltak:
- általános visszaélés (general misuse) a Scale AI segítségével;
- sérülékeny felhasználókkal való interakció a Handshake AI bevonásával;
- CBRN és kiberbiztonsági kockázatok vizsgálata a FAR.AI‑val;
- irányíthatatlansági/veszteség‑kontroll viselkedések (loss‑of‑control) elemzése az Apollo Research által.
Finomhangolási tanulmány
A csapat finomhangolt változatokat is létrehozott: Inkling és Inkling‑Small olyan verzióit is, amelyeket kifejezetten úgy optimalizáltak, hogy ne visszautasítsanak, hanem inkább engedjenek a káros kérések teljesítéséhez, majd ezekkel futtatták le a kettős felhasználású értékeléseket. A megfigyelés szerint a „csak segítőkész” (helpful‑only) variánsok nem adtak jelentős javulást CBRN és kiberfeladatokban, és teljesítményük összehasonlítható maradt a meglévő open weight modellekkel.
Jövőbeni irányok és módszertani ötletek
Thinking Machines további, kevésbé kipróbált ötleteket is megfontol. Például vizsgálják annak lehetőségét, hogy a pre‑training (előtréning) során szelektíven kiszűrjenek bizonyos veszélyes ismereteket — például CBRN fejlesztési útmutatókat — úgy, hogy az ne rontsa a modell általános intelligenciáját. Egy másik javaslat az iteratív kiadás: a modell lépcsőzetes bevezetése (például először zárt, tulajdonosi API formájában, majd finomhangolási API, amely a háttérmodellre épül, és végül maga a modell publikálása).
Miért fontos ez
A Thinking Machines rávilágít, hogy az open weight modellek kezelése alapvetően befolyásolja a technológiához fűződő egyéni szuverenitást és szabadságot: a széles körű hozzáférés lehetővé teszi az „önrendelkezés” bizonyos formáit, ugyanakkor jelentős kettős felhasználási és nehezen előrejelezhető kockázatokat is hordoz. A vállalat hangsúlyozza: „ez a biztonságos út az open modellekhez csak akkor működik, ha az ökoszisztéma védelmei legalább olyan gyorsan javulnak, mint a modellek képességei.” Thinking Machines szerint ők a maguk részét vállalják azzal, hogy gondosan döntenek a kiadás tárgyáról és kutatják, hogyan válasszák szét az intelligenciát a veszélyes képességektől.
Összegzés
Thinking Machines Inkling kiadása előtt kombinált belső és külső tesztelést, valamint kontrollált finomhangolási kísérleteket hajtott végre, és nyitott további módszertani fejlesztésekre, például veszélyes tudás szelektív kiszűrésére és lépcsőzetes kiadásra. A cég megközelítése hangsúlyozza, hogy a biztonságos hozzáféréshez nemcsak a fejlesztők, hanem az egész ökoszisztéma védelmi képességeinek gyors javulása szükséges.



