Biztonság

Mesterséges intelligenciával generált szöveg

Hogyan teszteljük az open weight modelleket: a Thinking Machines módszertana

A főszereplő a Thinking Machines, amely az Inkling és Inkling-Small nyílt súlyú modellek kiadása előtt részletes tesztelési módszertant dolgozott ki.

Hogyan teszteljük az open weight modelleket: a Thinking Machines módszertana

Az AI‑startup Thinking Machines részletezte, hogyan közelítette meg az open weight (nyílt súlyú) modellek közzétételének biztonsági kérdését, és milyen lépéseket tett Inkling nevű modellje kiadása előtt. A vállalat módszertana belső értékelésekre, külső tesztelésre és finomhangolási kísérletekre épült, hogy felmérje a modell potenciálisan veszélyes képességeit.

Mit vizsgáltak belsőleg

Thinking Machines többtényezős belső értékeléseket hajtott végre egy széles agresszív használati és ártalomkategória‑taxonómia mentén. Ezek között szerepeltek:

  • kettős felhasználású (dual‑use) területek, például CBRN (vegyi, biológiai, radiológiai és nukleáris) témák és támadó célú kiberbiztonsági feladatok;
  • általános, visszaélésszerű használati minták, beleértve a közvetlen kéréseket káros tartalom vagy kártékony viselkedés előállítására, valamint ügynökszerű (agentic) és eszközhasználati helyzeteket;
  • multimodális tartalmi értékelés: a modelleket káros promptokkal és azok rendben lévő hasonmásaival tesztelték 17 nyelven, különböző inputokkal (szöveg, kép, hang).

Külső tesztelés

A Thinking Machines négy független szervezettel végeztetett külső vizsgálatokat, amelyek különböző kockázati osztályokra fókuszáltak:

  • általános visszaélés (general misuse) a Scale AI segítségével;
  • sérülékeny felhasználókkal való interakció a Handshake AI bevonásával;
  • CBRN és kiberbiztonsági kockázatok vizsgálata a FAR.AI‑val;
  • irányíthatatlansági/veszteség‑kontroll viselkedések (loss‑of‑control) elemzése az Apollo Research által.

Finomhangolási tanulmány

A csapat finomhangolt változatokat is létrehozott: Inkling és Inkling‑Small olyan verzióit is, amelyeket kifejezetten úgy optimalizáltak, hogy ne visszautasítsanak, hanem inkább engedjenek a káros kérések teljesítéséhez, majd ezekkel futtatták le a kettős felhasználású értékeléseket. A megfigyelés szerint a „csak segítőkész” (helpful‑only) variánsok nem adtak jelentős javulást CBRN és kiberfeladatokban, és teljesítményük összehasonlítható maradt a meglévő open weight modellekkel.

Jövőbeni irányok és módszertani ötletek

Thinking Machines további, kevésbé kipróbált ötleteket is megfontol. Például vizsgálják annak lehetőségét, hogy a pre‑training (előtréning) során szelektíven kiszűrjenek bizonyos veszélyes ismereteket — például CBRN fejlesztési útmutatókat — úgy, hogy az ne rontsa a modell általános intelligenciáját. Egy másik javaslat az iteratív kiadás: a modell lépcsőzetes bevezetése (például először zárt, tulajdonosi API formájában, majd finomhangolási API, amely a háttérmodellre épül, és végül maga a modell publikálása).

Miért fontos ez

A Thinking Machines rávilágít, hogy az open weight modellek kezelése alapvetően befolyásolja a technológiához fűződő egyéni szuverenitást és szabadságot: a széles körű hozzáférés lehetővé teszi az „önrendelkezés” bizonyos formáit, ugyanakkor jelentős kettős felhasználási és nehezen előrejelezhető kockázatokat is hordoz. A vállalat hangsúlyozza: „ez a biztonságos út az open modellekhez csak akkor működik, ha az ökoszisztéma védelmei legalább olyan gyorsan javulnak, mint a modellek képességei.” Thinking Machines szerint ők a maguk részét vállalják azzal, hogy gondosan döntenek a kiadás tárgyáról és kutatják, hogyan válasszák szét az intelligenciát a veszélyes képességektől.

Összegzés

Thinking Machines Inkling kiadása előtt kombinált belső és külső tesztelést, valamint kontrollált finomhangolási kísérleteket hajtott végre, és nyitott további módszertani fejlesztésekre, például veszélyes tudás szelektív kiszűrésére és lépcsőzetes kiadásra. A cég megközelítése hangsúlyozza, hogy a biztonságos hozzáféréshez nemcsak a fejlesztők, hanem az egész ökoszisztéma védelmi képességeinek gyors javulása szükséges.