Eszközök

Cisco ingyenes keresője majdnem 900 nyílt modell ujjlenyomatával és származási adataival

A fő szereplő a Cisco Foundation AI és annak Model Provenance Kitjére és új AI Supply Chain Provenance Explorerére épülő kezdeményezés, amely ingyenesen elérhető adatbázist publikált.

Cisco ingyenes keresője majdnem 900 nyílt modell ujjlenyomatával és származási adataival

Cisco ma elérhetővé tette az AI Supply Chain Provenance Explorer nevű ingyenes, nyilvános adatbázist, amely közel 900 nyílt modellt tartalmaz és fájlszintű ujjlenyomatokat, szerzői jogi/licenc-adatait, szolgáltatói székhelyet és fájlok szkennelési számlálóját jeleníti meg. A szolgáltatás a cég áprilisban kiadott, nyílt forrású Model Provenance Kitjére épít, amely súlyszintű ujjlenyomatokat készített körülbelül 150 alapmodellről több mint 45 családból és 20+ publikálóból; a lefedettség azóta nagyjából hatszorosára nőtt egy negyedév alatt.

Miért volt szükség erre?

A jelenlegi gyakorlatban a biztonsági csapatok egy modell ellenőrzését gyakran a repository oldalán kezdik, amely a modellel kapcsolatos metaadatokat — például a feltöltő által beírt base_model taget — listázza. A Hugging Face nem követeli meg, hogy a feltöltő súlyszintű bizonyítékkal igazolja a bejelentett származást. Ennek következményeként a modell-származtatás felderítése ma manuális, hibára és hiányos információra épülő folyamat.

A probléma méretét érzékelteti az ATOM Report (Nathan Lambert és Florian Brand, Interconnects AI, április 2026): az ATOM mintegy 1,500 főbb nyílt modellt követett nyomon, és a Hugging Face base_model tagre építve azonosította a származékokat. E mérések szerint az Alibaba Qwen család a bejelentett szülője a 2026. februárig keletkezett új nyílt modell-származékok 69%-ának (2024. januárban ez az arány 1% volt). Összességében a kínai laborok 70%-os részesedést képviselnek, Európa pedig 4%-ot; a három régió kumulatív, követett letöltésszáma 2026. márciusig 2.04 milliárd volt.

Mit mér és hogyan működik az Explorer?

A Cisco eszköze a hasonlósági pontszámokra alapozza a modellek közötti kapcsolatokat, nem pusztán az önbevallásra. A Model Provenance Kit kétlépcsős ujjlenyomat-eljárást használ:

  • Első lépésben architektúra-metadata összehasonlítása történik súlyok betöltése előtt.
  • Ha a metaadat nem egyértelmű, a második szakasz öt súlyszintű jelből álló összevetést végez: Embedding Anchor Similarity, Embedding Norm Distribution, Norm Layer Fingerprint, Layer Energy Profile és Weight-Value Cosine.

A Cisco saját 111-párból álló benchmarkján 0.70-es küszöbértéknél 96.4% pontosságot és 0.963 F1-értéket jelentett; négy pár hibásan osztályozódott, mind extrém architektúraváltás miatt, amelyet a cég a páronkénti súlyösszehasonlítás alapvető korlátjának nevez.

A tokenizert érintő jeleket diagnosztikai célokra számítják ki, de szándékosan kizárják a végső származási pontszámból, hogy elkerüljék a hamis pozitívokat: például a StableLM és a Pythia ugyanazt a GPT‑NeoX tokenizert használja, még ha súlyszinten nincs is közös leszármazás.

A statikus (súlyszintű) ujjlenyomatok mellett a viselkedésalapú ujjlenyomatok is szerepet kapnak. Project VAIL és Daniel Kang (UIUC) kutatásai a viselkedésbeli végpont-stabilitásról mutatták, hogy egy modell végpontja futásidőben megőrizheti "egészséges" viselkedését, miközben identitása súlyfrissítések, kvantálás vagy routing hatására megváltozik. A Cisco bevezető blogja szerint az Explorer mindkét megközelítést integrálja: a statikus ujjlenyomatok súlyszintű bizonyítékot adnak tréning-idejű leszármaztatásra, míg a viselkedésalapú elemzés runtime identitásdriftet fog meg.

Mit mutat még az Explorer, és mi marad korlátozott?

Az Explorer riportjai között megjelenik a szolgáltató székhelye, a licenckorlátozások összegzése, valamint fájlszkennelési számláló és ClamAV-alapú malware/unsafe-file talált eredmények. A Cisco Foundation AI egy frissített ClamAV motort futtat minden nyilvános Hugging Face fájlon, és fájlszintű jelvényt (badge) jelenít meg. Ugyanakkor a Hugging Face dokumentációja szerint az, hogy egy fájl nem kapott "ok" vagy "infected" jelvényt, azt jelentheti, hogy sorban áll, még vizsgálódnak rajta, vagy hibába futott — tehát korábban a lefedettség inkább feltételezés volt, mint olvasható attribútum.

Fontos korlátok:

  • Az Explorer körülbelül 900 modellt fed le, míg a Hugging Face 2026 tavaszán több mint 2 millió modellt hostolt. A sok modell kívül marad a súly-alapú adatbázison, és ezeknél továbbra is a feltöltő által megadott tagre kell hagyatkozni.
  • A Cisco nem jelzett nyilvános API-t az Explorerhez; API hiányában a csapatok kézi lekérdezéssel dolgozhatnak, de a keresés nem egyszerűsíthető automatikusan CI/CI/CD kapukba. Ez a különbség a governance-objektum és a valódi kontroll között.

Szabályozási és működési következmények

Az EU AI Act végrehajtási hatásköre 2026. augusztus 2-án lép életbe a GPAI model provider-ekre; a bírságok elérhetik a 15 millió eurót vagy a globális forgalom 3%-át, attól függően, melyik magasabb. A Bizottság útmutatása szerint az, aki lényegesen módosít és egy nyílt modellt helyez az EU-piacra, provider státuszt szerezhet; a módosítás számítási igénye, amely meghaladja az eredeti modell egyharmadát, ebbe a kategóriába eshet. Az AI Act nyílt forrású kivétele (53. cikk (2)) olyan valóban szabad és nyílt licencet követel, amely engedélyezi a hozzáférést, használatot, módosítást és újraelosztást, valamint teljeskörű publikus információt a súlyokról, architektúráról és használatról — pusztán a publikus súlyok megléte nem elegendő.

Az ATOM adatai szerint a Llama és a Gemma együtt a új származékok körülbelül ötödét adják, és mindkettő olyan licenceket használ, amelyeket a Bizottság kritériumai valószínűleg kizárnának. Ennek következtében a licencosztályozás a provenance-felülvizsgálat részévé válik — és éppen ezt emeli ki az Explorer.

Mit kell rögzíteni az engedélyezési (approval) jegyzőkönyvben?

A Cisco ajánlása szerint négy mezőnek kell szerepelnie egy modell jóváhagyási rekordjában, amit sok szervezet ma még nem kezel:

  1. Súly-alapú, ujjlenyomatokkal alátámasztott leszármaztatás (nem csak a self-reported tag).
  2. Fájlok-szkennelési száma, amely a vizsgálati lefedettséget mérhetővé teszi a jelvényfeltételezés helyett.
  3. Szolgáltató székhelye (jurisdikció), weboldal és kapcsolódó HF szervezetek — felismerve, hogy a székhely önmagában nem rendez minden exportkontroll-kockázatot.
  4. Licenc-lánc: az upstream feltételek összegzése, hogy a jogi csapatok előre azonosíthassák a potenciális korlátozásokat.

A Cisco Explorer elérhető a provenance.aidefense.cisco.com címen, ingyenesen és fiók nélkül.

Mit változtat ez egy biztonsági csapat napi munkáján (például 2026. július 30-án)?

A legfontosabb hatás az, hogy a "mely termékeink örökölték az adott alapmodell sebezhetőségét és honnan tudjuk" kérdésre egy részben automatizált lekérdezés ad választ a lefedett modellek esetén, a korábbi manuális keresés helyett. Az Explorer nem old meg minden problémát, de a súlyszintű ujjlenyomatok, a fájl-szkennelési számlálók, a szolgáltatói adatok és a licenc-lánc megjelenítése mind olyan mérhető mezők, amelyeket a jóváhagyási jegyzőkönyvbe érdemes felvenni a kockázatkezelés javítása érdekében.