Az Anthropic bejelentette, hogy a Claude nevű chatbotja által generált tartalmakat megjelöli: a szövegekre egy láthatatlan, statisztikai jellegű vízjelet helyez, míg a támogatott képi formátumoknál (például PNG, JPG, SVG) aláírt metaadatok jelzik a mesterséges intelligencia részvételét.
Miért vezetik be a jelölést?
A mesterséges intelligencia egyre élethűbb tartalmakat állít elő, ezért nő a nyomás az AI-szolgáltatókra, hogy átláthatóvá tegyék az általuk készített vagy módosított anyagokat. Az Európai Unió új, frissen hatályba lépett előírásai megkövetelik, hogy a generatív AI-rendszerek szolgáltatói felismerhetővé tegyék a mesterségesen létrehozott vagy manipulált tartalmakat, ami közvetlenül érinti a most bejelentett megoldást.
Milyen technikát használnak a szövegeknél?
Az Anthropic egy a Google DeepMind SynthID-Text módszeréhez hasonló megközelítést alkalmaz a szövegek „vízjelezésére”. A módszer nem rejtett karaktereket illeszt a szövegbe, hanem a generálás során kiválasztott szavak statisztikai eloszlását enyhén módosítja. A nagy nyelvi modellek minden egyes következő szó kiválasztásakor több lehetséges folytatás közül választanak; a vízjel ezt a választási valószínűséget kis mértékben eltolja. Egyetlen mondatban ez nem észrevehető, de több ezer vagy tízezer szó után ezek az apró eltolódások összeadódva statisztikailag felismerhető mintát eredményeznek.
Az Anthropic hangsúlyozza, hogy a vízjel nem változtatja meg a jelentést vagy az olvasói élményt: a vízjelezett és a vízjel nélküli szöveg emberi olvasó számára megkülönböztethetetlen lesz. Ugyanakkor a vízjel utólagos ellenőrzéssel kimutathatóvá teheti, hogy a szövegben Claude valószínűleg részt vett. A cég az ellenőrzésre külön vízjel-detektáló API-t is tervez, de ennek részleteiről még nem közölt információkat.
Az Anthropic elismeri a módszer korlátait: a vízjel jelzésértékű, de nem abszolút bizonyíték arra, hogy egy adott szöveget kizárólag mesterséges intelligencia készített; a vízjel a Claude által választott tokenekhez kapcsolódik, ezért nem választja szét a szerzőséget és az utólagos szerkesztést.
Képi tartalmak: aláírt metaadatok a C2PA szabvány szerint
Ha Claude egy támogatott képfájlt (PNG, JPG, SVG) hoz létre vagy dolgoz fel, az Anthropic a fájl metaadataihoz kriptográfiailag aláírt megjegyzést csatol a nyílt C2PA (Content Authenticity Initiative) szabvány szerint. Ez nem jelenít meg látható „AI által készült” feliratot a képen, hanem a metaadatokban rögzíti, hogy Claude készítette vagy dolgozta fel az adott fájlt. Az aláírt hitelesítő adatok személyes adatokat nem tartalmaznak, és a kriptográfiai aláírás segíthet felderíteni, ha később a metaadatokat vagy a fájlt manipulálták.
Bevezetés ütemezése és hatások
Az Anthropic szerint az augusztus 2-án vagy azt követően piacra dobott modellek már támogatják a bevezetéskori jelölést. A vállalat azon dolgozik, hogy az EU-s jogszabályok által megengedett átmeneti időszakban az elkövetkező hónapokban a régebbi modellekhez is hozzáadja ezt a funkciót. Bár a követelmény Európára vonatkozik, az Anthropic a kezdetektől világszerte alkalmazni fogja a vízjelezést, indoklásuk szerint még nincs megoldás a régiónkénti korlátozásra.
A cég közlése szerint a vízjelzés elhanyagolható hatással lesz a modellek teljesítményére, nem generál extra tokeneket, és a szolgáltatás kiszolgálása, illetve használata nem jár többletköltséggel.
Összefoglalás
Az Anthropic lépése a szabályozói elvárásokra és a növekvő átláthatósági igényekre reagál: statisztikai vízjeleket alkalmaz a szövegeknél és kriptográfiailag aláírt metaadatokat a képeknél, egyúttal fejleszt egy detektáló API-t is. A megoldás jelezheti a Claude részvételét, de nem ad végleges bizonyítékot a szerzőségre, és nem változtat az emberi olvasók számára érzékelt tartalmon.



