Biztonság

Mesterséges intelligenciával generált szöveg

Claude modellje szöveges vízjellel jelzi az AI-eredetű tartalmat

Az Anthropic bejelentette, hogy Claude nagy nyelvi modelljeinek kimenetei szöveges vízjelet kapnak, hogy meg lehessen állapítani a Claude részvételének valószínűségét.

Claude modellje szöveges vízjellel jelzi az AI-eredetű tartalmat

Anthropic 2026. augusztus 14-én közölte, hogy a jövőbeli Claude modellek szöveges „vízjelet” fognak generálni. A lépés célja, hogy meg lehessen állapítani a valószínűségét annak, hogy a Claude részt vett-e a szöveg előállításában, és az intézkedést több nagy AI-szolgáltatóval együtt vezetik be az EU AI Actnak való megfelelés érdekében. Anthropic a július 2026-ban aláírt EU Code of Practice on Transparency of AI-Generated Content egyes előírásai szerint jár el; a kódex körülbelül 190 aláírót sorol fel, akik hasonló megoldásokat vezetnek be.

Hogyan működik a szöveges vízjel — az elv röviden

A Claude-típusú nagy nyelvi modellek szó szerinti kimenetet úgy állítják elő, hogy tokenenként — gyakorlatilag „szóról szóra” — választanak a lehetséges folytatások közül. Vannak olyan döntési helyzetek, amikor több szó is egyformán megfelelő lehet (például „overcast” vagy „grey” egy „The weather today was cold and …” kezdetű mondatban). A vízjelezés ezeket a kisebb jelentőségű, sokszor véletlenszerű választásokat használja arra, hogy egy rejtett mintát hagyjon a szövegben.

Technikailag a Claude most is véletlenszerűen választ, de a véletlenség forrását a vízjel kulcsa és a megelőző néhány szó határozza meg. A kimenet olvasó számára nem változik: a választott szavak továbbra is tűnnek véletlenszerűnek, és az értelem, a kreativitás és a olvashatóság nem módosul. Ugyanakkor aki rendelkezik a kulccsal, az megvizsgálhatja a szóválasztások sorrendjét, és valószínűségi becslést adhat arra, hogy a szöveget Claude állította-e elő.

Melyik módszert használják?

A Claude vízjele a Google DeepMind 2024-es Nature lapban bemutatott SynthID-Text megközelítésének változata; az elv pedig visszavezethető Scott Aaronson 2022-es javaslatára. Azonos tervezési elv: a vízjel a véletlenség forrását módosítja, nem pedig látható, beágyazott jelet ad a szöveghez.

Milyen hatása van a kimenetre, teljesítményre és költségre?

Anthropic szerint a vízjelezésnek nincs gyakorlati hatása a Claude által előállított szöveg minőségére, tartalmára vagy kreativitására. Belső tesztek és a SynthID-Text technikát bemutató vizsgálatok (például Google DeepMind forgalomkísérletei és kontrollált emberi értékelések) nem mutattak statisztikailag jelentős különbséget a vízjelezett és a nem vízjelezett válaszok között. A szolgáltatás sebességét és árát a vízjel elhelyezése elvileg nem növeli: nem generál plusz tokeneket, így nem lassítja vagy drágítja a modellt.

Biztonság, azonosíthatóság, és személyes adatok

A vízjel nem tartalmaz azonosító információt: nem fűzhető vissza egy adott felhasználóra, szervezetre vagy beszélgetésre. A kulcs és maga a módszer csupán azt teszi lehetővé, hogy valamilyen valószínűséget rendeljenek a Claude részvételéhez; nincs benne személyes adat vagy forrásazonosító.

Korlátok és gyenge pontok

  • A vízjel csak azt tudja jelezni, hogy Claude valószínűleg részt vett-e a szöveg létrehozásában; nem tudja biztosan megkülönböztetni azt, hogy „Claude írta ezt” vagy „Claude erősen szerkesztette a szöveget”.
  • Rövid szövegeken a detektálás kevésbé megbízható, mert kevesebb döntési pont áll rendelkezésre. Minél hosszabb a szöveg, annál nagyobb a konfidencia.
  • Tényközpontú, nagyon konkrét mondatoknál (ahol a következő token egyértelműen rögzített) a módszer nem tud hatékonyan működni. Ugyanez igaz a pusztán lektorált emberi szövegekre: ha csak néhány szerkesztés történik, lehet, hogy a vízjel nem mutatható ki.
  • A vízjel nem akadályozza meg teljesen a kijátszást: könnyű, apró szerkesztések általában nem tüntetik el teljesen a mintát, de egy teljes átírás már eltüntetheti a jelet.

Különleges esetek: kód, fordítás, fájlok

  • Kódnál, ahol pontos kimenet szükséges, a vízjel jellemzően kevesebb hatást gyakorol, mert a legtöbb helyzetben nincs alternatív, egyformán helyes token. Kommenteknél vagy olyan részeknél, ahol van választási lehetőség, a vízjel alkalmazható, de elenyésző hatása van a futtatható kódra.
  • Fordítások esetén, ahol Claude minden szót maga választ, a fordítás is vízjelezett lesz.
  • Ha Claude fájlt (például .png, .jpg, .svg) állít vagy dolgoz fel, a rendszer C2PA tartalmi hitelesítést (cryptographically signed content credential) csatol a fájl metaadataihoz. Ez nem a hagyományos értelemben vett látható vízjel: a fájl tartalma nem változik, hanem egy aláírt megjegyzés kerül a metaadatba, amely jelzi, hogy Claude hozta létre vagy dolgozta fel a fájlt. A C2PA egy nyílt ipari szabvány, amit kameragyártók és képszerkesztő szoftverek is használnak.

Ellenőrzés, API és bevezetés

Anthropic jelezte, hogy hamarosan elérhetővé tesz egy vízjel-detekciós API-t; a részletek kidolgozása folyamatban van. Az EU előírásai miatt a jelölést a globális bevezetéskor mindenhol alkalmazzák, mert jelenleg nincs tartós mód arra, hogy régiók szerint korlátozzák a vízjelezést. A 2026. augusztus 2-i határidővel kapcsolatban Anthropic dolgozik azon is, hogy a korábban indított Claude modellekre is kiterjessze a megoldást a következő hónapokban.

Miben különbözik ez a hagyományos AI-detektálástól?

Harmadik féltől származó AI-detektorok (például Pangram és hasonlók) más módszereket alkalmaznak: mintázatfelismerésre és stilisztikai jelekre támaszkodnak, mert ezek a szolgáltatók nem rendelkeznek a vízjel kulcsával. Az Anthropic által alkalmazott vízjel-ellenőrzés ezzel szemben kriptográfiai kulcson alapuló vizsgálat: nem a nyelvi „tells”-ekre épít, hanem arra, hogy a szóválasztások sorrendje konzisztens-e az adott kulccsal.

Jogok, felelősség és végkövetkeztetés

A vízjel használata nem változtat a tartalom tulajdonjogán vagy a jogi felelősségen: csak egy módszer arra, hogy valószínűségi becslést lehessen adni Claude részvételére. Az Anthropic csak akkor alkalmaz vízjelet, ha Claude részt vett a tartalom vagy fájl feldolgozásában.

Összefoglalva: Anthropic a SynthID-Texthez hasonló, rejtett mintázaton alapuló vízjelezést vezet be Claude-nál, amely olvasható szemmel nem észlelhető, nem növeli a költségeket, és a célja a megfelelés az EU előírásainak és a transzparencia növelése.