Biztonság

Mesterséges intelligenciával generált szöveg

Az Amazon ritka könyveket vásárol és gerincet vágva digitalizálja AI-tanítás céljára

A főszereplő az Amazon, amelyről a 404 Media számolt be, hogy ritka könyveket vásárol és fizikailag átalakítva digitalizálja azokat mesterséges intelligencia-tanításhoz.

Az Amazon ritka könyveket vásárol és gerincet vágva digitalizálja AI-tanítás céljára

A 404 Media vizsgálata szerint az Amazon nagy mennyiségben vásárol ritka könyveket, majd azokat úgy kezelik, hogy kivágják a gerincüket és beszkennelik őket gépi tanuláshoz. A cikk szerint egy ritka könyvbe rejtett követőeszköz végül egy Las Vegasban működő Amazon-telephelyen, a VGT3-on kötött ki.

A VGT3 telephelyet egy dinoszauruszt ábrázoló jelzés azonosítja, amely a történet szerint könyvet tart a karmai között. Az Amazon a 404 Media-nek adott nyilatkozatában azt közölte, hogy „könyveket vásárol kereskedelmi csatornákon keresztül, hogy javítsa az ügyfelek által használt termékeket és szolgáltatásokat.”

Miért érdekesek ezek a könyvek az AI-fejlesztők számára?

Nagyvállalatok, köztük az Amazon, hatalmas mennyiségű szöveges adattal képezik a nagynyelvi modelleket (LLM-eket). A nyílt interneten elérhető tartalmakat a modellek már részben feldolgozták, ezért értékes forrást jelentenek azok a kötetek, amelyek nincsenek fent az interneten, illetve régebbiek, nehezen hozzáférhetők.

A különösen értékes szövegek közé tartoznak az elavult kiadások és a nyomtatásban lévő, de digitálisan nem elérhető művek. Egy további indok: semmi, amit 2022 előtt publikáltak, nem írhatta egy LLM; ezért ezek a források segítenek elkerülni azokat a problémákat, amelyek akkor merülnek fel, ha modellek túl sok AI-által előállított szöveget sajátítanak el.

Kockázatok és viták

A 404 Media beszámolója emlékeztet arra is, hogy egyes cégeknél korábban jogi és etikai aggályok merültek fel a könyvek felhasználása kapcsán: például a szenzációsabb jelentések szerint más szereplők, köztük az Anthropic, illegálisan megszerzett könyveket is felhasználtak. Emellett a szakirodalomban ismert a „model collapse” jelenség kockázata: ha egy LLM túl sok mesterségesen előállított szöveget tanul meg, az a modell teljesítményének romlásához vezethet.

Mire érdemes figyelni továbbra is?

A történet a források nyomon követhetőségére, a szerzői jogi és etikai kérdésekre, valamint arra világít rá, hogyan szerzik be a nagy technológiai cégek a tréningadatokat. A gyakorlat további részleteit és a jogi vonatkozásokat a jövőben várhatóan további vizsgálatok és nyilatkozatok tisztázzák.