Amikor Alexandru Voica, a videógeneráló startup Synthesia vállalati kapcsolatokért felelős vezetője a nyáron elküldte nekem a legújabb PR-csapatuk tagjának linkjét, meglepett. Az volt: egy interaktív virtuális avatar róla, amelyet arra képeztek, hogy gyakori sajtókérdésekre válaszoljon a Synthesia tevékenységéről és működéséről. Egy nappal korábban egy panelen ültem, ahol PR-szakemberek kérdezték, zavar-e, ha AI által generált szöveggel dobják fel a megkereséseiket. Alexandru avatara ennél többet jelentett — számomra ez az AI PR-ben való alkalmazásának egyik végső formája volt.
Synthesia rövid bemutatása és termékei
Synthesia, amely eredetileg az Egyesült Királyságból indult és most New Yorkban is jelen van, a digitális avatárokat fejlesztő, gyorsan növekvő startupok közé tartozik olyan cégekkel együtt, mint a D-ID, HeyGen és Colossyan. Az idei év korai szakaszában a cég 4 milliárd dolláros értékelést ért el, és tavaly közölték, hogy átlépték a 100 millió dolláros éves ismétlődő bevételt (ARR).
A vállalat lehetővé teszi, hogy vállalati ügyfelek interaktív képzési videókat készítsenek AI-avatárokkal. Nemrég indították el a Roleplay Sessions nevű terméket, amely alkalmazottaknak kínál gyakorlási lehetőséget — például értékesítési beszélgetések szimulálását interaktív avatárral, amely reagál és pontozza a válaszokat.
Saját avatarkészítés: hogyan zajlott
Szeptemberben meghívtak az új new yorki irodába. Amikor felajánlották, hogy elkészítik a saját AI-avatáromat, azonnal igent mondtam. A folyamat egy mini filmes stúdióban zajlott az irodán belül: több fotót készítettek rólam és egy kétperces hangfelvételt rögzítettek. Hozzájárultam az avatárok készítéséhez, és megszületett az én „digitális Domom”.
Kétféle avatart készítettek: egy személyes, egyszerűen általam adott forgatókönyvet felolvasó változatot (szemüveges és szemüveg nélküli), valamint két interaktív avatárt (szintén szemüveges és szemüveg nélküli), amelyek képesek visszabeszélni és meghallgatni.
Az interaktív avatart egy kiválasztott cikkemre — egy anyavállalati tőkebefektetéssel kapcsolatos csalásokról szóló anyagra — képezték. Ez az avatar determinisztikus: csak arra a témára és azokra a kérdésekre válaszol, amelyekre kiképezték, tehát nem ad tágabb személyes információkat.
Műszaki háttér röviden
A Synthesia interaktív avatara többféle modell kombinációján alapul: hangból szöveg (voice-to-text), nyelvi agentikus modell, szövegből hang (text-to-voice) és végül egy videómodell, amely a beszédhez illesztve animálja az avatárt. A cég saját videó- és hangmodelleit használja, de ügyfelek választhatnak más laborok megoldásai közül is, például Cartesia, ElevenLabs, Google vagy OpenAI modellekből. A vállalatok dönthetnek arról is, hogy az avatart saját felhőjükön üzemeltetik-e vagy a Synthesia-t bízzák meg a hosztolással.
A Synthesia termékportfóliója alapvetően három típusú megoldást foglal magában:
- Hagyományos avatárokkal működő videókészítő és terjesztő platform, ahol valaki beír egy szöveget és az avatar felolvassa azt.
- Agentikus platform, a Sessions, ahol az avatárokkal lehet interaktív szerepjátékokat vagy felméréseket lebonyolítani.
- API platform, amely lehetővé teszi a Synthesia videó- és hangmodellek más szolgáltatásokkal való kombinálását interaktív avatárok vagy egyéb termékek építéséhez.
Első tapasztalatok és személyes reakciók
Az avatárok elkészítése néhány napot vett igénybe. A személyes avatarral először egy egyszerű forgatókönyvet írtam be, hogy meghalljam a lemásolt hangot; beszéltettem az avatárt arról, hogy megérkezett az ősz New Yorkba — a hang eléggé pontosnak tűnt, és szerencsére nem vette át azt a rekedtséget, ami a felvételkor jelen volt.
Nem technológiai ismerőseim érdekesnek és egyben kicsit hátborzongatónak találták a személyes avatart. Az interaktív avatart, amely csak az adott cikkre válaszolt, megpróbáltuk személyesebb kérdésekkel is faggatni (például hol dolgoztam korábban), de mindig visszairányított a cikk témájára. A barátaim szerint az interaktív hang kevésbé hasonlított rám, mint a személyes avatar, de így is elég közel volt ahhoz, hogy kellemetlen érzést keltsen. Anyám „lenyűgözőnek” nevezte, ami tőle magas elismerés.
Mit jelent mindez az újságírás és a vállalati használat szempontjából?
A tapasztalat elgondolkodtatott arról, hogy az újságírás jövője hogyan alakulhat: elfogadnák-e az emberek, hogy a híreket avatárok vezessék? Egy befektető azonnal elutasította ezt a lehetőséget; jelenleg erős ellenállás van az „AI slop” kapcsán, ami beszivárgott a közösségi médiába és más hírmegosztó platformokra. Mások azonban nem voltak egyértelműen elutasítóak: kérdéses, hogy az avatárok kiegészíthetik-e, vagy akár helyettesíthetik-e az újságírókat, illetve vállalati oldalon a vezérigazgatók hajlandóak lennének-e egy újságíró AI-avatárjával kommunikálni.
Számomra az újságírás lényege a kapcsolatteremtés, a történetírás és a kutatás — de legfőképp a bizalom, amit nehéz elképzelni, hogy AI-ra lehetne teljesen kiszervezni.
Ugyanakkor a klónozás ötlete vállalati környezetben vonzó lehet: nem kell lemaradni a munkáról szabadság alatt, mert a „te” egy változata mindig elérhető lehet, hogy válaszoljon kérdésekre. A jövőben kiderül, hogyan alakul az avatárok használata a corporate America-ban.
Végső gondolatok
Miközben az első kedvteléses izgalom után közelebbről megvizsgáltam az avatáromat, vártam — talán azt, hogy pislogjon, vagy mondjon valami újat, vagy jelezze, hogy "tud" valamit rólam. A determinisztikus avatárok ezeket soha nem fogják megtenni, de könnyű elképzelni, hogy egy kevésbé korlátozott, chatbot-alapú változat szokatlan pszichológiai hatásokat váltson ki. Generációs különbségekre vonatkozóan úgy vélem, hogy például a Z generáció számára ezek a digitális klónok sci-finek tűnhetnek, és talán nehezebben szoknának hozzájuk. Összességében kevert érzéseim vannak: az avatarok kevésbé ijesztőek számomra, mint a humanoid robotok, hiszen egy avatart mindig ki lehet kapcsolni, ha kellemetlen lesz.
A tapasztalat végén a Synthesia létrehozott egy személyes avatárt is, amely a cikkek heti toplistáját ismerteti — ez most az én digitális megfelelőm.



