Kutatás

Mesterséges intelligenciával generált szöveg

AgentHands: szinkronizált kézgesztusokkal földelt ügynökbeszélgetések az Android XR-ben

AgentHands egy Google által fejlesztett kutatási prototípus, amelyet a CHI 2026 konferencián mutattak be, és célja, hogy a nagy nyelvi modellek (LLM) verbális utasításait koherens, térben elhelyezett kézgesztusokká alakítsa az Android XR környezetben.

AgentHands: szinkronizált kézgesztusokkal földelt ügynökbeszélgetések az Android XR-ben

Ahogy a mesterséges intelligencia asszisztensek a szöveges felületektől a multimodális, környezetérzékeny társak irányába fejlődnek, nő az igény a proaktív, helyzethez kötött segítségnyújtásra. A Project Astra és a Gemini 3.1 Flash Live példái már lehetővé tették, hogy a felhasználók valós időben beszélgessenek a környezetükről, gyakran 2D bounding boxokat használva a kamera-kép objektumainak jelölésére. Ezek a megoldások képernyőkön hatékonyak, de a teljesen befogadó platformokra, például az Android XR-re való átmenet új kihívást hoz: hogyan lépjünk túl a síkbeli UI‑n, és teremtsünk valóban testet öltött, térben tudatos párbeszédet?

Erre a problémára válaszul mutattuk be az AgentHands nevű kutatási prototípust, amely a CHI 2026 konferencián került publikálásra. Az AgentHands a beszéddel egyidejű kézgesztusok erejét viszi át a 3D térbe. Az emberi kommunikációban a kezek nem csupán mutatnak: formákat írnak le, cselekvéseket utánoznak és hangsúlyoznak, miközben a beszéddel összehangoltak. Az Extended Reality (XR) térbeli képességeit kihasználva az AgentHands ezt a természetes szinergiát reprodukálja, továbbfejlesztve korábbi kutatásainkat a Human I/O és a Sensible Agent projektekben. A cél: az AI‑ügynökök olyan kifejező, szinkronizált kézmozdulatokkal rendelkezzenek, amelyek a verbális utasításokat intuitív, fizikai demonstrációkká alakítják.

Taxonómia a térben megjelenő kézügynökökhöz

Egy kezdeti formázó tanulmány során XR és ember–számítógép interakció (HCI) szakértőkkel feltérképeztük, mitől „olvasható” egy virtuális kéz 3D környezetben. Az eredmény egy többdimenziós taxonómia lett, amely meghatározza, hogy egy ügynök hogyan használja a kezeit a felhasználó fizikai terének megalapozására:

  • Handedness & gesture (kézhasználat és gesztus): egy vagy két kéz választása, és formakönyvtárból fakadó viselkedések — például „tenyér” óvatosság jelezésére, vagy „hengeres fogás” egy eszköz tartásának imitálására.
  • Spatiality (térbeliség): az XR mélységének kihasználása a kéz pozicionálásához — levegőben lebegő gesztusok általános hivatkozáshoz, objektumhoz rögzített mozdulatok konkrét részek megjelöléséhez, vagy felhasználóhoz viszonyított gesztusok szociális jelekhez.
  • Temporal dynamics & visual effects (időbeli dinamika és vizuális effektek): a gesztusok nem statikus pózok; animált mozdulatokat (pl. „öntés”, „vonal követés”) és XR‑specifikus vizuális rétegeket is alkalmazunk — például vörös fényhatást hő‑vészhelyzet jelzésére.

Az AgentHands munkafolyamata

A rendszer központi újítása, hogy a nagyméretű nyelvi modellek (LLM) magas szintű érvelését valós időben pontos, fizikai mozgásokká fordítja, amelyek egyszerre követik az ügynök „hangját” és a felhasználó XR‑környezetét. A munkafolyamat fő lépései:

  1. Környezettudatosság

A rendszer egy könnyű súlyú objektumregisztrációs modullal indul. Tekintet‑követés és jelenet‑rekonstrukció segítségével a felhasználók gyorsan „megjelölhetnek” tárgyakat — például egy orchideát vagy egy laptopot — létrehozva 3D bounding boxokat, amelyeket az ügynök hivatkozhat.

  1. Kézgesztus eseménykönyvtár

Egy kézgesztus‑viselkedéskönyvtárat építettünk fel három szemantikai kategóriában: a) deictic (deiktikus) hivatkozáshoz, b) iconic (ikonikus) cselekvés vagy forma ábrázolásához, és c) expression (kifejezés) társas jelek és érzelmek közvetítéséhez.

  1. Gesztusokkal beágyazott érvelés

Amikor a felhasználó kérdez, a háttérrendszerben futó LLM választ generál, amely inline GestureEvent‑eket tartalmaz. Minden esemény konkrét trigger‑szavakhoz kapcsolódik, és kódolja a kézviselkedés primitívjeit a taxonómia dimenziói szerint.

  1. Szinkronizált XR végrehajtás

Az XR headseten futó lokális parser koordinálja a text‑to‑speech (TTS) lejátszást és az animációs motort. Szó‑szintű időbélyegek használatával az ügynök kezei co‑speech, vagyis a beszéddel tökéletesen szinkronizált gesztusokat hajtanak végre, így világos, kifejező térbeli hivatkozás jön létre.

Ezeknek a moduloknak az integrációja áthidalja a nyelvi szándék és a fizikai tett közti szakadékot: egy standard LLM‑kimenetet multimodális előadássá alakít, ahol a válaszok beszéddel és a helyhez pontosan illeszkedő mozgással jelennek meg.

Alkalmazási helyzetek

A demonstrációkban azonosítottuk, hogyan javítják az embodied gesztusok és az XR térbeli érzékelése a környezet megértését:

  • Interaktív oktatás: egy orchideaápolási példában az ügynök nem egyszerűen kimondja, hogy „ellenőrizze a gyökereket”; a kéz a növény tövéhez mozogva körvonalazza a légi gyökereket, miközben elmagyarázza funkciójukat.
  • Műszaki bemutatók: 3D nyomtató kezelésekor az ügynök bemutathatja a pontos „fordítsd el és kattints” sorrendet, amely a vezérlőgombok kezelését és a fájlok kiválasztását érthetővé teszi.
  • Életmód‑társ: jóléti coachként az ügynök a felhasználó fizikai döntéseire reagálhat; például interaktív „figyelmeztető” gesztust tehet, kézfogással és vizuális effektussal jelezve káros viselkedést.

Felhasználói vizsgálat

A hatásért egy within‑subjects tanulmányt végeztünk (N = 12), összehasonlítva az AgentHands rendszert egy csak beszéd alapú kontrollal. Mindkét feltétel ugyanazt a kutató által írt verbális tartalmat használta, tehát az egyetlen különbség az embodied kezek jelenléte és a gesztusok szinkronizálása volt. A résztvevők két procedurális feladatot végeztek, amelyek a mindennapi gondozást és a technikai üzemeltetést egyaránt lefedték.

A feladatok:

  • Orchideaápolási feladat: a felhasználók megtanulták azonosítani a növény részeit (légi gyökerek, szárok) és többlépéses ápolási tevékenységeket hajtottak végre, beleértve célzott öntözést és helyes tápanyagalkalmazást.
  • 3D nyomtató kezelése: a résztvevők hardverkomponenseket (fúvóka, nyomóágy) azonosítottak, majd végigmentek egy működtetési folyamaton: eszköz bekapcsolása, SD kártya behelyezése, és a vezérlőpanel navigálása.

Eredmények

Az adatok több kommunikációs hatékonysági mérő mentén igazolták, hogy az XR és a co‑speech gesztusok kombinációja jelentősen javítja a térben megalapozott interakciókat.

  • Jelentős javulás a térbeli megalapozásban: a résztvevők könnyebben találták meg a pontos objektumokat és a megadott irányokat, a különbség statisztikailag szignifikáns volt (p < 0.05). A mutató gesztus pontos „leszállása” abban a pillanatban, amikor az ügynök kimondta a „ez” szót, kiküszöbölte a szóbeli utasításokra jellemző találgatást.
  • Komplex cselekvések jobb megértése: a szükséges tevékenységek követése egyszerűbbnek tűnt (p < 0.05). Egy résztvevő megjegyezte: „csak amikor az ügynök megmutatta az emelő gesztust, értettem meg, hogy fel kell emelnem az orchideát, hogy a víz lecsoroghasson”.
  • Markáns biztonsági jelzések: a figyelmeztetések hatékonyabbak voltak gesztusokkal és vizuális effektekkel párosítva. A 3D nyomtató feladat során használt „égés” effektust többen „igazán lenyűgözőnek” nevezték; a vizuális figyelemfelkeltés biztosította, hogy a felhasználók észrevegyék a forró fúvóka kockázatát.
  • Csökkent kognitív terhelés: a résztvevők szerint a leírások könnyebben érthetők és megjegyezhetők voltak. A kvalitatív visszajelzések alapján a kezek „egy partnernek tűntek, aki vezet”, ami a felhasználói élményt eszköz‑szerepből egy inkább testet öltő párbeszéddé változtatta.

Következtetések és jövőbeli irányok

Az AgentHands egy lépés a felé, hogy a mesterséges intelligencia rendszerek ne csak elemezzék a környezetünket, hanem dinamikusan működjenek is benne. A co‑speech gesztusok és az XR térbeli erejének együttes alkalmazásával csökkenthető a komplex feladatok kognitív terhelése, és emberközelibbé, hozzáférhetőbbé tehető a térszámítás. A további fejlesztések során az Android XR ökoszisztémára fókuszálva a személyre szabhatóságot szeretnénk növelni: például a felhasználó domináns kezéhez vagy egyéni térbeli rutinjaihoz igazítani a gesztusokat, hogy még zökkenőmentesebb ember–AI együttműködés jöhessen létre.

Köszönetnyilvánítás

A kutatást elsősorban Ziyi Liu végezte tanuló kutatóként a Google‑nál, több csapat együttműködéseként. Külön köszönet David Li‑nak, Zhongyi Zhou‑nak és David Kim‑nek a támogatásért, valamint Adarsh Kowdle‑nak, Guru Somadder‑nek és Shahram Izadi‑nak a stratégiai útmutatásért és értékes lektorálásért.