A Washingtoni Egyetem kutatói olyan fejhallgató-prototípust fejlesztettek, amely automatikusan felismeri és izolálja azt a beszélgetőpartnert, akire a viselő odafigyel — egy úgynevezett „proaktív hallássegédet”. A megoldás célja a koktélparti hatás problémájának csökkentése: a hallókészülékek és zajszűrők hagyományos korlátja, hogy nehéz egy adott személy hangját felerősíteni anélkül, hogy a környezeti zajt vagy más beszélők hangját is felerősítenék.
Mire épül a rendszer és hogyan működik?
A prototípus egy térhatású, emberi hallást utánzó binaurális mikrofonra támaszkodik, és két külön mesterséges intelligencia-modellt alkalmaz.
- A rendszer aktiválódik, amikor a fejhallgató viselője beszélni kezd. Ekkor az első AI-modell követni kezdi a beszélgetés résztvevőit egy "ki mikor" jellegű elemzéssel, és keresi a beszélgetések közötti alacsony átfedést.
- Az első modell eredményét a második AI-modell kapja meg, amely elkülöníti a résztvevők hangját, majd a megtisztított, izolált hangot játssza le a viselő számára.
A kutatók szerint a rendszer elég gyorsan dolgozik ahhoz, hogy ne legyen zavaró hangtompulás vagy késés a felhasználó számára.
Teljesítmény és korlátok
A prototípus jelenleg egy–négy beszélgetőpartnerrel képes egyszerre megbirkózni a viselő saját hangja mellett. A fejlesztők elismerik, hogy a dinamikus beszélgetési helyzetek, például az egyszerre beszélés vagy hosszabb monológok megnehezítik a működést, és a résztvevők beszélgetésbe való belépése és kilépése további kihívást jelent.
A kutatók azonban meglepődtek, hogy a prototípus milyen jól teljesített a bonyolultabb forgatókönyvekben is. A modelleket eddig angol, mandarin és japán párbeszédeken tesztelték; a csapat szerint más nyelvek ritmusa további finomhangolást tehet szükségessé.
Miért fontos ez?
Korábban a hasonló eszközök gyakran megkövetelték a felhasználótól, hogy manuálisan válasszon beszélőt vagy hallható távolságot, ami rontja a felhasználói élményt. Guilin Hu, a tanulmány vezető szerzője szerint az új prototípus „proaktív technológia”: automatikusan és kevésbé invazív módon következtet az emberi szándékra anélkül, hogy a felhasználónak állítgatnia kellene a rendszert.
A kutatók remélik, hogy a megközelítést nemcsak fülre helyezhető fejhallgatókban lehet alkalmazni, hanem később kisebb készülékekben — például hallókészülékekben, fülhallgatókban vagy okosszemüvegekben — is beépíthető lesz. Ez végső soron lehetővé teheti, hogy a felhasználók ne manuálisan irányítsák az AI „figyelmét”, hanem az automatikusan kiválassza és tisztán továbbítsa a releváns beszédet.
Bemutatás
A kutatási eredményeket a csapat egy, a természetes nyelvi feldolgozás empirikus módszereivel foglalkozó (EMNLP) konferencián mutatta be Kínában. A demonstráció jelenleg egy fülre helyezhető fejhallgatóval történt, de a szerzők a technológia további finomításán és a felhasználói élmény javításán dolgoznak.
(Figyelmeztetés: a cikk a prototípusról és a kutatási bemutatóról számol be; a megoldás gyakorlati, széleskörű alkalmazása további fejlesztést igényel.)



