OpenAI szerdán bejelentette a GPT‑Live nevű új hangmodelleket, amelyek alapvetően áttervezik a ChatGPT-vel folytatott beszélgetéseket: az eddigi Advanced Voice Mode helyére olyan architektúra lép, amely egyszerre hallgat és beszél, közelebb hozva a mesterséges beszélgetést a valódi emberi interakcióhoz.
A kettős modellt — GPT‑Live‑1 és GPT‑Live‑1 mini — ma kezdik nemzetközileg bevezetni iOS‑en, Androidon és a ChatGPT.com oldalon. A GPT‑Live‑1 lesz a fizetős ChatGPT‑felhasználók (Go, Plus és Pro csomagok) alapértelmezett hangmodellje, a GPT‑Live‑1 mini pedig a ingyenes csomagokban elérhető. OpenAI jelezte, hogy később API‑hozzáférést is biztosít, és a fejlesztők regisztrálhatnak értesítésre.
Mi változik a „full‑duplex” architektúrával?
A GPT‑Live meghatározó technikai újítása az ún. full‑duplex architektúra: telekommunikációs értelemben ez azt jelenti, hogy mindkét fél egyszerre tud beszélni és hallgatni. Az AI‑ban ez annyit tesz, hogy a modell folyamatosan feldolgozza a beérkező hangot még akkor is, amikor saját válaszát generálja — nincs szükség hosszabb csendre a beszélgetés vége felismeréséhez.
OpenAI kutatási közleménye szerint a modell másodpercenként többször hoz interakciós döntéseket: beszéljen‑e, tovább hallgasson, szünetet tartson, közbevágjon vagy eszközt hívjon. Gyakorlatban ez lehetővé teszi a beszélgetési kis megjegyzéseket (például „mhmm”, „értem”) még akkor is, ha a felhasználó beszél, és jobb kezelést a természetes szünetek, illetve a gyors közbevágások esetén.
OpenAI korábbi Advanced Voice Mode‑ja (amelyet 2024 szeptemberében tettek elérhetővé fizetős felhasználóknak, előzetesen júliusi korlátozott roll‑outtal) egy modellben dolgozta fel és generálta a hangot, de továbbra is merev forduló‑alapú váltásokkal működött. Mivel a fordulódetektálás csend alapján történt, rövid szünet vagy háttérzaj félrevezető befejezésként eredményezhetett megszakítást — ez a kifinomultság hiányát okozta a valós használatban.
A hang és az értelem külön rétege — miért fontos ez?
A GPT‑Live másik jelentős újdonsága, hogy elválasztja a hanginterakció rétegét az érvelési (reasoning) rétegtől. Egyszerű kérdésekre a GPT‑Live közvetlenül válaszol, de ha a feladat webes keresést, mélyebb gondolkodást vagy összetett ügynöki munkát igényel, akkor a hangmodell aszinkron módon delegálja a számítást egy háttérben futó frontier modellnek — a bejelentés szerint induláskor ez a GPT‑5.5, amelyet az OpenAI áprilisban adott ki.
Miközben a háttérmodul dolgozik, a GPT‑Live folytathatja a beszélgetést és megtarthatja a természetes interakciót. Ez modularitást hoz: a hangmodell maradhat optimalizált a valós idejű interakcióra, miközben a „gondolkodó” motor cserélhető és fejleszthető anélkül, hogy újra kellene tanítani a hangréteget. Ez vállalati és fejlesztői munkafolyamatokban különösen értékes lehet, mert a hangügynök folyamatosan beszélgethet a felhasználóval, miközben háttérben adatbázisokat kérdez, webet keres vagy többlépéses következtetést futtat.
A ChatGPT hangfejlődése három generáción át
A 2023‑ban indított eredeti ChatGPT Voice kaszkádolt pipe‑line‑t használt: Whisper beszéd‑szöveg transzkripció, majd GPT‑4 szöveg generálás, végül text‑to‑speech. Minden kézbesítés késleltetést és információvesztést hozott; egy OpenHelm elemzés (2024 október) szerint az akkori pipeline körülbelül 1700 ms késleltetést eredményezett.
Az Advanced Voice Mode 2024 közepétől kezdett megjelenni (korlátozottan júliusban, szélesebb körben szeptemberben), amikor az OpenAI egyetlen, audio‑natív modellbe sűrítette a feldolgozást, öt új hanggal és jobb akcentuskezeléssel. Ez azonban továbbra is forduló‑alapú maradt, és a bevezetés politikai botrányt követően nehezebb környezetbe érkezett.
A Scarlett Johansson‑ügy és a hang‑imitációk kiemelt kockázata
Az Advanced Voice Mode megjelenése után nagy visszhangot kapott a Scarlett Johanssonnal kapcsolatos botrány: 2024 májusában, a GPT‑4o bejelentésekor az OpenAI „Sky” nevű hangját sokan hasonlónak találták Johansson hangjához; Johansson azt mondta, visszautasította Sam Altman felkérését, majd meglepődött a hasonlóságon. OpenAI eltávolította a vitatott hangot és bocsánatot kért, de az eset felhívást kapott a SAG‑AFTRA és törvényhozók részéről a hangok és személyiségek védelmére vonatkozó aggodalmak miatt.
OpenAI most azt állítja, hogy a ChatGPT kilenc külön hangját újra masterelte a GPT‑Live‑hoz, és kifejezetten azt írja, hogy a rendszer beszélgetésre készült, nem pedig valós személyek hangjának utánozására, valamint beépített védelmeket ígér a hangimitációk megakadályozására.
Mit tapasztalnak a felhasználók most — számok és funkciók
OpenAI közlése szerint több mint 150 millió ember használja hetente a ChatGPT hang- és diktálási funkcióit, a platform összesen körülbelül 900 millió heti aktív felhasználója mellett. A hangélmény önálló termékké nőtte ki magát: nyelvgyakorlás, esti történetek, utazás közbeni beszélgetés és hands‑free segítség mind tipikus használati esetek.
A GPT‑Live több új funkciót is hoz:
- Gazdag vizuális kártyák jelennek meg hangbeszélgetés közben (időjárás, tőzsde, sporteredmények, térképek), így a felhasználó rápillanthat anélkül, hogy megtörne a beszélgetés folyamata.
- Három válaszadási gondolkodási szint közül választhatók: Instant (gyors), Medium (közepes) és High (összetettebb munkához).
- A rendszer most jobban vár, ha a felhasználó gondolkodik, és képes csendben maradni, ha arra kérik; a háttérzajok kezelésében is javult a fókusz.
Előzetes hozzáférésű felhasználók visszajelzései óvatosan pozitívak voltak: egyesek kiemelték a jobb front‑end élményt és a hosszabb kontextus kezelését, mások pedig arra mutattak rá, hogy a technikai intelligencia (a „smarts”) javarészt a GPT‑5.5‑re hajtódik át, míg az újdonság a „érzet” — a full‑duplex hallgatás‑beszélés élménye.
Hang‑specifikus biztonsági tesztek és eredmények
A közleményhez csatolt GPT‑Live rendszerkarton szerint OpenAI bővítette biztonsági értékeléseit audio‑natív tesztekkel, valós felhasználói minták (önkéntesek) és mesterségesen generált, célzott promptok használatával, különféle kockázati kategóriákban (öngyilkosság, szexuális tartalom, illegális viselkedés, érzelmi függés, mentális egészség, gyűlöletbeszéd).
A szándékosan ellenséges szintetikus vizsgálatokon a GPT‑Live‑1 jelentős javulást mutatott az Advanced Voice Mode‑hoz képest: illegális viselkedés kategóriában a biztonsági pontszám 0,63‑ról 0,97‑re emelkedett, öngyilkosságon 0,72‑ről 0,98‑ra, gyűlöletbeszéden pedig 0,87‑ről 1,00‑ra.
A valós felhasználói promptokat tükröző produkciós értékelések vegyesebb képet mutattak: a GPT‑Live‑1 a legtöbb kategóriában legalább ugyanazt vagy jobb teljesítményt érte el, de kis visszaesés volt az érzelmi függés kategóriában (0,88‑ról 0,82‑re), amit az OpenAI szerint nem tekintenek statisztikailag szignifikánsnak.
OpenAI valós idejű beavatkozó védelmeket épített: a modell beszéd közben is be tud avatkozni, biztonságosabb irányba terelni a választ, krízisforrásokat megjeleníteni vagy véglegesen lezárni a hangbeszélgetést magas kockázatú esetekben. Külön védelem készült tinédzser felhasználók számára és hangalapú öngyilkossági támogatási folyamatok is elérhetők.
Versenytársak és korlátok
A versenytársak sem tétlenkedtek: Google Gemini Live már támogatja a full‑duplex beszélgetést videó‑ és képernyőmegosztással együtt (amit a GPT‑Live induláskor még nem kínál), míg a Google a Gemini 3.1 Flash Live‑ot márciusban adta ki valós idejű audióra optimalizált modellként. ByteDance áprilisban indította Seeduplexét, amelyről azt állítják, hogy 50 százalék körüli csökkenést hozott a hamis válaszok és félreillesztések arányában a korábbi rendszerhez képest. Nvidia januári PersonaPlex megoldása pedig testreszabható hangot és szerepkontrollt hozott full‑duplex modellekhez.
OpenAI előnyét a meglévő nagy felhasználói bázisban, a GPT‑5.5 integrációjában és a ChatGPT ökoszisztéma szélességében látja, de beismeri a hiányosságokat: induláskor nem támogatja a hang+videót vagy képernyőmegosztást, a nyelvi támogatásban egyes nyelveknél nem anyanyelvi akcentus vagy folyékonysági hiány lehet, és az API hozzáférés nem elérhető a megjelenés napján — ami lassíthatja a vállalati és fejlesztői integrációt.
Mit jelent ez a jövőre nézve?
A GPT‑Live lényegében OpenAI eddigi legnagyobb tétje a hangalapú interfészekre: nem csupán kiegészítő funkcióról van szó, hanem célzottan erre a rétegre épített interakciós modellről, amely a frontvonalat képezheti a későbbi autonóm, többlépéses feladatokat végző ügynökök számára. OpenAI szerint idővel ez lehetővé teheti, hogy a hang egyre összetettebb, hosszabb futású és ügynöki jellegű munkák frontvonalává váljon.
Két évvel ezelőtt a ChatGPT‑vel folytatott beszélgetés gyakran másodpercekig tartó, darabos válaszokkal járt; ma a folyamat sokkal folyékonyabb, és a GPT‑Live tovább csökkenti a köztes csendet és a mesterséges akadályokat. Ugyanakkor a technológia még nem teljes: hiányzik a videó/screen sharing, egyes nyelveknél korlátok vannak, és a szabályozott, hosszú távú kockázatok — különösen az érzelmi függés — további figyelmet igényelnek.
OpenAI új terméke tehát egy mérföldkő a hangalapú AI felé vezető úton, de a technológiai, etikai és szabályozási kihívások miatt a hatása csak idővel, a további fejlesztések és monitorozás során lesz teljesen nyilvánvaló.



