Az OpenAI bejelentette a GPT‑Live nevű új hangmodelleket, amelyek célja, hogy a ChatGPT Voice‑szal folytatott beszélgetés sokkal inkább hasonlítson egy valós, megszakítás nélküli párbeszédre. A rendszer full‑duplex architektúrán alapul: egyszerre képes hallgatni és beszélni, így képes például rövid visszajelzéseket mondani („mhmm”, „yeah”), gyors párbeszédeket folytatni, vagy csendben maradni, ha a felhasználónak gondolkodási szünetre van szüksége.
Működés és belső felépítés
GPT‑Live folyamatos feldolgozásra tervezték: nem különálló üzenetváltások sorozataként kezeli a bejövő hangot, hanem másodpercenként többször hoz döntést arról, hogy beszéljen, tovább hallgasson, szüneteljen, közbevágjon, vagy eszközt hívjon meg. Ez a megközelítés természetesebb turn‑váltásokat, jobb időérzéket és akár élő fordítást is lehetővé tesz.
Ugyanakkor GPT‑Live nem végzi el minden háttérfeladatot maga: a mélyebb keresést, összetett logikát és „agentikus” munkát háttérben futó frontier modellekre delegálja. A bevezetéskor ez a háttérmodell a GPT‑5.5 lesz; a vállalat jelezte, hogy ahogy új frontier modelleket adnak ki, folyamatosan frissítik a GPT‑Live mögötti modellt.
Verziók és teljesítmény
A bevezetéskor két változat érhető el: GPT‑Live‑1 és GPT‑Live‑1 mini, amelyek globálisan indulnak el a ChatGPT‑felhasználók számára. A GPT‑Live‑1 (instant) és GPT‑Live‑1 mini a GPT‑5.5 Instant modellt használja háttérben; a GPT‑Live‑1 Medium és GPT‑Live‑1 High pedig a GPT‑5.5 Thinking modellt közepes, illetve magasabb gondolkodási erőfeszítéssel.
Emberi értékelésekben, 5–10 perces összehasonlító beszélgetések során a GPT‑Live‑1 és GPT‑Live‑1 mini erősen előnyben részesült az Advanced Voice Mode‑hoz képest olyan szempontokban, mint a preferencia, turn‑váltás, megszakítások, beszélgetési folyamat és a természetesség érzete.
Felhasználói élmény és funkciók
Az OpenAI szerint hetente több mint 150 millió ember használja a ChatGPT‑t hang- és diktálási funkciókkal mindennapi feladatokra: segítségkérésre, nyelvgyakorlásra, mesélésre vagy beszélgetésre utazás közben. A GPT‑Live bevezetésével a Voice gomb megnyomásakor már az új hangélményt kapják a felhasználók: természetesebb párbeszédet, okosabb válaszokat, jobb „figyelést” és vizuális válaszokat.
A rendszer lehetővé teszi, hogy a felhasználó közbevágjon, gondolkodási szünetet tartson, vagy megkérje a modellt, hogy lassítson. A ChatGPT most automatikusan jelzi, hogy követi a beszélgetést (például „mhmm”, „got it”), és a szolgáltatás kilenc különálló hangját is átkeverték GPT‑Live‑hoz.
Ezenkívül a hang válaszok mellé megjeleníthetők vizuális kártyák olyan témákhoz, mint az időjárás, részvények vagy sport, és a hang továbbra is támogatja a keresést, memóriát, képeket és fájlfeltöltést.
Biztonság és kockázatkezelés
A GPT‑Live „alapból biztonságosra” lett tervezve: az új modell a legújabb modellek biztonsági fejlesztéseire épít, és kifejezetten hangra vonatkozó védőrétegeket és tréninget kapott kulcsfontosságú kockázati területeken. A tesztelés kiterjedt audio‑natív értékelésekre és szintetikus, generált hangokon alapuló vizsgálatokra, fókuszálva olyan területekre, mint az öngyilkossági kockázat, pszichózis és mánia, érzelmi függőség az AI‑tól, erőszak és szexuális tartalom. Belső szakértők red‑teamekben is vizsgálták a hanghoz kapcsolódó speciális kockázatokat.
A tesztek szerint a GPT‑Live a legtöbb vizsgált területen hasonlóan vagy jobban teljesített az Advanced Voice Mode‑hoz képest. Mivel a beszélgetések valós időben zajlanak, a rendszer olyan őrjáratokat is tartalmaz, amelyek a modell beszéde közben tudnak beavatkozni: például a potenciálisan veszélyes kimenetet „biztonságosabb” irányba terelik, további üzeneteket vagy forrásokat jelenítenek meg, vagy magasabb kockázat esetén lezárják a hangbeszélgetést.
Öngyilkossági jellegű interakcióknál a ChatGPT hangban is adaptált támogatási folyamatokat kínál, beleértve szakmailag ellenőrzött krízisforróvonal‑javaslatokat. A tizenéves felhasználók védelme érdekében a modellbe életkor‑megfelelő viselkedést is beépítettek; a szülők beállíthatják, hogy a tinédzserek használhassák‑e a ChatGPT Voice‑ot, és bizonyos magas kockázatú helyzetekben értesítések küldhetők a kapcsolt szülőknek.
A vállalat hosszabb távú méréseket és poszt‑bevezetés utáni monitorozást is elindít az érzelmi függőség nyomon követésére és a védelem finomhangolására.
Korlátozások és megjegyzések
A GPT‑Live‑t a beszélgetésre tervezték, nem pedig más személyek hangjának utánzására: a modell előre definiált hangkészletet használ, és védelmek vannak a valódi személyek hangjának utánzásával szemben.
A bevezetéskor néhány nyelvnél nem anyanyelvi akcentus vagy folyékonysági hiányok előfordulhatnak; az OpenAI jelezte, hogy dolgoznak a többnyelvű tapasztalat javításán. Jelenleg a GPT‑Live nem támogatja a hangot videóval vagy képernyőmegosztással a ChatGPT‑ban, de ezeket a képességeket később tervezik bevezetni. A régi ChatGPT Voice‑verziók (Standard és Advanced Voice Mode) továbbra is elérhetők, ahol ezek a funkciók támogatottak.
Elérhetőség
GPT‑Live a mai naptól indul a ChatGPT felhasználóknak iOS‑en, Androidon és ChatGPT.com‑on. GPT‑Live‑1 lesz az alapértelmezett modell a Go, Plus és Pro felhasználóknál, míg GPT‑Live‑1 mini a Free felhasználóknál. További részletek az elérhetőségről a Help Centerben találhatók.
Az új architektúra és a háttérbeli frontier modellek kombinációja lehetővé teszi, hogy a hangalapú interakciók egyre összetettebb, hosszabb és aktívabb feladatok elvégzésére is alkalmassá váljanak a jövőben.



