Modellbevezetés

OpenAI bemutatja a GPT-Live-1 beszédmodelleket a természetesebb valós idejű beszélgetésekért

Az OpenAI bemutatta új, GPT-Live-1 és GPT-Live-1 mini nevű beszédalapú konverzációs modelljeit, amelyek célja a természetesebb és folyamatiasabb élő párbeszédek biztosítása.

OpenAI bemutatja a GPT-Live-1 beszédmodelleket a természetesebb valós idejű beszélgetésekért

OpenAI bejelentette új beszélgetésre tervezett modelljeit, a GPT‑Live‑1‑et és a kisebb GPT‑Live‑1 mini változatot, amelyek célja, hogy természetesebb, valós idejű hangbeszélgetéseket tegyenek lehetővé. A vállalat azt állítja, hogy a modellek jobban kezelik a beszélgetések turn‑váltását és alkalmasak a párhuzamos hallgatásra és beszédre (full‑duplex), így a felhasználók megszakíthatják a modellt anélkül, hogy a beszélgetés folyamata zavart szenvedne. Ez funkciókat is lehetővé tesz, például élő fordítást.

Hogyan változik a ChatGPT hangmódja

Az OpenAI közölte, hogy a ChatGPT korábbi Advanced Voice Mode‑ját alapértelmezésben a GPT‑Live‑1 mini váltja fel. A fizetős előfizetéssel rendelkezők számára elérhető lesz a nagyobb teljesítményű GPT‑Live‑1 modell. A régebbi megoldás több komponensből állt: beszéd‑szöveg átalakítás (speech‑to‑text), nagy nyelvi modell a válaszok generálásához és szöveg‑beszéd (text‑to‑speech) a kimenet előállításához; az új modellek ezeket a képességeket integrálják egy folyamatosabb élmény érdekében.

Tudás és háttérintegráció

A cég egy sajtóeseményen elmondta, hogy az új modellek megoldanak olyan korábbi problémákat, mint a beszélgetőpartner közbeni félbeszakítás vagy a korlátozott képességű válaszadás. A GPT‑Live‑1 modellek a beszélgetés folyamán a lekérdezéseket az OpenAI legújabb szöveges modelljeihez, például a GPT‑5.5‑höz továbbítják keresésre, következtetésre vagy ügynöki (agentic) feladatokra, miközben maga a hangalapú párbeszéd folyamatban marad.

A demonstráción látható volt, hogy a modell képes hosszabb időn át hallgatni és „felszívni” a kontextust, amíg aktiválják. Mivel az új hangmód hozzáfér modernebb GPT‑modellekhez, bizonyos információkat vizuális formában is képes bemutatni.

Versenytársak és piaci trendek

Más vállalkozások is a vizuálisabb, interaktívabb asszisztensek irányába mozdulnak el: például a Monogram startup 40 millió dollár seed befektetést szerzett a DST‑től és a Lux Capital‑től, és szintén hangsúlyozza a vizuális válaszokat. Emellett olyan nagy szereplők, mint az Apple és az Amazon, frissítették asszisztenseiket a jobb kontextuskezelés és természetesebb beszélgetés érdekében. A Sesame nevű startup, amelyet Brendan Iribe és Ankit Kumar alapított, szintén a háttérben végzett feladatokat és természetes párbeszédet kínál.

Hosszabb, kéz nélküli beszélgetések és a hang, mint elsődleges felület

A sajtóeseményen Atty Eleti, a ChatGPT Voice termékmenedzsere azt mondta, hogy személyesen 30–40 perces beszélgetéseket is folytatott a hangfunkcióval séták közben. Eleti kiemelte, hogy idővel a hang lehet a számítástechnika elsődleges kezelőfelülete összetett, hosszú távú ügynöki munkák irányításához. A cég egyes jelentésekre utalva azt is közölte, hogy az idén AI‑képességekkel ellátott fülhallgatópár indítása is felmerült, de hardvertermékre vonatkozó konkrét információt nem szolgáltattak.

Felügyelet és korlátok

OpenAI hangsúlyozta, hogy bár a cél a természetesebb hangmód, nem törekszik arra, hogy ez az asszisztens „AI‑társsá” váljon. A cég beépített védőkorlátokat említett: a modellek életkorhoz igazított válaszokat adnak tinédzsereknek, és forrásokat biztosítanak, ha az interakció öngyilkossági vagy önkárosító témák felé fordul.

Ugyanakkor a hangmód még nem tökéletes. A bemutatón az élő hindi fordítást mutatták be, ahol a segédszemélyzet amerikai akcentussal beszélt, a hindi pedig természetellenes, kissé könyvtárias hangzású volt. A cég azt közölte, hogy az új módot a „több beszélt nyelv” számára optimalizálták, de nem részletezték, mely nyelveket érti ez pontosan.

Felhasználás és terjedés

OpenAI az elmúlt években folyamatosan dolgozott a hangalapú funkciók fejlesztésén, hogy a ChatGPT hangmódja természetesebben szólaljon meg. A vállalat szerint több mint 150 millió ember használja a ChatGPT hang- és diktálás funkcióit beszélgetésre.

Összefoglalva, a GPT‑Live‑1 és GPT‑Live‑1 mini a vállalat lépése a hosszabb, megszakításra alkalmas, természetesebb hangalapú interakciók felé, miközben a háttérben erősebb szöveges modellek támogatják a komplexebb feladatokat és a vizuális prezentációt. A technológia még fejlesztésre szorul valamely nyelvek és akcentusok kezelésében, és a vállalat továbbra is óvatosan kezeli a biztonsági és etikai kérdéseket.