Modellbevezetés

OpenAI bemutatta a GPT-Live hangmodelljeit: egyszerre hallgat és beszél, miközben a nehezebb feladatokat GPT-5.5-re adja

Az OpenAI július 8-án bemutatta a GPT-Live-1 és GPT-Live-1 mini hangmodelleket, amelyek a megújult ChatGPT Voice motorját működtetik.

OpenAI bemutatta a GPT-Live hangmodelljeit: egyszerre hallgat és beszél, miközben a nehezebb feladatokat GPT-5.5-re adja
  1. július 8-án az OpenAI két új hangmodellt jelentett be: GPT-Live-1-et és GPT-Live-1 mini-t, amelyek az átalakított ChatGPT Voice szolgáltatást hajtják. A modellek fő újdonsága, hogy egyszerre képesek a bejövő és a kimenő hangfolyam feldolgozására — a teljes duplex üzemmódra —, és az összetettebb feladatokat háttérben futó érvelő modellnek, a GPT‑5.5‑nek adják át, miközben tovább beszélnek.

Miben különböznek az elődöktől

A GPT-Live modellek folyamatosan dolgozzák fel az audiojelet, tehát nem várják meg a beszélgetőpartner „fordulójának” végét. Telecom‑szaknyelven ez full‑duplex működés: a vétel és az adás egyszerre zajlik, mint egy hagyományos telefonhívásnál. Korábban az Advanced Voice Mode (AVM) egyetlen modellként sorban hallgatott, gondolkodott és válaszolt; a GPT‑Live architektúrája viszont szétválasztja a „talker” és a „thinker” funkciókat.

A hangmodellek több százszor másodpercenként döntenek a következő akcióról (beszél, hallgat, vár, közbevág, backchannel‑t ad, vagy eszközt indít). Amikor a kérdés mélyebb kutatást vagy több lépéses műveletet igényel — webkeresést, bonyolult érvelést, eszközök használatát — a hangmodell átadja a feladatot GPT‑5.5‑nek, folytatja a beszédet, majd beépíti az érvelő modell eredményét a válaszba. A két modellel kapcsolatos kontextust megosztják, de külön szolgálják ki és külön futnak.

Funkciók és korlátok

  • Mindkét modell beszédet fogad és beszédet ad vissza, az input és output átfedéssel folyik. A ChatGPT felületen vizuális kártyák (időjárás, részvények, sport, térkép) jelennek meg a beszélgetések mellett. Az alkalmazás képeket és fájlokat is elfogad, de élő videó és képernyőmegosztás jelenleg nincs a GPT‑Live funkciók között — ez a két képesség a régebbi Standard és AVM módokban továbbra is elérhető.
  • Élő fordítás és kilenc új, újramaszterelt hang érhető el; a hangok előre definiáltak, és védelmi mechanizmusok tiltják valós személyek utánozását.
  • Felhasználó által választható érvelési erősség GPT‑Live‑1‑en: Instant, Medium, High. Az Instant állás GPT‑5.5 Instantet futtat a háttérben; a Medium és High a GPT‑5.5 Thinking megfelelő szintjeit használja. A GPT‑Live‑1 mini csak a GPT‑5.5 Instantet hívja meg.

Néhány részletet az OpenAI nem közölt: a paraméterszámokat, architektúra‑részleteket, tanítóadatokat, tudásvágást, késleltetési méréseket és használatalapú árazást nem hozták nyilvánosságra.

Teljesítmény és mérési eredmények

Az OpenAI saját tesztjei szerint a GPT‑Live jelentős előrelépést hoz az AVM‑hez képest, különösen azon feladatoknál, amelyeket a GPT‑5.5‑nek delegálnak. Néhány belső benchmark, amelyet az OpenAI publikált:

  • GPQA (graduális szintű természettudományos kérdések: biológia, kémia, fizika): GPT‑Live‑1 magas érvelési beállításon 84,2 százalékot ért el, míg az AVM 45,3 százalékot.
  • BrowseComp (ügynöki webkeresés nehezen megtalálható tényekért): GPT‑Live‑1 magas érvelésen 75,2 százalékos helyes választ adott, az AVM pedig 0,7 százalékot.
  • Emberi értékelők preferenciája: párba állított 5–10 perces beszélgetésekben a GPT‑Live‑1‑et 75,7 százalékban részesítették előnyben az AVM‑mel szemben; a GPT‑Live‑1 mini esetében a preferencia 69,2 százalék volt.

Biztonsági jelzések tekintetében a GPT‑Live modellek is jobban teljesítettek: tiltott tartalmak észlelésében javulás látható. Példák az OpenAI által közölt számokra:

  • Illegális viselkedés jelzése: GPT‑Live‑1 97% vs. AVM 74%.
  • Öngyilkosságra utaló veszély jelzése: GPT‑Live‑1 96% vs. AVM 89%.
  • Ellenfelezett (adversarial) egészségügyi kérdések jelzése: GPT‑Live‑1 84% vs. AVM 57%.
  • Öngyilkosságra utaló adversarial promptok: GPT‑Live‑1 98% vs. AVM 72%.

Fontos megjegyezni, hogy az OpenAI összehasonlításai elsősorban a saját korábbi AVM‑jével történtek; rivális hangmodellekkel való független összevetések nem szerepelnek a közölt anyagban.

Elérhetőség és fejlesztői hozzáférés

A GPT‑Live funkciók globálisan elérhetők iOS‑en, Androidon és a ChatGPT.com‑on. Alapértelmezettént a GPT‑Live‑1 a Go, Plus és Pro előfizetésekhez tartozik extra díj nélkül, a szabad (free) csomagban pedig a GPT‑Live‑1 mini az alapértelmezett. Fejlesztői API a GPT‑Live‑hez egyelőre nem jelent meg: a fejlesztők számára továbbra is a GPT‑Realtime‑2 marad a hangos lehetőség, amely májusban érkezett meg a Realtime API‑hoz.

Mi áll a háttérben és miért fontos

A GPT‑Live két fő megoldása — a full‑duplex feldolgozás és a háttérérvelő modell használata — nem teljesen újak a kutatásban. Több korábbi kezdeményezés hasonló irányt követett: Alibaba Qwen2.5‑Omni Thinker‑Talker, Thinking Machines Lab TML‑Interaction‑Small, Kyutai Moshi, valamint Nvidia PersonaPlex, továbbá Google Gemini Live, amely folyamatos beszélgetést és kamerát/képernyőmegosztást is kínál. Az OpenAI előnye az, hogy ezt a kombinációt nagy felhasználói bázishoz juttatja el: a cég szerint a ChatGPT hang- és diktálási funkcióit hetente több mint 150 millióan használják.

A hangra épülő interfészek fejlesztése stratégiai jelentőségű az OpenAI számára. A Bloomberg beszámolója szerint a cég még az idén be kíván mutatni egy hordozható, képernyő nélküli okoshangszórót, amely kizárólag GPT‑Live alapú hanginterakcióra épít, és a készülékek 2027 elején érhetők el. A terv szerint ez a készülék idővel egyre személyre szabottabb interakciókra lesz képes, és erősebb modelleket hívhat meg, mint a jelenlegi okoshangszórók.

Következtetés

A full‑duplex hangfeldolgozás és a külön érvelő modellnek való delegálás kombinációja két különböző problémát old meg: kényelmesebb, természetesebb beszélgetést tesz lehetővé, és ugyanakkor lehetővé teszi, hogy bonyolultabb, több lépéses feladatoknál mélyebb gondolkodás történjen anélkül, hogy a beszélgetés folyamatossága megszakadna. Az OpenAI belső mérési eredményei jelentős javulást mutatnak az AVM‑hez képest, de az összehasonlítások belső benchmarkokra épülnek, és több részlet — például a modellparaméterek és késleltetési számok — publikus ismerete hiányzik.

A technológia hosszabb távú sikere attól függ, hogy az OpenAI mennyire tudja ténylegesen átültetni a hangalapú interakciók előnyeit mindennapi, produktív felhasználási esetekbe, és hogy a vállalat mennyire tudja fenntarthatóan kezelni a biztonsági és adatvédelmi kihívásokat.