Modellbevezetés

OpenAI bemutatja a GPT-Realtime-2 hang–hang modellt a sebesség és a következtetés szabályozásával

Az OpenAI frissítette Realtime API-ját, és bemutatta a GPT-Realtime-2, GPT-Realtime-Translate és GPT-Realtime-Whisper modelleket, amelyek hangalapú feldolgozást céloznak.

OpenAI bemutatja a GPT-Realtime-2 hang–hang modellt a sebesség és a következtetés szabályozásával

OpenAI három új audiomodellel bővítette Realtime API‑ját: GPT‑Realtime‑2, GPT‑Realtime‑Translate és GPT‑Realtime‑Whisper. A középpontban a GPT‑Realtime‑2 áll: ez egy hang–hang (speech‑to‑speech) modell, amelynél a fejlesztők szabályozhatják a „következtetési erőfeszítés” szintjét — ezzel a késleltetés és az ésszerű válaszadás képessége közötti kompromisszum állítható be.

Mire képesek az új modellek?

  • GPT‑Realtime‑2: end‑to‑end hang‑be és hang‑ki feldolgozás, ugyanazon a modellen belül végzi a beszéd felismerését, a következtetést és a beszédgenerálást; bemenetként fogad szöveget, hangot és képet (akár 128 000 tokenig), kimenete szöveg és hang (akár 32 000 tokenig). A modellre vonatkozó késleltetési mérések: minimális következtetési erőfeszítésnél 1,12 másodperc az első hangkimenetig, magas erőfeszítésnél 2,33 másodperc.
  • GPT‑Realtime‑Translate: beszédfordítás több mint 70 bemeneti nyelvből 13 kimeneti nyelvre; fogad audio bemenetet (akár 16 000 token) és ad audio kimenetet (akár 2 000 token).
  • GPT‑Realtime‑Whisper: beszéd átiratát készíti szövegként; text/audio bemeneteket fogad (akár 16 000 token), szöveges kimenet (akár 2 000 token).

GPT‑Realtime‑2 részletes funkciók

  • Öt szintű "reasoning effort" (minimal, low, medium, high, xhigh), amely állítja a modell által végzett számítások mennyiségét és ennek megfelelően növeli a késleltetést és a következtetési tokenfelhasználást.
  • Párhuzamos eszközhívások és ezek narrálása: a modell beszélt megjegyzésekkel jelezheti a folyamatban lévő műveleteket („megnézem a naptáradat”, „most utánanézek”), illetve opcionális bevezető mondatok („hagy nézzem meg”) használhatók.
  • Problémás vagy megoldhatatlan kérések kezelésére a modell figyelmeztető kifejezéseket használ, például „ezzel most gondom van”, ahelyett, hogy egyszerűen hallgatna.
  • Hangnem (attitűd) szabályozása és function calling támogatás.

Teljesítmény és benchmarkok

  • GPT‑Realtime‑2 jó eredményeket ért el több független benchmarkon: vezeti a Scale AI Audio MultiChallenge audio‑output ranglistáját és jól szerepelt az Artificial Analysis Conversational Dynamics mutatóján. A Big Bench Audio teszten (Artificial Analysis) magas következtetési erőfeszítésre állítva 96,6%-os eredményt ért el, amellyel holtversenyben állt a Google Gemini 3.1 Flash Live Preview‑val; tíz‑tized százalékos pontossággal elmaradt a Step‑Audio R1.1 Realtime (97,6%) és Grok Voice Think Fast 1.0 (97,1%). Minimális erőfeszítésen 71,8%-ra esett vissza.
  • A Conversational Dynamics (a beszélgetési váltások, megszakítások és rövid visszajelzések kezelése) mutatóján minimális erőfeszítéssel 96,1%-kal vezetett, magas erőfeszítéssel azonban 95,3%-ra csökkent, és ezzel elmaradt a GPT‑Realtime‑1.5 és GPT Realtime Mini modellektől (95,7%).
  • Az 𝜏‑Voice méréseiben (ügyfélszolgálati feladatok három doménjében) a légiutas‑kiszolgálás doménjében vezetett 63%-kal, de a három domén összesítésében 39,8%-kal elmaradt Grok Voice Think Fast 1.0 (52,1%) mögött, és megelőzte a Gemini 3.1 Flash Live Preview‑t (37,7%).
  • Időbeli összevetés: a hang első megszólalásáig eltelt idő Step‑Audio R1.1 Realtime‑nál 1,51 másodperc, Grok Voice Think Fast 1.0‑nál 1,25 másodperc, míg GPT‑Realtime‑2‑nél magas következtetésnél 2,33 másodperc — vagyis a két rivális gyorsabb.
  • Fontos megjegyzés: még xhigh szinten a Scale AI Audio MultiChallenge átmeneti passzaránya kevesebb mint 50% volt, ami arra utal, hogy a megbízható többfordulós beszélgetések még kihívást jelentenek a jelenlegi modellek számára.

Elérhetőség és árak

  • A modellek az OpenAI Realtime API‑n keresztül érhetők el.
  • Árazás (OpenAI által megadott tételes díjak):
    • GPT‑Realtime‑2: $32 / $0.40 / $64 per millió bemeneti / cache‑elt / kimeneti audió token, $4 / $0.40 / $24 per millió bemeneti / cache‑elt / kimeneti szöveg token, és $5 / $0.50 / $24 per millió bemeneti / cache‑elt képtoken.
    • GPT‑Realtime‑Translate: $0.034 per perc.
    • GPT‑Realtime‑Whisper: $0.017 per perc.

Nyitott kérdések

OpenAI nem tette közzé a modellek paraméterszámát, architektúráját, illetve a kiképzésükhöz használt adatok és módszerek részleteit.

Miért fontos ez?

A legtöbb hangalapú ügynök egyszerűbb interakciókra van optimalizálva, mert a komplexebb következtetés jellemzően nagyobb késleltetéssel jár. A GPT‑Realtime‑2 újdonsága, hogy a fejlesztők beállíthatják a késleltés és a következtetési képesség közötti kompromisszumot: minimális beállításokkal élénkebb, alacsony késleltetésű beszélgetések érhetők el; magasabb beállításokkal összetettebb, több lépéses következtetéseket lehet végrehajtani, ha az interakció megvárhatja a lassabb választ. Ez szélesítheti a hangalapú alkalmazások felhasználási körét anélkül, hogy a feldolgozást szövegre kellene áttéríteni.

Összegzés

OpenAI új Realtime audio‑modelljei, különösen a GPT‑Realtime‑2, közelebb viszik az end‑to‑end hang‑hang következtetést a gyakorlati alkalmazásokhoz azzal, hogy szabályozhatóvá teszik a késleltés és a következtetési teljesítmény közti kompromisszumot. Ugyanakkor a legmagasabb következtetési beállításnál mért késleltetések és az alacsony, 50% alatti passzarányok azt mutatják, hogy a megbízható többfordulós beszélgetések terén még van tér a fejlesztésre.