Modellbevezetés

Mesterséges intelligenciával generált szöveg

OpenAI bemutatja a GPT‑Live‑1-et az API‑ban: valós idejű, megszakításkezelő beszédmodel a fejlesztőknek

Az OpenAI bemutatta és elérhetővé tette az API‑ban a GPT‑Live‑1 modellt, amely a ChatGPT‑ben megismert természetes, teljes duplex beszélgetéseket hozza a fejlesztői eszköztárba.

OpenAI bemutatja a GPT‑Live‑1-et az API‑ban: valós idejű, megszakításkezelő beszédmodel a fejlesztőknek

Az OpenAI bejelentette, hogy a GPT‑Live‑1 mostantól elérhető az API‑ban, így a fejlesztők valós idejű, teljes duplex (egyidejű hallgatás és beszéd) beszélgetési képességeket kapnak hangalapú alkalmazásokhoz és üzleti munkafolyamatokhoz. A modellt először a ChatGPT‑ben mutatták be; a GPT‑Live‑1 képes egyszerre hallgatni és beszélni, valamint a háttérben mélyebb logikai feladatokat és eszközhasználatot delegálni más modelleknek és rendszereknek.

Mire jó a GPT‑Live‑1 és miért fontos ez?

A hagyományos hangügynökök több különálló lépésből épülnek fel (beszéd‑szöveg konverzió, érvelő modell, szöveg‑beszéd), és minden átadás növeli a késleltetést, valamint a természetes beszélgetés ritmusának elvesztésének kockázatát. A GPT‑Live‑1 ezeket a feladatokat egyetlen modellben kezeli, így egyszerre tud reagálni megszakításokra és visszajelzésekre, miközben bonyolultabb számításokat vagy műveleteket a háttérben végrehajtott modellekre bízhat.

A fejlesztők szabadon választhatják, mely modelleket, eszközöket és agent‑harness‑t párosítják a GPT‑Live‑1‑gyel. Például nagy mennyiségű rutin feladathoz, mint időpontfoglalás vagy rendelésfrissítés, egy Luna‑szerű modellt lehet használni, míg összetettebb, mély gondolkodást igénylő ügyfélesetekhez Astra‑szerű modellt. Ez a rugalmasság lehetővé teszi a sebesség, költség és érvelés mélységének feladat szerinti optimalizálását.

Teljesítmény és korai eredmények

A GPT‑Live‑1 sima megszakításkezelése már üzleti hatást hozott: korai értékelések szerint a Speak azt találta, hogy a GPT‑Live‑1 használatával a nyelvtanulóknak több idő jutott a gondolkodásra a nyelvtanár válasza előtt — a megszakítások száma majdnem 80%-kal csökkent a korábbi, forduló alapú rendszerekhez képest.

Általános teljesítménymérésben a GPT‑Live‑1 a Full Duplex Bench mutatóban 30 százalékponttal jobb teljesítményt ért el a GPT‑Realtime‑2.1‑hez képest, különösen a fordulóváltási késleltetés és az interaktív viselkedés terén. Ha közepes érvelési erőfeszítéssel párosítják a GPT‑6 Astra modellel, a kombináció a Tau3 rangsorban is az első helyet érte el, amely a határon lévő hangügynök‑intelligenciát méri end‑to‑end feladatokban.

Funkciók és fejlesztői lehetőségek

  • Nativ módon ad ASR (automatikus beszédfelismerési) átiratot és a válasz szövegét.
  • Jó alfanumerikus értelmezést és kulcsszó‑biasing támogatást kínál.
  • Bár nem kifejezetten forduló‑alapú modell, natívan támogatott a fordulóérzékelés, így a fejlesztők továbbra is építhetnek expliciten meghatározott fordulóhatárokra.
  • Képes kezelni háttérbeszédet, másik személynek szóló beszédet, hallgatói visszajelzéseket (backchannels) és megszakításokat.
  • Tesztelték eszközhasználatban természetes szünetekkel, habozásokkal és önkorrekciókkal; a Pass@1 metrika jelzi az eszközhívási és választ eredményességét különböző feladatoknál.

Hangok, nyelvek és további elérhetőség

Az OpenAI a valós idejű hangválasztékot bővíti: a GPT‑Live‑1 kezdetben több valós idejű hanggal érkezik, és tovább növelik az elérhető akcentusok, dialektusok és nyelvek számát az elkövetkező hónapokban. Egyéni hanghozzáféréshez az érdeklődőknek az OpenAI értékesítési csapatához kell fordulniuk az jogosultság és kérelem részleteiért.

Árazás és elérhetőség

A GPT‑Live‑1 ma elérhető az OpenAI API‑ján keresztül, a front‑end hangréteg használata $0.05 per perc áron. A fejlesztők választhatják meg a háttérmodell(ek)et és az agent‑harness‑t az alkalmazásuk igényei szerint, hogy a hangélmény a szükséges munkamennyiséggel és költségekkel skálázható legyen.

Kapcsolódó termékek és demo

Az OpenAI kiemeli, hogy a GPT‑Live‑1 demója időkorláthoz kötött, és a demó használata az OpenAI feltételeinek és adatvédelmi irányelveinek elfogadását jelenti. A GPT‑Live‑1 integrálható például a Codex‑szel, ahol a beszélgetési kontextust át lehet adni a Codex‑nek, és annak válaszát visszaküldeni a GPT‑Live‑1‑nek; az integráció beállítása és a delegálás kezelése a fejlesztő feladata.

Továbbá az OpenAI Presence szolgáltatás is használja a modellt valós idejű hanginterakciókhoz, hogy vállalati ügynököket üzemeltessen: ezek képesek kérdések megválaszolására, ügyintézésre, rendszerek használatára, jóváhagyott műveletek végrehajtására és szükség esetén emberi kiemelésre. Az érdeklődő vállalatok az OpenAI fiókfelelősüknél kérhetnek további információt.