Eszközök

Mesterséges intelligenciával generált szöveg

OpenAI: Dots, GPT-6.1 és gyors döntésmodellek formálják a számítógép‑használat következő hullámát

A főszereplők az OpenAI, különösen Ari Weinstein, a Computer Use termék és mérnöki csapat vezetője, valamint Nikunj Handa, az OpenAI API csapatának termékvezetője.

OpenAI: Dots, GPT-6.1 és gyors döntésmodellek formálják a számítógép‑használat következő hullámát

OpenAI DevDay előadások és egy utána közzétett podcast alapján a cég a "Computer Use" (számítógép‑használat) területére több új építőelemet jelentett be és mutatott be. A két beszélgetőpartner, Ari Weinstein (Product & Engineering, Computer Use, OpenAI) és Nikunj Handa (Product, API, OpenAI) részletezték az új termékeket, a mögöttük álló technikákat és a fejlesztési irányokat.

Mit jelent a Dots és a személyes felhőgép?

Ari Weinstein elmondta, hogy a Dots nevű személyes asszisztenstermékekhez mostantól minden Dot mellé külön Linux alapú virtuális számítógép jár a felhőben. Ez nem pusztán böngésző‑hozzáférést jelent: a Dot képes teljes asztali alkalmazásokat futtatni és webböngészőt is használni. A cél az, hogy az ügynök (agent) ugyanazokat a szoftvereket tudja használni, mint egy ember, és így a felhasználó feladatokat biztonságosan rá tud delegálni.

Weinstein példaként említette, hogy összetett megrendeléseket (például egy személyre szabott ételelőfizetés konfigurálása) korábban két óra alatt lehetett elintézni, míg a Dot ugyanazt 15 perc alatt végezte el, a GPT‑6.1 Sol modellt használva.

GPT‑6.1 Sol: költség és sebesség

Ari szerint a GPT‑6.1 Sol különösen alkalmas Computer Use feladatokra a költség és a sebesség miatt: állítása szerint a modell a teljes költségszinten az Astra modellhez képest körülbelül ötöd akkora költséggel fut, és kifejezetten Computer Use-re nézve nagyjából hétszer olcsóbbnak adódik. Ezeket a számokat a keynote során említették.

Hogyan változott a Computer Use rövid idő alatt?

Weinstein azt hangsúlyozta, hogy az elmúlt hónapokban jelentős előrelépés történt: a modellek nemcsak fel tudják kezdeni a feladatokat, hanem sokkal jobbak a hibakeresésben, az önjavításban és a próbálkozások ismétlésében. Emellett több technika együttes használata — képernyőképek, hozzáférhetőségi fák (accessibility trees), a DOM‑hoz való közvetlen hozzáférés, Playwright és generált JavaScript‑kód végrehajtása — lényegesen javítja a sebességet és megbízhatóságot.

Weinstein szerint az egyik legfontosabb áttörés, hogy az ügynökök gyakran maguk írnak JavaScriptet, amelyet végrehajtanak a szoftver gyorsabb és több lépésből álló vezérléséhez.

App shots, hozzáférhetőség és gazdagabb kontextus

Az "app shots" (alkalmazás‑pillanatfelvétel) funkció nem pusztán sima képernyőkép: az eszköz gyűjti a nyers szöveget és az alkalmazás hozzáférhetőségi reprezentációját, így a modell részletesebb, token‑hatékony kontextust kap a feladatokhoz. Weinstein hangsúlyozta, hogy a szabványosan a fogyatékossággal élő felhasználók számára fejlesztett hozzáférhetőségi technológiák kettős hasznot hoznak: segítik a képernyőolvasókat és a nyelvi modelleket is abban, hogy pontosan „lássák” az alkalmazás tartalmát.

A teljes fejlesztési ciklus lezárása: fejlesztés, tesztelés, QA

Ari kiemelte, hogy a Computer Use lehetővé teszi, hogy az ügynök ne csak kódot generáljon, hanem a saját maga által készített kódot le is tesztelje — ezzel részben automatizálható a fejlesztés és a QA folyamata, és a fejlesztő már csak ellenőrzi a jól tesztelt eredményt.

Agents API, bizalom, jogosultságok és biztonság

Ari szerint a Computer Use beépítése az Agents API‑ba lehetővé teszi, hogy külső fejlesztők is könnyebben építsenek a harmadik felek webszolgáltatásaira és alkalmazásaira. Ugyanakkor hangsúlyozta a bizalom és a biztonság fontosságát: érzékeny, következményekkel járó műveletek (például fizetések) előtt egyértelmű felhasználói hozzájárulást kell kérni, és limitálni kell, hogy az ügynök milyen webhelyekhez és alkalmazásokhoz férhet hozzá.

Nikunj Handa: API‑újdonságok — aszinkron eszköhívások, mid‑turn steering, WebSockets

Nikunj Handa (Product, API) bemutatta a GPT‑6‑hoz és az új API‑verziókhoz kötődő technikai fejlesztéseket:

  • Async function/tool calling: az eszközhívások aszinkron futtatása lehetővé teszi, hogy a modell ne blokkolódjon az eszközvárakozások alatt, hanem közben további gondolatmeneteket folytasson és később ellenőrizze az eredményt. Ez különösen fontos a hosszabb idejű külső válaszidőket igénylő műveleteknél.
  • Mid‑turn steering: a beavatkozás abban a köztes állapotban, amikor a modell még gondolkodik — így dinamikusan lehet utasításokat adni a futó folyamatra.
  • WebSockets támogatás: bidirekcionális kommunikáció, amely csökkenti a visszaküldési költséget és javítja a valós idejű interakciókat.

Handa elmondta, hogy ezek a funkciók a modellek és a harness kombinációjából válnak hasznossá, és a WebSockets különösen fontos a gyors, eszközvezérelt alkalmazásoknál.

UltraFast, Az inference stack sebességének emelése

Nikunj beszélt az UltraFast kezdeményezésről is: az inference csapat sok optimalizációval dolgozott az Astra és más modellek hatékonyságán, részben a költségcsökkentés céljából (például Luna ára jelentősen csökkent), majd a fókusz átállt a lehető legalacsonyabb késleltetésre. UltraFast a leggyorsabb elérhető futtatást célozza, és az OpenAI a fejlesztések egy részét a kísérletezés és belső ügynökös prototípusok révén hajtotta végre.

Decisions API: gyors döntésmodellek — Jev‑inspiráció

Handa elismerően beszélt a Jev projekt inspiráló hatásáról. A Decisions API‑t az OpenAI belsőleg gyors osztályozási és döntési feladatokra szánták: a jelenlegi implementációt a Luna súlyaira (weights) építették, és a mérnökök az inferencia optimalizálásával, párhuzamos kérdésfuttatással és strukturált kimenetekre való korlátozással érik el a nagyon alacsony késleltetést. Handa hangsúlyozta, hogy ez kezdetben egy „Luna‑alapú, gyors, strukturált” megoldás, és a csapat iterálni fog, ahogy a visszajelzések érkeznek.

A Decisions API alkalmas lehet nagyon gyors osztályozási feladatokra, támogatja a látást is (Vision képességek öröklődnek a Luna‑ból), és belső prototípusoknál GPT Live‑lal kombinálva szintén gyorsabb, interaktív élményt ad.

Caching, előmelegítés (pre‑warming) és hosszú életű agent‑szálak

A Responses API‑hoz kapcsolódóan Handa megosztotta, hogy az OpenAI javította a gyorsítótár (cache) szolgáltatásokat: alapvető garanciaként 30 perces cache‑találatot említette, és belső előnézetben egy 12 órás cache‑garanciát is bevezettek bizonyos ügyfelek számára. A pre‑warming funkció lehetővé teszi, hogy előre írási díjért „melegítsék” a cache‑t, és garantált cache‑olvasatot kapjanak a következő időablakban.

Handa arra buzdította a fejlesztőket, hogy legyenek cache‑tudatosak, használják a prompt és cache diagnosztikai eszközöket, mert ez költség- és teljesítményelõnyt hozhat.

Kontextuskompakció, /compact és szerveroldali compaction

A hosszú, akár millió‑tokenes kontextusok miatt az OpenAI compaction (kompaktálás) megoldásokkal dolgozik. Az Agents API‑ban a compaction a harness része, a Responses API‑nál két lehetőség van: szerveroldali autokompresszió (amikor egy küszöb elérésekor automatikusan csökkentik a használt kontextust), vagy a fejlesztő által kezelt /compact végpont, amellyel kézi kontrollt kap a kompakció felett.

Hol tartunk és hova tart a Computer Use?

Weinstein szerint a jelenlegi fejlesztési irány az, hogy a Computer Use sok feladatot már gyorsabban képes elvégezni, mint az átlagember, és a következő lépés az, hogy „betegesen” gyors, azaz szakértő emberi felhasználóknál is jobb, tehát „literally superhuman” teljesítményű legyen. Ennek eléréséhez egyszerre kell fejleszteni a modelleket, az inferenciát, a harness‑t és a reprezentációs formákat.

Összegzés és fejlesztői felhívás

OpenAI a Dots‑szal, a GPT‑6.1 Sol modellel, az Agents API‑val és a Decisions API‑val olyan összetevőket adott a fejlesztők kezébe, amelyek kombinálva gyorsabb, interaktívabb és kontextusgazdagabb ügynököket tesznek lehetővé. A cég várja a visszajelzéseket: különösen érdeklik őket az Agents és Decisions API‑k használati mintái, a caching és teljesítmény‑diagnosztika, valamint a magasabb szintű platform‑primitívák iránti igények, amelyek tovább emelhetik az "AI cloud"‑szerepet az infrastruktúra‑stackben.

A podcastban résztvevők: Ari Weinstein (Product & Engineering, Computer Use at OpenAI) és Nikunj Handa (Product, API at OpenAI), a beszélgetést Vibhu és Swyx vezette.