A GPT‑5.6 modellcsalád jelentősen csökkenti az agentek üzemeltetési költségeit, miközben tovább tolja a hatékonysági határokat: kisebb modellek is képesek hosszabb távú feladatokat kezelni kevesebb tokennel, és új Responses API‑primitívek segítik az ügynökök működését.
A modellek és a költséghatékonyság
A GPT‑5 óta minden generáció arra törekszik, hogy hosszabb távú, többlépéses feladatokat kevesebb tokenfelhasználással oldjon meg. A GPT‑5.6 ezt a vonalat viszi tovább: javul az agent‑teljesítmény és csökkennek a költségek, miközben az alapvető végrehajtási környezeten csak minimális változtatás szükséges.
A top‑line költséghatékonyság javulását ráadásul az a tény is növeli, hogy a modellek alacsonyabb „reasoning effort” mellett is pontosabb eredményt adnak. Például az Agents’ Last Exam mérésén a GPT‑5.6 Sol „low” reasoning szinten jobb eredményt ért el, mint a GPT‑5.5 „high” reasoning mellett ugyanazzal a harness‑szal. Több startup produkciós tesztjei is hasonló sikert mutattak: a korábbi alapbeállításokhoz képest csökkentett reasoning effort jelentős költségjavulást eredményezett különböző munkafolyamatokban.
Korábban hosszú távú feladatoknál gyakran a legnagyobb, legmagasabb reasoning szinten futtatott flagship modell jelentette a legjobb megoldást, mert ezek jobbak voltak a hosszabb kontextus és a tool‑hívások kezelésében. A 5.6‑os családdal ez megváltozott: megfelelő tesztidő‑számítás mellett a kisebb Luna és Terra modellek gyakran hasonló teljesítményt adnak, mint a GPT‑5.4 vagy 5.5, de jóval olcsóbban.
Benchmarks és árpélda
A BrowseComp benchmark — amely ritka tények keresésére épül — a modell keresési képességeit méri. Három hónappal ezelőtt a GPT‑5.5 (Extra High) 84,36%-ot ért el ezen a teszten összesen 33,27 dollár költséggel. A GPT‑5.6 Luna (Extra High) a megjelenéskor gyakorlatilag ugyanazt az eredményt adta: 84,04%‑ot, de mindössze 1,33 dollár költséggel. Azóta az árakat tovább csökkentették.
Mikor érdemes kisebb modelleket használni?
Az 5.6‑os kisebb modellek különösen alkalmasak nagy volumenű munkára, alacsony késleltetésű interakciókra és az agentikus folyamatokon belüli ismétlődő lépésekre. Például egy jogi‑tech startup, amely kézzel írt feljegyzéseket parsziroz általános kinyerési lépésként az agentikus elemzés előtt, most Terra vagy Luna modelleket használhat az extrakcióhoz, és jelentős költségmegtakarítást érhet el az egész folyamatban.
Új Responses API‑primitívek és belső architekturális beavatkozások
A GPT‑5.6 mellé új Responses API‑primitíveket is bevezettek, amelyek további hatékonyságot tesznek lehetővé. A modellt három, egymást kiegészítő architekturális beavatkozással tanították end‑to‑end, amelyek célja, hogy az agentek gazdaságosabban működjenek:
- Retained reasoning: a modell megőrzi a releváns gondolatmenetek egy részét a későbbi lépésekhez, így nem kell minden alkalommal újraindítani a teljes rezonálást.
- Compaction: a modell által előállított reprezentációk tömörítése, kevesebb token használatával megőrizni a releváns információt.
- Programmatic Tool Calling: a modell programozottan hívhat eszközöket és írhat JavaScriptet az eszközök orkesztrálásához, párhuzamos hívások futtatásához és az eredmények kontextuson kívüli feldolgozásához.
E három eszköz együttes használata látványos javulást hozhat. Például az ARC‑AGI‑3 vizsgálatnál a GPT‑5.6 Sol a standard harnesszal 13,3%-ot ért el; a retained reasoning és a compaction engedélyezésével az eredmény 38,3%‑ra ugrott, miközben körülbelül hatszor kevesebb output tokent használtak — a modell maga nem változott, de a teljesítmény közel háromszorosára nőtt.
Programmatic Tool Calling és párhuzamos feldolgozás
Agentikus munkafolyamatok gyakran kétféle feladatból állnak: a nyers adatkinyerésből/előfeldolgozásból és a valódi értelmi döntéshozatalból. Ha egy agent például 100 beadványt tölt le, dátum szerint szűr és azonosít tranzakciókat, nem kell, hogy a modell minden közbenső eredményt a kontextusablakában dolgozzon fel. A Programmatic Tool Calling lehetővé teszi, hogy a GPT‑5.6 JavaScriptet írjon az eszközök orkesztrálására, párhuzamos hívásokra és az eredmények kontextuson kívüli aggregálására, így a modell arra koncentrálhat, ami valóban intelligenciát igényel: az ítéletalkotást.
Több‑agent orkesztráció
Összetett, párhuzamosítható feladatoknál az akciók és a rezonálás több agent‑munkafolyamatra való felosztása gyorsabb és intelligensebb megoldást eredményezhet. Ilyen felállásban a fő agent irányítja a subagenteket és delegálja a részfeladatokat; a subagentek párhuzamosan dolgoznak, majd visszaküldik eredményeiket a fő agentnek a végső szintézishez. A fejlesztőcsapatok a Responses API‑ban natívan engedélyezhetik a multi‑agent működést, és ez a megközelítés hasonló az ultra capability beállításhoz a ChatGPT‑ben.
Bár a GPT‑5.6 maga is jó érzékkel dönt arról, mikor érdemes subagenteket indítani és hányat, a multi‑agent viselkedés erősen szabályozható: az utasítások megadása, hogy mikor hívjon al‑ügynököket, növelheti annak esélyét, hogy csak azokban az esetekben spawnoljon plusz agenteket, ahol a további tokenkiadás valóban jobb teljesítményt hoz.
Prompt cache és determinisztikus cache breakpoints
A teljes modellcsaládnál a prompt cache TTL‑je mostantól minimum 30 perc, és a cache breakpoints determinisztikusan beállíthatók a modell kontextusablakán belül. Ez jelentősen javította a startupok cache hit rátáját. Emellett a prompt_cache_key helyes használata növeli annak valószínűségét, hogy egy kérés ugyanarra az inference engine‑re essen, amely korábban kiszolgált azonos prefixet, így csökkentve a késleltetést.
Összegzés
A bemutatott példákból jól látszik, milyen mértékben változott meg az agentek költség‑gazdaságossága. Olyan feladatok, amelyek korábban minden lépésnél frontier modellt igényeltek, ma gyakran hasonló vagy jobb eredményt adhatnak töredékköltségen, ha kisebb modelleket használnak, finomhangolják a reasoning effort‑ot és hatékony architekturális döntéseket alkalmaznak.
A vezető írók — Samarth Madduru, Prashant Mital, Dave Leo és Julien Reiman — tapasztalatai alapján készült útmutató bemutatja, hogyan alkalmazzák a startupok a GPT‑5.6 új lehetőségeit a korai tesztektől a produkcióig. Izgalommal várják, mit építenek ebből a közösségek.



