OpenAI bemutatta első, kifejezetten inferenciafeladatokra tervezett saját chipjét, Jalapeñót, és az azt körülvevő teljes rendszert. A vállalat közlése szerint a tesztek jelentős előrelépést mutatnak: a Jalapeño több AI-műveletet képes kiszolgálni egységnyi energia alatt, miközben gyorsabb válaszidőt biztosít. OpenAI szerint a chip egyetlen architektúrával éri el egyszerre a magasabb áteresztőképességet és az alacsonyabb késleltetést, miközben a meglévő rendszerek gyakran kompromisszumot kényszerülnek kötni ezek között.
Mit jelent ez a felhasználóknak?
A cég szerint az eredmények gyorsabb válaszokat, interaktívabb ügynököket és megbízhatóbb hozzáférést jelenthetnek növekvő terhelés mellett. OpenAI küldetése, hogy a mesterséges általános intelligencia (AGI) az egész emberiség javát szolgálja; a vállalat hangsúlyozza, hogy a Jalapeño hatékonyságnövekedése hozzájárulhat az egyre képzőbb AI-szolgáltatások olcsóbbá és szélesebb körben elérhetővé tételéhez.
A mérési módszer és a benchmark
A hatékonyságot úgy értékelték, hogy egyenértékű felhasználói élmény mellett mérték, melyik rendszer mennyi hasznos AI-munkát tud elvégezni egységnyi energia alatt, miközben teljesíti a felhasználók és az interaktív ügynökök által igényelt késleltetési követelményeket. A konkrét összehasonlítás a SemiAnalysis InferenceX nyilvános benchmarkján történt, amely az AI-kérés kiszolgálásának teljes folyamatát méri. OpenAI a publikusan elérhető rendszerekkel vetette össze Jalapeñót a vizsgált üzemmódtartományban, a nagy áteresztőképességű kiszolgálástól a nagyon interaktív, alacsony késleltetésű felhasználásig.
Teszteredmények három nyilvános modellen
A Jalapeño három, nyilvános modellel végzett tesztsorozatban 1,5–1,9-szer több AI-munkát hajtott végre wattonként csúcsteljesítmény mellett, továbbá 1,7–3,6-szor alacsonyabb végpontok közötti késleltetést ért el a összehasonlító rendszerekhez képest. Interaktív terhelések esetén a teljesítményjavulás 2,1–4,1× között volt.
A részletes összehasonlításnál az eredményeket az egyes gyorsítók hivatalos csip teljesítményfelvételi értékei alapján normalizálták. A Jalapeñót 700 wattos névleges csomag TDP-vel (package TDP) minősítették, bár a tesztelt munkaterheléseken a mérhető folyamatos teljesítményfelvétel 550 watt vagy az alatt maradt.
Konkrét adatok InferenceX eredményekből (Jalapeño vs. összehasonlító rendszer, ahol a GB200/GB300 szerepel mint összehasonlítás):
- GPT-OSS 120B (nominal 8k/1k, STP): végpont-késleltetés 0.69 ms vs. 1.87 ms (1,459 vs. 535 tok/s/felhasználó); 22,935 vs. 427 mixed/kW (az 535.28 tok/s/felhasználó ponton).
- DeepSeek R1 MXFP4 (nominal 8k/1k, STP): végpont-késleltetés 1.43 ms vs. 5.90 ms (700 vs. 169 tok/s/felhasználó); 12,258 vs. 118 mixed/kW (a 169.41 tok/s/felhasználó ponton).
- Kimi K2.5 MXFP4 (nominal 8k/1k, STP): végpont-késleltetés 1.44 ms vs. 5.48 ms (694 vs. 182 tok/s/felhasználó); 6,744 vs. 120 mixed/kW (a 182.46 tok/s/felhasználó ponton).
A Kimi K2.5 esetében, amely a tesztelt nyilvános modellek közül a legnagyobb, a Jalapeño mintegy 1,5× nagyobb csúcsteljesítményt per watt és 3,4× alacsonyabb végpont-késleltetést nyújtott az összehasonlító rendszerhez képest.
Miben más ez: teljes verem tervezés (full-stack)
OpenAI szerint a Jalapeño eredményei a teljes verem együtttervezésének bizonyítékai: modellek, termékek, szerver-szoftverek, chipek, memória, hálózat és rendszerek egységes tervezésével a valós munkaterhelések visszacsatolása javít minden réteget. A chipet, a memóriát, a hálózatot és a szoftvert úgy alakították ki, hogy minimalizálják az adathozzáférés és kommunikáció miatti késleltetést: a KV cache és más modellállapotok explicit módon lokálisan tarthatók, a hálózat nagy domainje pedig lehetővé teszi, hogy a teljes munkaterhelés egy összekapcsolt rendszerben maradjon.
Ez kiegyensúlyozott, rugalmas gyorsítóarchitektúrát eredményez, amely mind a prefill (prompt feldolgozása, számításigényes), mind a decode (token-generálás, memória-sávszélesség-érzékeny) fázisoknál jól teljesít, és alkalmazkodik az architektúrák változásához — különösen fontos az ügynökös (agentic) munkaterhelések esetén.
Az AI szerepe a chip fejlesztésében
OpenAI közlése szerint a saját AI-modelljeik is felgyorsították a Jalapeño fejlesztését: a korábbi generációk segítettek a tervezésben és bring-up fázisban, míg a legújabb modellek gyorsították a chip programozását és optimalizálását. A fejlesztőcsapat AI segítségével a kezdeti dizájntól a tapeoutig kilenc hónap alatt jutott el, rövidítve a tervezési, mérési és verifikációs ciklusokat. AI-alapú optimalizációk a számítási áramkörökben lehetővé tették, hogy több számítási kapacitást sűrítsenek a chipbe határidőre.
A programozhatóságot úgy tervezték, hogy mind emberi mérnökök, mind AI képes legyen világosan leírni a munkát lokális tenzorokkal, explicit kommunikációval és kiszámítható szinkronizációval. Az AI ezután optimalizálhatja a munkák elhelyezését, ütemezését és koordinációját a rendszeren belül. OpenAI szerint bizonyos kiválasztott GPT-OSS attention és mixture-of-experts blokkokra AI által generált implementációk 1,5–1,8× gyorsabbak voltak, mint a korábbi emberi szakértők által írt változatok (ez a gyorsulás a kiválasztott blokkokra vonatkozik, nem a teljes modellekre).
Gyártás, bevezetés és jövőbeli generációk
OpenAI tervei szerint a Jalapeñót év végéig kezdi telepíteni saját számítástechnikai infrastruktúrájában. A chip az első generációs termék egy többgenerációs fejlesztési útvonalban: a Gen 2 fejlesztése mélyen folyik, a Gen 3 pedig formálódik. Minden generáció a tapasztalatokra építve tovább növeli majd a hatékonyságot és a sebességet.
A vállalat hangsúlyozza, hogy a növekvő AI-igény kielégítése több számítási kapacitást fog igényelni minden elérhető forrásból; ennek részeként továbbra is széles körben telepítenek majd NVIDIA és más partnerek gyorsítóit edzési és inferenciafeladatokra.
A telepítés előkészítéseként jelenleg folytatódik a termelési kvalifikáció, a szoftver érési folyamata, az üzemeltetési skálára való felkészülés és a teljesítmény további modelleken történő validálása. A mostani mérések azt mutatják, milyen eredmények érhetők el, ha a teljes rendszert együtt tervezik: válaszkészebb, képességeiben bővülő és hatékonyabb AI-szolgáltatások szélesebb körű eljuttatása lehetséges.



