Alex Zhang, az MIT kutatója, akinek munkája a GPU‑kernelektől a Recursive Language Models (RLMs) és nagy multi‑agent rendszerek felé ívelt, a közelmúltban részletesen beszélt arról, hogyan lehet a nyelvi modellek köré épített „harness”‑ekkel jelentős képességnövekedést elérni. Az interjú több témát érintett: GPU Mode és KernelBench, AI‑generált GPU‑kernelek, a harnessek szerepe a kompozicionális generalizációban, RLM‑ek belső működése, Prime Agent, az agent‑swarms gyakorlati és költség‑problémái, valamint a kutatói ízlés és a PhD‑hallgatók helyzete.
GPU Mode, KernelBench és az AI‑írta kernel problematikája
Zhang a GPU Mode közösség korai szereplője; a közösség eredetileg CUDA/programozásra fókuszált Discord volt, amelyből később GPU Mode nőtt ki. A közösség által indított versenyek és projektek (például KernelBench) célja annak feltérképezése volt, hogy lehet‑e nagyméretű adathalmaz és LLM‑ek segítségével részben automatizálni GPU‑kernel fejlesztést.
- Több versenymegoldás ma már AI‑generált, de Zhang felhívta a figyelmet egy fontos verifikációs hézagra: a leaderboardokon első helyeken gyakran találhatók megoldások, amelyek nem stabilak valós end‑to‑end rendszerekben. A manuális szakértelem — például egy tapasztalt kernel‑programozó ellenőrzése és prompt‑irányítása — még mindig jelentős előnyt hoz.
- A GPU kernel‑optimalizációra vonatkozó „speed‑of‑light” becslések elméletben meghatározhatók, de a gyakorlatban a megvalósítható teljesítmény sokszor messze elmarad ettől. A memóriaátviteli és megafúziós (megakernel) szempontok is kritikusak az end‑to‑end teljesítmény szempontjából.
Mi az a harness, és miért fontos?
A beszélgetés egyik központi érve, hogy a „harness” — az a környezet és protokoll, amellyel egy nyelvi modellt feladatok megoldására használunk (eszközhívások, állapotmentés, kódvégrehajtás stb.) — sokszor alulértékelt. Zhang szerint a jelenlegi mainstream harnessek (például Codex‑szerű megközelítések) alapstruktúrái egymáshoz hasonlók, de léteznek alternatívák (RLM‑szerű és más opinionált designok), amelyek jobb kompozicionális általánosítást adhatnak.
- A harness szerepe: a nyelvi modell feladatmegoldását programozott lépésekre, alügynökökre (subagents) bontja, eszközhívások és megosztott állapot (pl. fájlrendszer) köré szervezi.
- Kontextus‑offload és megosztott memória: ha a halmozódó kontextust nem egyszerűen promptként tartjuk, hanem kódon/fájlon keresztül kezeljük, a modell hívásai lokálisan in‑distribution maradhatnak — ez erősítetten segíti a generalizációt hosszabb, összetettebb feladatokra.
Rekurzív nyelvi modellek (RLMs) röviden
Zhang meghatározása szerint az RLM alapvetően olyan harness‑terv, ahol a fő eszköz a kód: a modell programkódot ír és hív meg, a rendszer lehetőséget ad önhívásra (rekurzióra), és a kontextus állandóan elérhető egy külső memóriában (például fájlrendszer). Az RLM‑ek célja a hosszú kontextusok, a komponensekre bontott problémamegoldás és a komponens‑szintű in‑distribution hívások biztosítása.
- Előny: ha a rendszert úgy szervezik, hogy a modell minden részfeladatra lokálisan „ismerős” bemenetet kap, akkor az egész feladat jobb általánosítást mutathat — például rövidebb példákból képes hosszabb, 8–30× hosszabb feladatokra kiterjeszteni a megoldást.
- RLM konstrukciókban a subagentek programkódot írhatnak, futtathatnak és állapotot menthetnek, így a rendszer komponenciái visszahívhatóak és akár tartós (persistent) alügynökökként használhatók.
Prime Agent és folytonos harness‑ötletek
Prime Agent az RLM‑ötletből nőtt ki: egy opinionált harness, amelynél IPython (vagy egy REPL) az elsődleges eszköz, minden más funkciót Python‑modulként vagy külső parancsként kezelnek. A Prime Agent keretében kapott hangsúlyt a:
- subagent‑kommunikációs protokoll (hogyan beszélgetnek a komponensek és a root agent),
- persistent subagents (alügynökök, amelyek túlélnek egyes futásokon),
- és a continual harness koncepció (a harness maga is dinamikusan módosíthatja képességeit, alügynökeit és a rendszer‑promptot).
Zhang elmondta, hogy Prime/Select cégek kísérleteznek RLM‑környezetre finomhangolt modellek képzésével, de ő mint akadémikus személyesen nem vesz részt a modellek poszt‑tréningjében.
Agent‑swarms, skálázás és a pazarló keresés kérdése
A beszélgetésben több alkalommal felmerült az agent‑swarms gyakorlati korlátja: nagy ügynöksokaságok hatalmas mennyiségű token‑költséggel és sok „slop”‑pal (felesleges, nem konvergens keresési munka) járhatnak. Zhang szerint a kérdés nem csak az, hogy egy modellt rá lehet‑e bízni egy nagyon nehéz problémára, hanem hogy mennyi compute‑ és token‑veszteség kell ahhoz, hogy a swarm konvergáljon egy hasznos megoldásra.
- OpenAI állítólagos kísérletei: a beszélgetés említette, hogy OpenAI kísérleteiben 10 000 agent körül futott ~88 órán át, 130 milliárd output tokennel — ami nyilvános árazással nagyjából 40 millió dollárnak felelhet meg. Zhang megjegyezte, hogy a teljes költség és a belső infrastruktúra ennél komplexebb lehet, de a szám jelzi a nagyságrendet.
- A hatékonyság kérdése: Zhang úgy vélte, hogy sok swarm‑művelet „wasteful search”, és a konvergencia nehéz; léteznek megközelítések (szervezési org‑chart‑szerű struktúrák, hatékony koordinátorok), de ezek tervezése még kutatási probléma.
Hol van most a kutatói ízlés és mire érdemes fogadni?
Zhang többször hangsúlyozta: a PhD‑hallgatóknak előnyük van abban, hogy kockázatos, „furcsa” ötletekre tehetnek szert, amelyekre ipari laborok nem fektetnek be. Több példa (Quiet‑STaR, ReAct, SWE‑bench, RLMs) arra mutat, hogy egyszerű, jól kivitelezett ötletek később nagy hatást érhetnek el, pedig eleinte kevesen foglalkoztak velük.
- Tanács: használják ki az akadémia szabadságát a nagy, kockázatos fogadásokra; sok ötlet elsőre triviálisnak vagy lényegtelennek tűnhet, de fontosabbá válhat, ha jól megformálják és köré kísérleteket építenek.
Egyéb említett irányok és szervezetek
A beszélgetés több további projektet és csoportot is megemlít:
- Jev és más új modellkoncepciók: Zhang szerint ezek új kimeneti terek (output‑space) példái lehetnek, amelyek gyorsabb inferenciát és másfajta trade‑offokat tesznek lehetővé, mint a standard autoregresszív dekóderek.
- Sakana AI és open‑endedness: nyitott, cél nélküli vagy kevésbé célorientált generatív kutatási irányok; Zhang említette, hogy az ilyen cégek kísérleteznek az automatikus kutatással és az „always‑on” persistens rendszerekkel.
- Kimi és más kínai/regionális megoldások: dinamikus munkafolyamatok és lokális finomhangolások, amelyek piac‑ és kultúra‑specifikus célokra készülnek.
- Harmadik fél RLM implementációk: Harvey (jogi területen) és egyéb csapatok, amelyek RLM‑szerű harnesseket használnak valós alkalmazásokban.
Speculatív programozott eszközhívás és Neuralese
Zhang érintette a „speculative programmatic tool calling” ötletét: ha egy modell kódot ír vagy eszközöket hív, érdemes a futtatást előre (spekulatívan) elindítani — párhuzamos eszközvégrehajtás javíthatja a késleltetést. Ezenfelül felveti a kérdést, hogy a modell „natív” reprezentációja nem feltétlenül angol vagy kód lehet; a jövő nyelve (vagy „Neuralese”) befolyásolhatja, hogyan gondolkodnak és érvelnek a rendszerek.
Kockázatok, lehetőségek és záró gondolatok
- Képesség‑többlet (capability overhang): Zhang szerint a jelenlegi élvonalbeli modellek mögött lehet még nagy hatékonysági tartalék, ha jobb harness‑ekkel és oktatási/finomhangolási stratégiákkal dolgozunk.
- Hatékonyság vs. skála: nagy laborok skálázással érnek el eredményeket, de a kisebb csapatok és akadémia a koncepcionális újításokban (adat, architektúra, harness) találhatnak versenyelőnyt.
Hol található több információ?
- Alex Zhang weboldala: alexzhang13.github.io
- X (Twitter): @a1zhang
Időbélyegek (a podcast fontosabb témáihoz)
00:00:00 – Bevezetés 00:00:49 – GPU Mode, KernelBench, AI‑írta kernel problémák 00:07:38 – Emberi szakértelem vs. nyers token‑kutatás 00:13:20 – Kutatói ízlés és nagy fogadások 00:19:28 – GEV és a nyelvi modell paradigmájának újragondolása 00:29:03 – Játékszimulációk és harness problémák 00:31:01 – Claude Code, Codex és Pi szerkezeti hasonlóságai 00:36:42 – Harnessek mint kompozicionális generalizálók 00:44:24 – RLMs magyarázat 00:52:01 – Prime Agent és tartós alügynökök 00:57:41 – RLMs terepen 01:00:30 – OpenAI swarmok és a jövő nyelvi modelljei 01:07:26 – Open‑endedness és Sakana AI 01:15:52 – Kimi kontra OpenAI agent swarmok 01:20:06 – Capability overhang és spekulatív eszközhívás 01:28:19 – Neuralese, jövőbeni kutatások és AI a tudományért
A fenti összegzés Zhang interjújának főbb pontjait foglalja össze: a kulcsüzenet az, hogy a modellek önmagukban nem mindenek — a köréjük épített rendszerek (harnessek, subagentek, tartós memóriák) alakítják át használhatóságukat, hatékonyságukat és általánosító képességüket. Zhang arra buzdítja a PhD‑hallgatókat, hogy vállaljanak nagy, elsőre „furcsa” kutatói fogadásokat, mert ezekból gyakran nőnek ki később a legfontosabb előrelépések.



