A Together Compute DeepSWE-eredményei szerint GLM-5.3 lényegesen több feladatot old meg egységnyi költségre vetítve, mint Fable 5: a mérések 87,6%-os megoldási arányt jeleznek nagyjából 16 dollár költség mellett, szemben Fable 5 69,7%-ával 21,63 dollárnál. Fontos megjegyezni, hogy a GLM-eredmény négy próbálkozás összegzése, nem egyszeri futás. Ugyanezen a napon a Financial Times arról számolt be, hogy Anthropic legerősebb modelljei versenyhátrányba kerülhetnek olcsóbb alternatívákkal szemben.
Mi történt és miért fontos
A Together Compute routing-eredményei azt mutatják, hogy ha egy rendszer újrapróbálkozhat (retry), akkor a költséghatékonyság — azaz hány sikeres futás jön ki 100 dollárból — kulcsfontosságú mutató lehet. A közölt számítás szerint GLM-5.3 17 megoldást ad 100 dollárból DeepSWE-n, míg Fable 5 mindössze 3-at; ha az ügynökarchitektúrád képes többszöri próbálkozásra, a drágább egyetlen-„győztes” modell már nem feltétlenül a legjobb választás.
Ugyanakkor a GLM-adatpont mérsékelten intenzív értelmezést igényel: a 87,6% négy próbálkozás eredője, tehát nem egyetlen futás statisztikája. Ez azt jelenti, hogy a számítások érzékenyek az újrapróbálási stratégiákra és a routing logikára.
Egyéb iparági fejlemények (rövid hírek)
- Empero most ingyenes, OpenAI-kompatibilis közösségi végpontot kínál a Qwen3.8-27B-FP8 modellhez; egyszerűen tesztelhető, de nem közöltek uptime-ot, rate limitet vagy adatkezelési feltételeket, így egyelőre teszthasználatra ajánlott.
- Archal API-sandboxokat indított AI-ügynökökhöz, Slack, Linear, Datadog és 20+ állapotmegőrző környezettel CI-hez és értékeléshez — ez a hiányzó rész, amit sok csapat álmintákkal próbál pótolni.
- terminal-code a VS Code funkcióit hozza el a terminálba egyesítve a code-serverrel és a terminal-browserrel, így a szerkesztő, diff, SSH és review folyamatok egy nézetben maradnak.
- Bezalel egyetlen MCP URL mögé sűríti a memóriát, e-mailt, SMS-t, fizetéseket, számítógépet, sandboxokat és csatlakozókat, hogy könnyebb legyen több integráció nélkül tesztelni képességeket; azonban még alfa állapotban van és a csatlakozói állítások változóak.
- SenseNova kiadta U1.5-8B-MoT modellt a Hugging Face-re: egy 8 milliárd paraméteres, bármilyen bemenet-bemenetre (any-to-any) modell, amely helyi multimodális tesztelésre alkalmas, bár benchmarkok egyelőre nem szerepelnek a model cardon.
- Audio8 megjelentette a TTS-Preview-0.1B-t, amelyet a világ legkisebb zéró-sorozatú (zero-shot) TTS modelljének neveznek; 0,1 milliárd paraméterrel helyi hangszintézis gyors kipróbálását teszi lehetővé.
Biztonság, eszközök és kutatás
- Anthropic a Mythos 5 nem nyilvános modellt a Claude Security mögé tette, GitHub-repozitóriumok vizsgálatára és javításokra ajánlva — a legerősebb kód/bug-kereső modell nem „chatel” először, hanem közvetlenül a hibakeresési munkába kerül.
- Fabien Sanglard közzétette az általa használt agent.md fájlt, amelyet LLM-mel támogatott kódminőség-ellenőrzésre használ; ez egy másolható szabvány, amit érdemes soronként összevetni a saját instrukcióiddal.
- A Model Context Protocol (MCP) karbantartói a progresszív eszközfelderítést és egy egységes eszköz-eredmény szerződést tették a roadmapre, hogy javítsák az eszközök kontextusba hozatalát és a kliensoldali egységes kezelést.
- Google Cloud közzétett öt mintát hosszú-horizontú ügynökök számára: stabil prefixek, háttértanulás, perzisztens munkaterületek, explicit hibakezelés és védőláncok — ezek a csendesen felgyülemlő hibák kezelését célozzák.
Finomhangolás, rate-limit és teljesítményszámok
- Valaki Gemma 4 12B modellt finomhangolt eszközhívásokra és 2,7×-es javulást jelentett, azzal az indoklással, hogy a modell kényelmesen elfér egy 16 GB VRAM-mos kártyán. Ez arra utal, hogy az eszközhívási megbízhatóság javítható helyben is, olyan hardveren, amelyet sok fejlesztő már birtokol.
- OpenAI Codex vezetője, Tibo, két fő okot említett a rate-limit problémák mögött: képintenzív, hosszú munkamenetek ismételt kompaktálásokkal, és a Computer Use költségének megugrása a p95+ szinten. A tanács: tartózkodj attól, hogy képeket használj azokban a futásokban, amelyeket kompaktálni tervezel.
- Teljesítményadatok: GLM-5.2 753B-t 14,9 tok/s-sel futtatták egy 96 GB GPU-n; DeepSeek-V4-Flash 284B 22 tok/s 32 GB-on; Qwen3.6-35B 39,3 tok/s egy 8 GB kártyán. Ha ezek a mérések reprodukálhatók, a "túl nagy ahhoz, hogy helyben szolgáljuk" küszöb lejjebb tolódott, és az 8 GB-os Qwen-paraméter különösen hozzáférhető a legtöbb fejlesztő számára.
Nyílt forráskódú eszközök és „Clone & Run” ajánlások
- Apache Maka: helyileg futó ügynök-munkatér, amely modellüzeneteket, eszközhívásokat, jogosultságokat és leállítási eseményeket naplóz első osztályú rekordként — még az Apache inkubációban van.
- Paseo: nyílt vezérlőfelület Claude Code, Codex, Copilot és OpenCode számára helyi gépeken és VPS-en.
- Anthropic claude-plugins-community: csak olvasható tükör a Claude Code és Claude Cowork plugin könyvtárról, megmutatva a valós piactartalmat.
- OpenHuman: nyílt forráskódú, személyes AI lokális memóriával és ügynök-futás-orchesztrációval.
- agent-safe-pipeline: referencia-architektúra, ahol az ügynök javasolhat műveleteket, de nem hagyhat jóvá végső döntést; a döntés egy független policy réteghez kerül.
- open-slide: promptból interaktív bemutatót generál úgy, hogy a kódoló ügynök React komponenseket írjon, így az eredmény szerkeszthető marad.
- Ruflo, oh-my-subagents és több más projekt olyan megoldásokat adnak, amelyek segítik az ügynökkoordinációt, perzisztenciát és auditálhatóságot.
Használati statisztikák
- a16z jelentése szerint február óta a Codex leggyorsabban növekvő felhasználói nem a technológiai szektorban vannak: jogi terület +108×, értékesítés és toborzás +41×, marketing +26×, egészségügy +24×. Ez azt sugallja, hogy a nem mérnöki felhasználók konkrét ismétlődő tudásfeladatokat alakítanak át Codex-szerű munkafolyamatokká.
Következtetés
A Together Compute mérései felhívják a figyelmet arra, hogy a routing és az újrapróbálkozási stratégiák megváltoztathatják a modellek közötti költséghatékonysági sorrendet. Egyes nagy teljesítményű modellek helyett olcsóbb, gyorsabban skálázható vagy helyben futtatható alternatívák versenyképessé válhatnak, különösen ha az ügynökök többször próbálkozhatnak. Ugyanakkor a GLM-adatok több próbálkozás összevont eredményéből származnak, ezért döntés előtt érdemes saját routing-teszteket futtatni a valós használati mintákkal.



