Epoch AI bemutatta a MirrorCode nevű, METR-rel közösen fejlesztett hosszú távú kódolási benchmarkot, amelynek célja feltérképezni, mekkora, önállóan elvégezhető szoftverprojektet képes befejezni egy AI. A MirrorCode 25 valós program újraépítését bízza a modellekre — a feladatok között bioinformatikai eszközök, Unix-utility-k, kriptográfiai komponensek és interpreterek is szerepelnek. A modellek nem kapnak hozzáférést a forráskódhoz, és emberi beavatkozás sem engedélyezett.
A benchmarkot úgy tervezték, hogy elegendő inferenciakeretet biztosítson a modelleknek valódi szoftvermérnöki (SWE) munkához: míg sok meglévő SWE-benchmark feladatokra jellemzően körülbelül 1–10 dollár inferencia-költséget és percekben vagy legfeljebb órákban mérhető futásidőt enged, a MirrorCode egyes feladatai nagyságrendekkel többet igényelnek. Az egyik legnagyobb MirrorCode-feladat egyetlen futtatása 2 600 dollárba került, és a modell 19 napon át dolgozott emberi közreműködés nélkül. A MirrorCode becslése szerint a legnehezebb feladatok egy emberi mérnök számára asszisztencia nélkül heteket vagy hónapokat igényelnének.
Jelenleg a Claude Opus 4.7 teljesít a legjobban a teszten: 56%-os megoldási arányt ért el, ami arra utal, hogy még jelentős javulási lehetőség maradt a modellfejlesztésben. A részletes eredmények és az elemzés elérhetők a kiadványban.
Pénzügyi trend: a hyperscalerek beruházásai felülmúlhatják működési cash flow-jukat 2026 végére
Isabel Juniewicz, Epoch AI szenior kutatója arra mutat rá, hogy a világ legnagyobb hyperscalerei — Microsoft, Amazon, Alphabet, Meta és Oracle — növekvő ütemben emelik készpénz alapú tőkeberuházásaikat (capex), és ezek a beruházások gyorsabban nőnek, mint a működésből származó készpénzbevételeik. Több hyperscaler már külső finanszírozáshoz folyamodott vagy fontolgat ilyen forrásokat, hogy az AI-infrastruktúra bővítését fedezni tudja. Juniewicz elemzése szerint a trend azt vetíti előre, hogy a capex 2026 végére meghaladhatja az operációs cash flow-kat.
Gradient Updates: két új rövid elemzés
Epoch két új Gradient Update-et tett közzé, amelyekben kutatók és vendégszerzők informálisabb, véleményorientált gondolatokat osztanak meg az AI-fejlődés fontos kérdéseiről. A Gradient Updates az egyes szerzők nézőpontját tükrözi, és nem feltétlenül az Epoch AI hivatalos álláspontja.
Mit tanultunk 1 604 kínai AI álláshirdetésből?
Cheryl Wu, JS Denain és Anson Ho több mint 1 600 álláshirdetést gyűjtött össze hat jelentős kínai vállalattól, hogy feltérképezze stratégiáikat. Az elemzés szerint a kínai laborok — hasonlóan az amerikai szereplőkhöz — nem követnek egyetlen egységes mintát: eltérő „személyiségeket” és működési stratégiákat mutatnak.
Egy O*NET-szerű taxonómia az AI K+F-hez
Joe Kwon, valamint Epoch AI kutatói, Jean-Stanislas Denain és Anson Ho egy részletes, 60+ feladatot tartalmazó taxonómiát javasolnak a csúcstechnológiás AI-kutatás nyomon követésére. A szerzők szerint a jelenlegi gazdasági automatizációt mérő eszközök túl durvák ahhoz, hogy pontosan megmondják, mely kutatási részek automatizálhatók, ezért szükség van egy finomabb, kutatás-specifikus felosztásra.
Egyéb frissítések és álláshirdetések
Epoch AI toborzást folytat több távoli munkakörre (minden pozíció teljesen remote):
- Senior Product Designer és Product Designer: komplex kutatási eredmények intuitív, magas hatású vizualizációkká és dashboardokká alakítása.
- Researchers és Senior Researchers: új projektek vezetése a bővülő csapatokban.
- Data Scientist (Contract): szerződéses adatkutató, aki segíti az AI-kutatást — irodalomáttekintés, benchmark-adatok követése, AI-modellek, adatközpontok és vállalatok elemzése.
A jelentkezések folyamatosan érkeznek, így az érdeklődőknek érdemes hamar jelentkezni.



