Kutatás

Új MirrorCode mérőszám, hyperscaler beruházások és AI-kutatás taxonómia – Epoch Brief összefoglaló

Epoch AI 2026.

Új MirrorCode mérőszám, hyperscaler beruházások és AI-kutatás taxonómia – Epoch Brief összefoglaló

Epoch AI bemutatta a MirrorCode nevű, METR-rel közösen fejlesztett hosszú távú kódolási benchmarkot, amelynek célja feltérképezni, mekkora, önállóan elvégezhető szoftverprojektet képes befejezni egy AI. A MirrorCode 25 valós program újraépítését bízza a modellekre — a feladatok között bioinformatikai eszközök, Unix-utility-k, kriptográfiai komponensek és interpreterek is szerepelnek. A modellek nem kapnak hozzáférést a forráskódhoz, és emberi beavatkozás sem engedélyezett.

A benchmarkot úgy tervezték, hogy elegendő inferenciakeretet biztosítson a modelleknek valódi szoftvermérnöki (SWE) munkához: míg sok meglévő SWE-benchmark feladatokra jellemzően körülbelül 1–10 dollár inferencia-költséget és percekben vagy legfeljebb órákban mérhető futásidőt enged, a MirrorCode egyes feladatai nagyságrendekkel többet igényelnek. Az egyik legnagyobb MirrorCode-feladat egyetlen futtatása 2 600 dollárba került, és a modell 19 napon át dolgozott emberi közreműködés nélkül. A MirrorCode becslése szerint a legnehezebb feladatok egy emberi mérnök számára asszisztencia nélkül heteket vagy hónapokat igényelnének.

Jelenleg a Claude Opus 4.7 teljesít a legjobban a teszten: 56%-os megoldási arányt ért el, ami arra utal, hogy még jelentős javulási lehetőség maradt a modellfejlesztésben. A részletes eredmények és az elemzés elérhetők a kiadványban.

Pénzügyi trend: a hyperscalerek beruházásai felülmúlhatják működési cash flow-jukat 2026 végére

Isabel Juniewicz, Epoch AI szenior kutatója arra mutat rá, hogy a világ legnagyobb hyperscalerei — Microsoft, Amazon, Alphabet, Meta és Oracle — növekvő ütemben emelik készpénz alapú tőkeberuházásaikat (capex), és ezek a beruházások gyorsabban nőnek, mint a működésből származó készpénzbevételeik. Több hyperscaler már külső finanszírozáshoz folyamodott vagy fontolgat ilyen forrásokat, hogy az AI-infrastruktúra bővítését fedezni tudja. Juniewicz elemzése szerint a trend azt vetíti előre, hogy a capex 2026 végére meghaladhatja az operációs cash flow-kat.

Gradient Updates: két új rövid elemzés

Epoch két új Gradient Update-et tett közzé, amelyekben kutatók és vendégszerzők informálisabb, véleményorientált gondolatokat osztanak meg az AI-fejlődés fontos kérdéseiről. A Gradient Updates az egyes szerzők nézőpontját tükrözi, és nem feltétlenül az Epoch AI hivatalos álláspontja.

Mit tanultunk 1 604 kínai AI álláshirdetésből?

Cheryl Wu, JS Denain és Anson Ho több mint 1 600 álláshirdetést gyűjtött össze hat jelentős kínai vállalattól, hogy feltérképezze stratégiáikat. Az elemzés szerint a kínai laborok — hasonlóan az amerikai szereplőkhöz — nem követnek egyetlen egységes mintát: eltérő „személyiségeket” és működési stratégiákat mutatnak.

Egy O*NET-szerű taxonómia az AI K+F-hez

Joe Kwon, valamint Epoch AI kutatói, Jean-Stanislas Denain és Anson Ho egy részletes, 60+ feladatot tartalmazó taxonómiát javasolnak a csúcstechnológiás AI-kutatás nyomon követésére. A szerzők szerint a jelenlegi gazdasági automatizációt mérő eszközök túl durvák ahhoz, hogy pontosan megmondják, mely kutatási részek automatizálhatók, ezért szükség van egy finomabb, kutatás-specifikus felosztásra.

Egyéb frissítések és álláshirdetések

Epoch AI toborzást folytat több távoli munkakörre (minden pozíció teljesen remote):

  • Senior Product Designer és Product Designer: komplex kutatási eredmények intuitív, magas hatású vizualizációkká és dashboardokká alakítása.
  • Researchers és Senior Researchers: új projektek vezetése a bővülő csapatokban.
  • Data Scientist (Contract): szerződéses adatkutató, aki segíti az AI-kutatást — irodalomáttekintés, benchmark-adatok követése, AI-modellek, adatközpontok és vállalatok elemzése.

A jelentkezések folyamatosan érkeznek, így az érdeklődőknek érdemes hamar jelentkezni.