Epoch AI legújabb kiadványa bemutatja az EBR-bench nevű benchmarkot, két rövid, adatalapú elemzést és egy friss "Gradient Update" értekezést, továbbá felhívással él nyitott pozíciókra.
Modellek értékelése: EBR-bench
EBR-bench egy új mérőeszköz, amely azt vizsgálja, képesek-e AI-rendszerek tanulni a saját tapasztalataikból. A benchmark egy összetett táblajátékon, az Earthborne Rangersen alapul: a modelleket többször egymás után játszatják, hogy láthatóvá váljon, javulnak-e a teljesítményük és képesek-e hibáikból tanulni.
Epoch eddigi eredményei szerint kevés jel utal arra, hogy a vizsgált modellek jelentősen javulnának az ismételt próbálkozások során. Az EBR-bench célja, hogy folyamatosan nyomon kövesse ezt a képességet, észlelje, ha és amikor változás történik, és ezzel eszközt adjon a kutatóknak és döntéshozóknak.
Benchmarking-tevékenység bővítése
Az EBR-bench az Epoch benchmarking-portfóliójának egyik új eleme. Két héttel korábban az Epoch elindította a MirrorCode benchmarkot, amelyet a METR-rel közösen fejlesztett: itt a modellek autonóm módon, hetekig írnak kódot valós programok újraírására — egyes feladatok több tízezer sort is érintettek. Jelenleg a legjobb modell 56%-os pontszámot ért el a MirrorCode-on.
Az Epoch több benchmarkot is követ: az elmúlt hónapban kilenc, majd legutóbb további tizenhárom benchmarkot adtak hozzá, amelyek között ügynöki (agentic) feladatok, kiberbiztonság, algoritmustervezés, előrejelzés és kutatási szintű fizika is szerepel. A legújabb hét benchmark adatát az Epoch Capabilities Index (ECI) összesített mutató is felhasználja.
Data Insights: két új rövid elemzés
Epoch két új Data Insights-t tett közzé, amelyek röviden, számokkal mutatják be fontos trendeket.
-
GPT-4 hosszabb ideig vezetett az ECI-n, mint bármely más modell
OpenAI GPT-4 nagyjából egy éven át vezette az Epoch Capabilities Indexet a 2023 márciusi kiadása után, és azóta egyetlen modell sem tartotta meg ilyen hosszú ideig az első helyet. A második leghosszabb vezetést OpenAI o1 modellje érte el, ami valamivel több mint három hónapig tartott — kevesebb mint a harmada GPT-4 idejének.
-
Kibersebezhetőségi bejelentések ugrása a Claude Mythos Preview körül
Luke Emberson kutató szerint júniusban körülbelül 1 500 magas és kritikus súlyosságú CVE-t jelentettek be figyelemre méltó szervezetek, ami több mint 3,5-szerese az előző havi rekordnak a Claude Mythos megjelenése előtt. A növekedés összefüggésben áll az Anthropic áprilisi bejelentésével, amely szerint a Claude Mythos Preview képes autonóm módon szoftver-sebezhetőségeket feltárni, és hogy a Project Glasswing program partnerei már a modell publikus kiadása előtt használták azt hibák felkutatására és javítására.
Gradient Update: a hiányzó fele az AI-futurizmus vitáknak
A legújabb Gradient Update szerzői, JS Denain (senior kutató) és Anson Ho (kutató), azt állítják, hogy az automatizált AI-kutatásra épülő futurista jóslatok gyakran kizárólag a modellek képességeinek további fejlődésére támaszkodnak, és nem végzik el a futurisztikus technológiák megvalósíthatóságának részletes elemzését. A szerzők azt javasolják, hogy a megalapozottabb előrejelzésekhez használjuk az exploratív mérnökség módszereit és tegyünk világos feltételezéseket az AI-képességekről.
A Gradient Updates a szerzők véleményét tükrözik, és nem feltétlenül egyeznek meg az Epoch AI hivatalos álláspontjával.
Egyéb frissítések: karrierlehetőségek
Az Epoch bővül, és több nyitott pozíciót hirdetett meg, többek között:
- Finance Specialist / Manager — pénzügyi és számviteli működés vezetése
- Researcher (Benchmark Reviews) — AI benchmarkok kritikáinak és felülvizsgálatainak kidolgozása és publikálása
- Researcher (Evaluations) — élvonalbeli modellek értékelése nehezen osztályozható feladatokon
- Software Engineer, Benchmarking — benchmarking infrastruktúra fejlesztése és karbantartása
- Talent Scout — kivételes jelöltek felkutatása és toborzása
- Senior Product Designer — UI/UX és advizualizáció vezetése
- Data Scientist (Contract) — irodalomkutatás és adatelemzés támogatása
A jelentkezéseket folyamatosan fogadják, így a szervezet alkalmazásokat vár a megüresedett pozíciókra.



