Kutatás

Epoch bemutatja az EBR-benchet és friss elemzéseket az AI-képességekről és sebezhetőség-keresésről

Az Epoch AI kiadta az EBR-bench nevű új benchmarkot, amely a komplex Earthborne Rangers társasjáték ismételt lejátszásával vizsgálja, képesek-e a modellek tapasztalatból tanulni.

Epoch bemutatja az EBR-benchet és friss elemzéseket az AI-képességekről és sebezhetőség-keresésről

Epoch AI legújabb kiadványa bemutatja az EBR-bench nevű benchmarkot, két rövid, adatalapú elemzést és egy friss "Gradient Update" értekezést, továbbá felhívással él nyitott pozíciókra.

Modellek értékelése: EBR-bench

EBR-bench egy új mérőeszköz, amely azt vizsgálja, képesek-e AI-rendszerek tanulni a saját tapasztalataikból. A benchmark egy összetett táblajátékon, az Earthborne Rangersen alapul: a modelleket többször egymás után játszatják, hogy láthatóvá váljon, javulnak-e a teljesítményük és képesek-e hibáikból tanulni.

Epoch eddigi eredményei szerint kevés jel utal arra, hogy a vizsgált modellek jelentősen javulnának az ismételt próbálkozások során. Az EBR-bench célja, hogy folyamatosan nyomon kövesse ezt a képességet, észlelje, ha és amikor változás történik, és ezzel eszközt adjon a kutatóknak és döntéshozóknak.

Benchmarking-tevékenység bővítése

Az EBR-bench az Epoch benchmarking-portfóliójának egyik új eleme. Két héttel korábban az Epoch elindította a MirrorCode benchmarkot, amelyet a METR-rel közösen fejlesztett: itt a modellek autonóm módon, hetekig írnak kódot valós programok újraírására — egyes feladatok több tízezer sort is érintettek. Jelenleg a legjobb modell 56%-os pontszámot ért el a MirrorCode-on.

Az Epoch több benchmarkot is követ: az elmúlt hónapban kilenc, majd legutóbb további tizenhárom benchmarkot adtak hozzá, amelyek között ügynöki (agentic) feladatok, kiberbiztonság, algoritmustervezés, előrejelzés és kutatási szintű fizika is szerepel. A legújabb hét benchmark adatát az Epoch Capabilities Index (ECI) összesített mutató is felhasználja.

Data Insights: két új rövid elemzés

Epoch két új Data Insights-t tett közzé, amelyek röviden, számokkal mutatják be fontos trendeket.

  • GPT-4 hosszabb ideig vezetett az ECI-n, mint bármely más modell

    OpenAI GPT-4 nagyjából egy éven át vezette az Epoch Capabilities Indexet a 2023 márciusi kiadása után, és azóta egyetlen modell sem tartotta meg ilyen hosszú ideig az első helyet. A második leghosszabb vezetést OpenAI o1 modellje érte el, ami valamivel több mint három hónapig tartott — kevesebb mint a harmada GPT-4 idejének.

  • Kibersebezhetőségi bejelentések ugrása a Claude Mythos Preview körül

    Luke Emberson kutató szerint júniusban körülbelül 1 500 magas és kritikus súlyosságú CVE-t jelentettek be figyelemre méltó szervezetek, ami több mint 3,5-szerese az előző havi rekordnak a Claude Mythos megjelenése előtt. A növekedés összefüggésben áll az Anthropic áprilisi bejelentésével, amely szerint a Claude Mythos Preview képes autonóm módon szoftver-sebezhetőségeket feltárni, és hogy a Project Glasswing program partnerei már a modell publikus kiadása előtt használták azt hibák felkutatására és javítására.

Gradient Update: a hiányzó fele az AI-futurizmus vitáknak

A legújabb Gradient Update szerzői, JS Denain (senior kutató) és Anson Ho (kutató), azt állítják, hogy az automatizált AI-kutatásra épülő futurista jóslatok gyakran kizárólag a modellek képességeinek további fejlődésére támaszkodnak, és nem végzik el a futurisztikus technológiák megvalósíthatóságának részletes elemzését. A szerzők azt javasolják, hogy a megalapozottabb előrejelzésekhez használjuk az exploratív mérnökség módszereit és tegyünk világos feltételezéseket az AI-képességekről.

A Gradient Updates a szerzők véleményét tükrözik, és nem feltétlenül egyeznek meg az Epoch AI hivatalos álláspontjával.

Egyéb frissítések: karrierlehetőségek

Az Epoch bővül, és több nyitott pozíciót hirdetett meg, többek között:

  • Finance Specialist / Manager — pénzügyi és számviteli működés vezetése
  • Researcher (Benchmark Reviews) — AI benchmarkok kritikáinak és felülvizsgálatainak kidolgozása és publikálása
  • Researcher (Evaluations) — élvonalbeli modellek értékelése nehezen osztályozható feladatokon
  • Software Engineer, Benchmarking — benchmarking infrastruktúra fejlesztése és karbantartása
  • Talent Scout — kivételes jelöltek felkutatása és toborzása
  • Senior Product Designer — UI/UX és advizualizáció vezetése
  • Data Scientist (Contract) — irodalomkutatás és adatelemzés támogatása

A jelentkezéseket folyamatosan fogadják, így a szervezet alkalmazásokat vár a megüresedett pozíciókra.