Az Arena, amely 2023‑ban indult kutatási projektként a University of California, Berkeleyn, és a közösségre alapozva gyűjti az AI modellek rangsorait, bejelentette, hogy 200 millió dollár értékű Series B körben szerzett tőkét, 3,1 milliárd dolláros vállalatértékelés mellett. A bejelentés csütörtökön érkezett.
A beruházás időzítése részben annak köszönhető, hogy a vállalat júniusban arról számolt be, elérte a 100 millió dolláros évesített bevételi ütemet (annualized run‑rate). Korábban, januárban az Arena 150 millió dolláros Series A kört jelentett be 1,7 milliárd dolláros post‑money értékeléssel; akkor az évesített bevételük 30 millió dollár volt. Ezek alapján a cég piaci értéke nagyjából tíz hónap alatt közel megduplázódott.
A kör vezető befektetői Lightspeed Venture Partners és Khosla Ventures voltak; további befektetők között szerepeltek a Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis és mások.
Mire épül az Arena szolgáltatása?
Az Arena egy közösségi, crowdsourced platformot működtet, amelyet a fogyasztók ingyenesen használhatnak. Felhasználók beírnak promptokat vagy vibe‑kódolt feladatokat, majd értékelik, hogy melyik modell teljesített jobban. A vállalat állítása szerint havi tízmilliós nagyságrendű látogatottsággal rendelkezik.
2024 szeptemberében az Arena bevezette kereskedelmi termékét, az AI Evaluations szolgáltatást, amely részletes teljesítményelemzéseket kínál AI laboroknak és vállalatoknak a közösségi visszajelzések alapján. A szolgáltatás iránti keresletet erősítette, hogy az év során több AI labor is rájött: modellek képesek optimalizálni a szabványos benchmarkok elleni viselkedést úgy, hogy jó eredményeket érjenek el anélkül, hogy valódi, általánosítható fejlődést mutatnának. Ugyanakkor a vállalati szereplők olyan vizsgálati módszereket kerestek, amelyek jobban tükrözik saját belső felhasználási eseteiket, nem csak az egységesített benchmarkokat.
A cég közleménye szerint „az AI gyorsabban fejlődik, mint ahogy azt értékelni tudjuk, és a statikus benchmarkok felbomlanak, ha a modellek felismerik, hogy tesztelik őket.” A közlemény hozzáteszi, hogy szükség van egy semleges harmadik félre, aki valós felhasználók kezében méri az AI biztonságosságát és összhangját; az Arena ebbe a szerepbe lép be.
Új mérőszám: alignment
Ennek megfelelően az Arena bővítette rangsorát egy új kategóriával, amelyet alignmentnek (összhang) nevez. Ebben a kategóriában a modelleket olyan problémák alapján értékelik, mint a jogosulatlan műveletvégzés (a kéréstől eltérő cselekvés), a hibás attribúció (tévesen egy forráshoz rendelni állításokat vagy tényeket), illetve az Arena által „deceptive completion”-nek nevezett viselkedés (arra vonatkozó hazugság, hogy egy feladatot elvégeztek, amikor az nem történt meg).
A preliminary alignment leaderboardon jelenleg több OpenAI‑modell is az élmezőnyben szerepel. Claude Opus 5.5 és Claude Fable a lista hatodik, illetve kilencedik helyén állnak.
Miért fontos ez?
A közösségi visszajelzésen alapuló értékelés és a kereskedelmi analitika kombinációja választ ad a benchmarkokkal kapcsolatos hiányosságokra, és segíthet a vállalatoknak olyan modelleket választani, amelyek a saját felhasználási környezetükben jobban teljesítenek. Az Arena gyors növekedése és a most lezárt finanszírozás jelzi, hogy a piac igényt lát egy független, felhasználóközpontú mérési megoldásra.



