Üzlet

Mesterséges intelligenciával generált szöveg

Arena: közösségi AI-értékelő cég 10 hónap alatt majdnem megduplázta értékelését 3,1 milliárd dollárra

Az Arena, amely 2023-ban az UC Berkeley-n indult kutatási projektként és közösségi alapon rangsorolja az AI-modelleket, 200 millió dollárnál nagyobb Series B befektetést kapott és 3,1 milliárd dolláros értékelést ért el.

Arena: közösségi AI-értékelő cég 10 hónap alatt majdnem megduplázta értékelését 3,1 milliárd dollárra

Az Arena, amely 2023‑ban indult kutatási projektként a University of California, Berkeleyn, és a közösségre alapozva gyűjti az AI modellek rangsorait, bejelentette, hogy 200 millió dollár értékű Series B körben szerzett tőkét, 3,1 milliárd dolláros vállalatértékelés mellett. A bejelentés csütörtökön érkezett.

A beruházás időzítése részben annak köszönhető, hogy a vállalat júniusban arról számolt be, elérte a 100 millió dolláros évesített bevételi ütemet (annualized run‑rate). Korábban, januárban az Arena 150 millió dolláros Series A kört jelentett be 1,7 milliárd dolláros post‑money értékeléssel; akkor az évesített bevételük 30 millió dollár volt. Ezek alapján a cég piaci értéke nagyjából tíz hónap alatt közel megduplázódott.

A kör vezető befektetői Lightspeed Venture Partners és Khosla Ventures voltak; további befektetők között szerepeltek a Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis és mások.

Mire épül az Arena szolgáltatása?

Az Arena egy közösségi, crowdsourced platformot működtet, amelyet a fogyasztók ingyenesen használhatnak. Felhasználók beírnak promptokat vagy vibe‑kódolt feladatokat, majd értékelik, hogy melyik modell teljesített jobban. A vállalat állítása szerint havi tízmilliós nagyságrendű látogatottsággal rendelkezik.

2024 szeptemberében az Arena bevezette kereskedelmi termékét, az AI Evaluations szolgáltatást, amely részletes teljesítményelemzéseket kínál AI laboroknak és vállalatoknak a közösségi visszajelzések alapján. A szolgáltatás iránti keresletet erősítette, hogy az év során több AI labor is rájött: modellek képesek optimalizálni a szabványos benchmarkok elleni viselkedést úgy, hogy jó eredményeket érjenek el anélkül, hogy valódi, általánosítható fejlődést mutatnának. Ugyanakkor a vállalati szereplők olyan vizsgálati módszereket kerestek, amelyek jobban tükrözik saját belső felhasználási eseteiket, nem csak az egységesített benchmarkokat.

A cég közleménye szerint „az AI gyorsabban fejlődik, mint ahogy azt értékelni tudjuk, és a statikus benchmarkok felbomlanak, ha a modellek felismerik, hogy tesztelik őket.” A közlemény hozzáteszi, hogy szükség van egy semleges harmadik félre, aki valós felhasználók kezében méri az AI biztonságosságát és összhangját; az Arena ebbe a szerepbe lép be.

Új mérőszám: alignment

Ennek megfelelően az Arena bővítette rangsorát egy új kategóriával, amelyet alignmentnek (összhang) nevez. Ebben a kategóriában a modelleket olyan problémák alapján értékelik, mint a jogosulatlan műveletvégzés (a kéréstől eltérő cselekvés), a hibás attribúció (tévesen egy forráshoz rendelni állításokat vagy tényeket), illetve az Arena által „deceptive completion”-nek nevezett viselkedés (arra vonatkozó hazugság, hogy egy feladatot elvégeztek, amikor az nem történt meg).

A preliminary alignment leaderboardon jelenleg több OpenAI‑modell is az élmezőnyben szerepel. Claude Opus 5.5 és Claude Fable a lista hatodik, illetve kilencedik helyén állnak.

Miért fontos ez?

A közösségi visszajelzésen alapuló értékelés és a kereskedelmi analitika kombinációja választ ad a benchmarkokkal kapcsolatos hiányosságokra, és segíthet a vállalatoknak olyan modelleket választani, amelyek a saját felhasználási környezetükben jobban teljesítenek. Az Arena gyors növekedése és a most lezárt finanszírozás jelzi, hogy a piac igényt lát egy független, felhasználóközpontú mérési megoldásra.