Az Artificial Analysis (AA) nevű, az iparágban széles körben idézett AI-benchmark szeptember 3-án GPT-6 Astra modelljét 61 pontra értékelte, ezzel a Muse Spark 1.3 elé helyezte. A bejelentést követő 24 órán belül az AA frissítette a mérőindexet v4.2-re, és az új verzióban Astra a második helyre lépett elő.
Az Artificial Analysis közlése szerint a változtatás egy több hónapon át előkészített módszertani frissítés volt. A benchmark karbantartója tehát nem egy gyors korrekciót, hanem rendszeres módszertani átdolgozást jelölt meg az átrendeződés okaként.
Miért fontos ez?
A benchmarkok elsődleges ígérete az objektív, reprodukálható összehasonlítás: egy adott pontszámnak tartósan értelmezhető referenciát kell adnia. Ebben az esetben azonban a pontszám és a hozzá kapcsolódó rangsor másnapra megváltozott, ami rámutat arra, hogy az iparági szereplők által gyakran idézett számok dinamikusak lehetnek.
A frissítés nyomán nem történt nyilvános visszalépés a korábbi idézetektől — se laborok, se sajtóorgánumok részéről nem jelent meg széles körű kérdés vagy visszavonás arról, hogy mi mást módosítottak még a mérési eljárásban. A fejlemény így arra hívja fel a figyelmet, hogy a sajtóközleményekben és marketinganyagokban idézett benchmark-számok valójában szerkeszthető, változó mutatók lehetnek.
Konkrét tények
- Dátum: szeptember 3. — initial score közzététele.
- Kezdeti eredmény: GPT-6 Astra 61 ponton, Muse Spark 1.3 előtt.
- Változtatás: az index frissítése v4.2-re 24 órán belül.
- AA állítása: a frissítés módszertani jellegű, több hónapos előkészítést követően történt.
A történet nem hozott nyilvános botrányt vagy visszavonást, de rávilágít arra, hogy a leggyakrabban idézett benchmark-értékek sem feltétlenül állandó mérőszámok, hanem idővel módosítható indexek részei lehetnek.



