A brit AI Security Institute (AISI) hét különböző benchmarkon vizsgált élvonalbeli mesterséges intelligencia modelleket, és azt találta, hogy a széles körben elfogadott pontszámok rendszerszinten hibásak. A közös problémát az jelenti, hogy minden vizsgálatba egy rögzített számítási (compute) költségkeret van beépítve: a modellek csak meghatározott mennyiségű tokennel vagy lépésben dolgozhatnak.
Mit talált az AISI?
- Ha egy „ügynöknek” több token áll rendelkezésére, a teljesítménye folyamatosan javul: szoftveres feladatoknál akár 25%-kal, matematikai feladatoknál pedig 22%-kal.
- Egy kiberbiztonsági kihívás, amely egy emberi szakértő számára körülbelül 20 órát vesz igénybe, megoldatlan maradt a standard korlátok mellett. Ez a feladat csak akkor oldódott meg, amikor a modelleket 30 millió tokenig engedték futni — jóval túl minden szokásos benchmark-vágáson.
- A kutatás szerint az AISI kiberes haladási üteme is gyorsabbnak bizonyult, amikor eltávolították a capet: a teljesítmény megduplázódásának ideje 67 napról 40 napra csökkent.
Miért számít ez a gyakorlatban?
Az AISI megállapítása azt jelenti, hogy a képesség nem egy fix érték, hanem a számítási ráfordítással növekvő görbe. A megszokott leaderbordok, a „modell X Y pontot ért el” típusú címek, valamint a szabályozók által is használt biztonsági értékelések mind arra a pontszámra épülnek, amelyet egy elvileg indokolatlanul kiválasztott költségkeret mellett mértek. Így ezek az értékek nem konzervatív becslések a legrosszabb esetre, hanem torzított, költségfüggő eredmények.
Következmények a modellek rangsorolására és szabályozására
Az AISI figyelmeztetése szerint minden olyan szám, amelyet rangsorolásra, értékesítésre vagy szabályozási döntésekre használnak, valójában egy költségkeret artefaktuma, nem pedig az intelligencia objektív mértéke. Ennek megfelelően a benchmarkok újragondolása szükséges lehet: vagy rugalmasabb mérési kereteket kell alkalmazni, vagy világosan dokumentálni kell a költségkorlátok hatását, hogy a pontszámokat megfelelő kontextusban lehessen értelmezni.
Rövid összegzés
A brit AI Security Institute vizsgálata rámutat, hogy a fix számítási keretek miatt sok benchmark alulbecsüli a modellek valós képességeit. Amíg a mérési gyakorlat nem veszi figyelembe a költség- és tokenfüggést, a publikált pontszámok és a belőlük levont következtetések félrevezetőek lehetnek.



