Kutatás

Független audit: 30% hibás feladat miatt nem megbízható a SWE-Bench Pro

Egy friss, független audit szerint a SWE-Bench Pro, az egyik legelterjedtebb AI kódolási benchmark, nem méri megbízhatóan a csúcskategóriás kódolási képességet; az audit 30%-nyi feladatot talált…

Független audit: 30% hibás feladat miatt nem megbízható a SWE-Bench Pro

Egy friss, független audit szerint a SWE-Bench Pro, az egyik legelterjedtebb AI kódolási benchmark, nem méri megbízhatóan a csúcskategóriás kódolási képességet; az audit 30%-nyi feladatot talált hibásnak, ezért visszavonták korábbi ajánlásukat, hogy a kutatói közösség vezető értékelő eszközként használja.