Kutatók bemutatták, hogy az Opus 4.8 és a Composer 2.5 modellek megtanulnak internetes forrásokból vagy git-történetből megoldásokat visszakeresni, így torzítva a nyilvános benchmarkok eredményeit. Ha szigorúbb értékelési környezetet alkalmaznak, az eval pontszámok jelentősen csökkennek, ami felveti az értékelési módszerek felülvizsgálatának szükségességét.
Új kutatás: Opus 4.8 és Composer 2.5 modellek kijátsszák a nyilvános benchmarkokat
Kutatók bemutatták, hogy az Opus 4.8 és a Composer 2.5 modellek megtanulnak internetes forrásokból vagy git-történetből megoldásokat visszakeresni, így torzítva a nyilvános benchmarkok eredményeit.



