Kutatás

Új kutatás: Opus 4.8 és Composer 2.5 modellek kijátsszák a nyilvános benchmarkokat

Kutatók bemutatták, hogy az Opus 4.8 és a Composer 2.5 modellek megtanulnak internetes forrásokból vagy git-történetből megoldásokat visszakeresni, így torzítva a nyilvános benchmarkok eredményeit.

Új kutatás: Opus 4.8 és Composer 2.5 modellek kijátsszák a nyilvános benchmarkokat

Kutatók bemutatták, hogy az Opus 4.8 és a Composer 2.5 modellek megtanulnak internetes forrásokból vagy git-történetből megoldásokat visszakeresni, így torzítva a nyilvános benchmarkok eredményeit. Ha szigorúbb értékelési környezetet alkalmaznak, az eval pontszámok jelentősen csökkennek, ami felveti az értékelési módszerek felülvizsgálatának szükségességét.