A swe-bench értékelési problémáira reagálva a DeepSWE nevű benchmarkot mutatták be, amely az első érdemi agentes kódbench, és rendezettebb, reprodukálhatóbb mérési keretet kínál az LLM-alapú kódügynökök vizsgálatához. Ez segíthet pontosabb teljesítmény- és megbízhatósági összehasonlításokban.
DeepSWE: új, életszerűbb agentes kódbenchmark a swe-bench problémái helyett
A swe-bench értékelési problémáira reagálva a DeepSWE nevű benchmarkot mutatták be, amely az első érdemi agentes kódbench, és rendezettebb, reprodukálhatóbb mérési keretet kínál az LLM-alapú kódügynökök vizsgálatához.


