Kutatás

DeepSWE: új, életszerűbb agentes kódbenchmark a swe-bench problémái helyett

A swe-bench értékelési problémáira reagálva a DeepSWE nevű benchmarkot mutatták be, amely az első érdemi agentes kódbench, és rendezettebb, reprodukálhatóbb mérési keretet kínál az LLM-alapú kódügynökök vizsgálatához.

A swe-bench értékelési problémáira reagálva a DeepSWE nevű benchmarkot mutatták be, amely az első érdemi agentes kódbench, és rendezettebb, reprodukálhatóbb mérési keretet kínál az LLM-alapú kódügynökök vizsgálatához. Ez segíthet pontosabb teljesítmény- és megbízhatósági összehasonlításokban.