Benchmark

DeepSWE Benchmark

What is DeepSWE?

Evaluates coding agents on 113 original, long-horizon software engineering tasks across 91 open-source repositories in five languages. Tasks are written from…

Released
2026-05-18
Evaluates
Code & Software, Software & AI Compute, cs.SE
Openness
unknown
Importer
Claire Radar
Review status
source-reviewed
Reported scores
0

Source provenance

DeepSWE paper, code and dataset

No reported scores are on record for this benchmark yet.

Which sources cite DeepSWE?

Related Code & Software, Software & AI Compute, cs.SE benchmarks