Benchmark
DeepSWE Benchmark
What is DeepSWE?
Evaluates coding agents on 113 original, long-horizon software engineering tasks across 91 open-source repositories in five languages. Tasks are written from…
- Released
- 2026-05-18
- Evaluates
- Code & Software, Software & AI Compute, cs.SE
- Openness
- unknown
- Importer
- Claire Radar
- Review status
- source-reviewed
- Reported scores
- 0
Source provenance
- Original evidence https://arxiv.org/abs/2607.07946
DeepSWE paper, code and dataset
No reported scores are on record for this benchmark yet.