Benchmark

DeepSWE 1.1

DeepSWE 1.1 evaluates software engineering agents using the mini-swe-agent harness.

Modality
text
Categories
agents, code
Openness
unknown
Source
llm_stats
Reported scores
25

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude Fable 5Anthropic0.72026-06-09evidence
Claude Opus 4.8Anthropic0.592026-05-28evidence
Claude Opus 5Anthropic0.6882026-07-24evidence
Claude Sonnet 4.6Anthropic0.32026-02-17evidence
Claude Sonnet 5Anthropic0.542026-06-30evidence
Gemini 3.1 ProGoogle0.122026-02-19evidence
Gemini 3.5 FlashGoogle0.372026-05-19evidence
Gemini 3.6 FlashGoogle0.492026-07-21evidence
Gemini 3.7 FlashGoogle0.6532026-08-13evidence
GLM-5.2Z.ai0.442026-06-16evidence
GLM-5.3Z.ai0.6692026-08-14evidence
GPT-5.4OpenAI0.522026-03-05evidence
GPT-5.5OpenAI0.672026-04-23evidence
GPT-5.6 LunaOpenAI0.672026-07-09evidence
GPT-5.6 SolOpenAI0.732026-07-09evidence
GPT-5.6 TerraOpenAI0.72026-07-09evidence
Grok 4.5xAI0.542026-07-16evidence
Grok 4.6xAI0.6592026-08-12evidence
Kimi K2.7 CodeMoonshot AI0.312026-06-12evidence
Kimi K3Moonshot AI0.692026-07-16evidence
Laguna S 2.1Poolside0.4042026-07-21evidence
Muse Spark 1.1Meta0.532026-07-09evidence
Muse Spark 1.2Meta0.5932026-08-05evidence
Qwen3.8 MaxQwen0.5662026-08-02evidence
Qwen3.8-27BQwen0.4222026-08-14evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.