Benchmark

SWE-Bench Pro

SWE-Bench Pro is an advanced version of SWE-Bench that evaluates language models on complex, real-world software engineering tasks requiring extended…

Modality
text
Categories
reasoning, agents, code
Openness
unknown
Source
llm_stats
Reported scores
50

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude Fable 5Anthropic0.82026-06-09evidence
Claude Mythos PreviewAnthropic0.7782026-04-07evidence
Claude Opus 4.7Anthropic0.6432026-04-16evidence
Claude Opus 4.8Anthropic0.6922026-05-28evidence
Claude Sonnet 5Anthropic0.6322026-06-30evidence
DeepSeek-V4-Flash-0423DeepSeek0.5232026-04-23evidence
DeepSeek-V4-Flash-MaxDeepSeek0.5262026-04-23evidence
DeepSeek-V4-Pro-MaxDeepSeek0.5542026-04-23evidence
Gemini 3.1 ProGoogle0.5422026-02-19evidence
Gemini 3.5 FlashGoogle0.5512026-05-19evidence
Gemini 3.5 Flash-LiteGoogle0.5422026-07-21evidence
Gemini 3.6 FlashGoogle0.5872026-07-21evidence
GLM-5.1Z.ai0.5842026-04-07evidence
GLM-5.2Z.ai0.6212026-06-16evidence
GPT-5.2 CodexOpenAI0.5642026-01-14evidence
GPT-5.3 CodexOpenAI0.5682026-02-05evidence
GPT-5.4OpenAI0.5772026-03-05evidence
GPT-5.4 miniOpenAI0.5442026-03-17evidence
GPT-5.4 nanoOpenAI0.5242026-03-17evidence
GPT-5.5OpenAI0.5862026-04-23evidence
GPT-5.6 LunaOpenAI0.6272026-07-09evidence
GPT-5.6 SolOpenAI0.6462026-07-09evidence
GPT-5.6 TerraOpenAI0.6342026-07-09evidence
Grok 4.5xAI0.6472026-07-16evidence
Hy3Tencent0.5792026-07-06evidence
Inkling-SmallThinking Machines Lab0.5592026-07-30evidence
Kimi K2.5Moonshot AI0.5072026-01-27evidence
Kimi K2.6Moonshot AI0.5862026-04-20evidence
Laguna S 2.1Poolside0.5942026-07-21evidence
Laguna XS 2.1Poolside0.4762026-07-02evidence
MAI-Code-1-FlashMicrosoft0.5122026-06-02evidence
MAI-Thinking-1Microsoft0.5282026-06-02evidence
MiMo-V2.5Xiaomi0.5612026-04-22evidence
MiMo-V2.5-ProXiaomi0.5722026-04-27evidence
MiniMax M2.5MiniMax0.5542026-02-12evidence
MiniMax M2.7MiniMax0.5622026-03-18evidence
MiniMax M3MiniMax0.592026-06-01evidence
Muse Glimmer-30BMeta0.5122026-08-10evidence
Muse SparkMeta0.5242026-04-08evidence
Muse Spark 1.1Meta0.6152026-07-09evidence
North Mini Code 1.0Cohere0.4022026-06-09evidence
Qwen3.6 PlusQwen0.5662026-04-02evidence
Qwen3.6-27BQwen0.5352026-04-21evidence
Qwen3.6-35B-A3BQwen0.4952026-04-16evidence
Qwen3.7 MaxQwen0.6062026-05-19evidence
Qwen3.7-PlusQwen0.5762026-05-31evidence
Qwen3.8 MaxQwen0.6772026-08-02evidence
Qwen3.8-27BQwen0.6172026-08-14evidence
Seed 2.1 ProByteDance0.5752026-06-24evidence
Seed 2.1 TurboByteDance0.572026-06-24evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.