Benchmark
SWE-Bench Verified
A verified subset of 500 software engineering problems from real GitHub issues, validated by human annotators for evaluating language models' ability to…
- Modality
- text
- Categories
- reasoning, frontend_development, code
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 111
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 3.5 Haiku | Anthropic | 0.406 | 2024-10-22 | evidence |
| Claude 3.5 Sonnet | Anthropic | 0.49 | 2024-10-22 | evidence |
| Claude 3.7 Sonnet | Anthropic | 0.703 | 2025-02-24 | evidence |
| Claude Fable 5 | Anthropic | 0.95 | 2026-06-09 | evidence |
| Claude Haiku 4.5 | Anthropic | 0.733 | 2025-10-15 | evidence |
| Claude Mythos Preview | Anthropic | 0.939 | 2026-04-07 | evidence |
| Claude Opus 4 | Anthropic | 0.725 | 2025-05-22 | evidence |
| Claude Opus 4.1 | Anthropic | 0.745 | 2025-08-05 | evidence |
| Claude Opus 4.5 | Anthropic | 0.809 | 2025-11-24 | evidence |
| Claude Opus 4.6 | Anthropic | 0.808 | 2026-02-05 | evidence |
| Claude Opus 4.7 | Anthropic | 0.876 | 2026-04-16 | evidence |
| Claude Opus 4.8 | Anthropic | 0.886 | 2026-05-28 | evidence |
| Claude Sonnet 4 | Anthropic | 0.727 | 2025-05-22 | evidence |
| Claude Sonnet 4.6 | Anthropic | 0.796 | 2026-02-17 | evidence |
| Claude Sonnet 5 | Anthropic | 0.852 | 2026-06-30 | evidence |
| DeepSeek-R1-0528 | DeepSeek | 0.446 | 2025-05-28 | evidence |
| DeepSeek-V2.5 | DeepSeek | 0.168 | 2024-05-08 | evidence |
| DeepSeek-V3 | DeepSeek | 0.42 | 2024-12-25 | evidence |
| DeepSeek-V3.1 | DeepSeek | 0.66 | 2025-01-10 | evidence |
| DeepSeek-V3.2 | DeepSeek | 0.731 | 2025-12-01 | evidence |
| DeepSeek-V3.2 (Thinking) | DeepSeek | 0.731 | 2025-12-01 | evidence |
| DeepSeek-V3.2-Exp | DeepSeek | 0.678 | 2025-09-29 | evidence |
| DeepSeek-V3.2-Speciale | DeepSeek | 0.731 | 2025-12-01 | evidence |
| DeepSeek-V4-Flash-0423 | DeepSeek | 0.786 | 2026-04-23 | evidence |
| DeepSeek-V4-Flash-Max | DeepSeek | 0.79 | 2026-04-23 | evidence |
| DeepSeek-V4-Pro-Max | DeepSeek | 0.806 | 2026-04-23 | evidence |
| Devstral Medium | Mistral | 0.616 | 2025-07-10 | evidence |
| Devstral Small 1.1 | Mistral | 0.536 | 2025-07-11 | evidence |
| Gemini 2.5 Flash | 0.604 | 2025-05-20 | evidence | |
| Gemini 2.5 Flash-Lite | 0.316 | 2025-06-17 | evidence | |
| Gemini 2.5 Pro | 0.632 | 2025-05-20 | evidence | |
| Gemini 2.5 Pro Preview 06-05 | 0.672 | 2025-06-05 | evidence | |
| Gemini 3 Flash | 0.78 | 2025-12-17 | evidence | |
| Gemini 3 Pro | 0.762 | 2025-11-18 | evidence | |
| Gemini 3.1 Pro | 0.806 | 2026-02-19 | evidence | |
| Gemini Diffusion | 0.229 | 2025-05-20 | evidence | |
| GLM-4.5 | Z.ai | 0.642 | 2025-07-28 | evidence |
| GLM-4.5-Air | Z.ai | 0.576 | 2025-07-28 | evidence |
| GLM-4.6 | Z.ai | 0.68 | 2025-09-30 | evidence |
| GLM-4.7 | Z.ai | 0.738 | 2025-12-22 | evidence |
| GLM-4.7-Flash | Z.ai | 0.592 | 2026-01-19 | evidence |
| GLM-5 | Z.ai | 0.778 | 2026-02-11 | evidence |
| GPT-4.1 | OpenAI | 0.546 | 2025-04-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.236 | 2025-04-14 | evidence |
| GPT-4.5 | OpenAI | 0.38 | 2025-02-27 | evidence |
| GPT-4o | OpenAI | 0.332 | 2024-08-06 | evidence |
| GPT-4o mini | OpenAI | 0.087 | 2024-07-18 | evidence |
| GPT-5 | OpenAI | 0.749 | 2025-08-07 | evidence |
| GPT-5 Codex | OpenAI | 0.745 | 2025-09-15 | evidence |
| GPT-5.1 | OpenAI | 0.763 | 2025-11-13 | evidence |
| GPT-5.1 Codex | OpenAI | 0.737 | 2025-11-19 | evidence |
| GPT-5.1 Instant | OpenAI | 0.763 | 2025-11-12 | evidence |
| GPT-5.1 Thinking | OpenAI | 0.763 | 2025-11-12 | evidence |
| GPT-5.2 | OpenAI | 0.8 | 2025-12-11 | evidence |
| Grok Code Fast 1 | xAI | 0.708 | 2025-08-28 | evidence |
| Hy3 | Tencent | 0.78 | 2026-07-06 | evidence |
| Inkling-Small | Thinking Machines Lab | 0.802 | 2026-07-30 | evidence |
| Kimi K2-Instruct-0905 | Moonshot AI | 0.658 | 2025-09-05 | evidence |
| Kimi K2-Thinking-0905 | Moonshot AI | 0.713 | 2025-09-05 | evidence |
| Kimi K2.5 | Moonshot AI | 0.768 | 2026-01-27 | evidence |
| Kimi K2.6 | Moonshot AI | 0.802 | 2026-04-20 | evidence |
| Laguna XS 2.1 | Poolside | 0.709 | 2026-07-02 | evidence |
| LongCat-Flash-Chat | Meituan | 0.604 | 2025-08-29 | evidence |
| LongCat-Flash-Lite | Meituan | 0.544 | 2026-02-05 | evidence |
| LongCat-Flash-Thinking | Meituan | 0.594 | 2025-09-22 | evidence |
| LongCat-Flash-Thinking-2601 | Meituan | 0.7 | 2026-01-14 | evidence |
| MAI-Code-1-Flash | Microsoft | 0.716 | 2026-06-02 | evidence |
| MAI-Code-1.1-Flash | Microsoft | 0.726 | 2026-08-11 | evidence |
| MAI-Thinking-1 | Microsoft | 0.735 | 2026-06-02 | evidence |
| MiMo-V2-Flash | Xiaomi | 0.734 | 2025-12-16 | evidence |
| MiMo-V2-Omni | Xiaomi | 0.748 | 2026-03-18 | evidence |
| MiMo-V2-Pro | Xiaomi | 0.78 | 2026-03-18 | evidence |
| MiMo-V2.5-Pro | Xiaomi | 0.789 | 2026-04-27 | evidence |
| MiniMax M1 40K | MiniMax | 0.556 | 2025-06-16 | evidence |
| MiniMax M1 80K | MiniMax | 0.56 | 2025-06-16 | evidence |
| MiniMax M2 | MiniMax | 0.694 | 2025-10-27 | evidence |
| MiniMax M2.1 | MiniMax | 0.67 | 2025-12-23 | evidence |
| MiniMax M2.5 | MiniMax | 0.802 | 2026-02-12 | evidence |
| MiniMax M3 | MiniMax | 0.805 | 2026-06-01 | evidence |
| Mistral Medium 3.5 | Mistral | 0.776 | 2026-04-29 | evidence |
| Muse Glimmer-30B | Meta | 0.76 | 2026-08-10 | evidence |
| Muse Spark | Meta | 0.774 | 2026-04-08 | evidence |
| Nemotron 3 Nano (30B A3B) | NVIDIA | 0.388 | 2025-12-15 | evidence |
| Nemotron 3 Super (120B A12B) | NVIDIA | 0.5373 | 2026-03-11 | evidence |
| Nemotron 3 Ultra (550B A55B) | NVIDIA | 0.707 | 2026-06-04 | evidence |
| Nemotron 3.5 Lightning (30B A3B) | NVIDIA | 0.5156 | 2026-08-11 | evidence |
| North Mini Code 1.0 | Cohere | 0.676 | 2026-06-09 | evidence |
| Nova 2 Lite | Amazon | 0.645 | 2025-12-02 | evidence |
| Nova 2 Pro | Amazon | 0.7 | 2025-12-02 | evidence |
| o1 | OpenAI | 0.41 | 2024-12-17 | evidence |
| o1-preview | OpenAI | 0.413 | 2024-09-12 | evidence |
| o3 | OpenAI | 0.691 | 2025-04-16 | evidence |
| o3-mini | OpenAI | 0.493 | 2025-01-30 | evidence |
| o4-mini | OpenAI | 0.681 | 2025-04-16 | evidence |
| Qwen3 Max | Qwen | 0.696 | 2025-12-15 | evidence |
| Qwen3-Coder 480B A35B Instruct | Qwen | 0.696 | 2025-01-31 | evidence |
| Qwen3.5-122B-A10B | Qwen | 0.72 | 2026-02-24 | evidence |
| Qwen3.5-27B | Qwen | 0.724 | 2026-02-24 | evidence |
| Qwen3.5-35B-A3B | Qwen | 0.692 | 2026-02-24 | evidence |
| Qwen3.5-397B-A17B | Qwen | 0.764 | 2026-02-16 | evidence |
| Qwen3.6 Plus | Qwen | 0.788 | 2026-04-02 | evidence |
| Qwen3.6-27B | Qwen | 0.772 | 2026-04-21 | evidence |
| Qwen3.6-35B-A3B | Qwen | 0.734 | 2026-04-16 | evidence |
| Qwen3.7 Max | Qwen | 0.804 | 2026-05-19 | evidence |
| Qwen3.7-Plus | Qwen | 0.777 | 2026-05-31 | evidence |
| Sarvam-105B | Sarvam AI | 0.45 | 2026-03-06 | evidence |
| Sarvam-30B | Sarvam AI | 0.34 | 2026-03-06 | evidence |
| Seed 2.0 Lite | ByteDance | 0.735 | 2026-02-14 | evidence |
| Seed 2.0 Pro | ByteDance | 0.765 | 2026-02-14 | evidence |
| Solar Pro 4 | Upstage | 0.706 | 2026-08-06 | evidence |
| Step-3.5-Flash | StepFun | 0.744 | 2026-02-02 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.