Benchmark
MBPP
MBPP (Mostly Basic Python Problems) is a benchmark of 974 crowd-sourced Python programming problems designed to be solvable by entry-level programmers…
- Released
- 2021-08-16
- Modality
- text
- Categories
- reasoning, general
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 33
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Codestral-22B | Mistral | 0.782 | 2024-05-29 | evidence |
| Gemini Diffusion | 0.76 | 2025-05-20 | evidence | |
| Gemma 2 27B | 0.626 | 2024-06-27 | evidence | |
| Gemma 2 9B | 0.524 | 2024-06-27 | evidence | |
| Gemma 3 12B | 0.73 | 2025-03-12 | evidence | |
| Gemma 3 1B | 0.352 | 2025-03-12 | evidence | |
| Gemma 3 27B | 0.744 | 2025-03-12 | evidence | |
| Gemma 3 4B | 0.632 | 2025-03-12 | evidence | |
| Gemma 3n E2B Instructed | 0.566 | 2025-06-26 | evidence | |
| Gemma 3n E2B Instructed LiteRT (Preview) | 0.566 | 2025-05-20 | evidence | |
| Gemma 3n E4B Instructed | 0.636 | 2025-06-26 | evidence | |
| Gemma 3n E4B Instructed LiteRT Preview | 0.636 | 2025-05-20 | evidence | |
| Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 0.846 | 2025-03-18 | evidence |
| Llama 4 Maverick | Meta | 0.776 | 2025-04-05 | evidence |
| Llama 4 Scout | Meta | 0.678 | 2025-04-05 | evidence |
| Llama-3.3 Nemotron Super 49B v1 | NVIDIA | 0.913 | 2025-03-18 | evidence |
| MiniCPM-SALA | OpenBMB | 0.8911 | 2026-02-11 | evidence |
| Mistral Small 3 24B Base | Mistral | 0.6964 | 2025-01-30 | evidence |
| Mistral Small 3.1 24B Instruct | Mistral | 0.7471 | 2025-03-17 | evidence |
| Phi-3.5-mini-instruct | Microsoft | 0.696 | 2024-08-23 | evidence |
| Phi-3.5-MoE-instruct | Microsoft | 0.808 | 2024-08-23 | evidence |
| Qwen2 72B Instruct | Qwen | 0.802 | 2024-07-23 | evidence |
| Qwen2 7B Instruct | Qwen | 0.672 | 2024-07-23 | evidence |
| Qwen2.5 14B Instruct | Qwen | 0.82 | 2024-09-19 | evidence |
| Qwen2.5 32B Instruct | Qwen | 0.84 | 2024-09-19 | evidence |
| Qwen2.5 72B Instruct | Qwen | 0.882 | 2024-09-19 | evidence |
| Qwen2.5 7B Instruct | Qwen | 0.792 | 2024-09-19 | evidence |
| Qwen2.5 VL 32B Instruct | Qwen | 0.84 | 2025-02-28 | evidence |
| Qwen2.5-Coder 32B Instruct | Qwen | 0.902 | 2024-09-19 | evidence |
| Qwen2.5-Coder 7B Instruct | Qwen | 0.835 | 2024-09-19 | evidence |
| Qwen2.5-Omni-7B | Qwen | 0.732 | 2025-03-27 | evidence |
| Qwen3 235B A22B | Qwen | 0.814 | 2025-04-29 | evidence |
| Sarvam-30B | Sarvam AI | 0.927 | 2026-03-06 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.