Benchmark

MBPP

MBPP (Mostly Basic Python Problems) is a benchmark of 974 crowd-sourced Python programming problems designed to be solvable by entry-level programmers…

Released
2021-08-16
Modality
text
Categories
reasoning, general
Openness
unknown
Source
llm_stats
Reported scores
33

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Codestral-22BMistral0.7822024-05-29evidence
Gemini DiffusionGoogle0.762025-05-20evidence
Gemma 2 27BGoogle0.6262024-06-27evidence
Gemma 2 9BGoogle0.5242024-06-27evidence
Gemma 3 12BGoogle0.732025-03-12evidence
Gemma 3 1BGoogle0.3522025-03-12evidence
Gemma 3 27BGoogle0.7442025-03-12evidence
Gemma 3 4BGoogle0.6322025-03-12evidence
Gemma 3n E2B InstructedGoogle0.5662025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.5662025-05-20evidence
Gemma 3n E4B InstructedGoogle0.6362025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.6362025-05-20evidence
Llama 3.1 Nemotron Nano 8B V1NVIDIA0.8462025-03-18evidence
Llama 4 MaverickMeta0.7762025-04-05evidence
Llama 4 ScoutMeta0.6782025-04-05evidence
Llama-3.3 Nemotron Super 49B v1NVIDIA0.9132025-03-18evidence
MiniCPM-SALAOpenBMB0.89112026-02-11evidence
Mistral Small 3 24B BaseMistral0.69642025-01-30evidence
Mistral Small 3.1 24B InstructMistral0.74712025-03-17evidence
Phi-3.5-mini-instructMicrosoft0.6962024-08-23evidence
Phi-3.5-MoE-instructMicrosoft0.8082024-08-23evidence
Qwen2 72B InstructQwen0.8022024-07-23evidence
Qwen2 7B InstructQwen0.6722024-07-23evidence
Qwen2.5 14B InstructQwen0.822024-09-19evidence
Qwen2.5 32B InstructQwen0.842024-09-19evidence
Qwen2.5 72B InstructQwen0.8822024-09-19evidence
Qwen2.5 7B InstructQwen0.7922024-09-19evidence
Qwen2.5 VL 32B InstructQwen0.842025-02-28evidence
Qwen2.5-Coder 32B InstructQwen0.9022024-09-19evidence
Qwen2.5-Coder 7B InstructQwen0.8352024-09-19evidence
Qwen2.5-Omni-7BQwen0.7322025-03-27evidence
Qwen3 235B A22BQwen0.8142025-04-29evidence
Sarvam-30BSarvam AI0.9272026-03-06evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.