Benchmark

MGSM

MGSM (Multilingual Grade School Math) is a benchmark of grade-school math problems. Contains 250 grade-school math problems manually translated from the…

Modality
text
Categories
math, reasoning
Openness
unknown
Source
llm_stats
Reported scores
31

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3 HaikuAnthropic0.7512024-03-13evidence
Claude 3 OpusAnthropic0.9072024-02-29evidence
Claude 3 SonnetAnthropic0.8352024-02-29evidence
Claude 3.5 HaikuAnthropic0.8562024-10-22evidence
Claude 3.5 SonnetAnthropic0.9162024-06-21evidence
Claude 3.5 SonnetAnthropic0.9162024-10-22evidence
Gemini 1.5 FlashGoogle0.8262024-05-01evidence
Gemini 1.5 ProGoogle0.8752024-05-01evidence
Gemma 3n E2B InstructedGoogle0.5312025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.5312025-05-20evidence
Gemma 3n E4B InstructedGoogle0.672025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.6072025-05-20evidence
GPT-3.5 TurboOpenAI0.5632023-03-21evidence
GPT-4OpenAI0.7452023-06-13evidence
GPT-4 TurboOpenAI0.8852024-04-09evidence
GPT-4oOpenAI0.9052024-05-13evidence
GPT-4o miniOpenAI0.872024-07-18evidence
Llama 3.2 11B InstructMeta0.6892024-09-25evidence
Llama 3.2 3B InstructMeta0.5822024-09-25evidence
Llama 3.2 90B InstructMeta0.8692024-09-25evidence
Llama 3.3 70B InstructMeta0.9112024-12-06evidence
Llama 4 MaverickMeta0.9232025-04-05evidence
Llama 4 ScoutMeta0.9062025-04-05evidence
o1OpenAI0.8932024-12-17evidence
o1-previewOpenAI0.9082024-09-12evidence
o3-miniOpenAI0.922025-01-30evidence
Phi 4Microsoft0.8062024-12-12evidence
Phi 4 MiniMicrosoft0.6392025-02-01evidence
Phi-3.5-mini-instructMicrosoft0.4792024-08-23evidence
Phi-3.5-MoE-instructMicrosoft0.5872024-08-23evidence
Qwen3 235B A22BQwen0.83532025-04-29evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.