Benchmark

GSM8k

Grade School Math 8K, a dataset of 8.5K high-quality linguistically diverse grade school math word problems requiring multi-step reasoning and elementary…

Released
2021-04-01
Modality
text
Categories
math, reasoning
Openness
unknown
Source
llm_stats
Reported scores
48

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3 HaikuAnthropic0.8892024-03-13evidence
Claude 3 OpusAnthropic0.952024-02-29evidence
Claude 3 SonnetAnthropic0.9232024-02-29evidence
Claude 3.5 SonnetAnthropic0.9642024-06-21evidence
Claude 3.5 SonnetAnthropic0.9642024-10-22evidence
Command R+Cohere0.7072024-08-30evidence
DeepSeek-V2.5DeepSeek0.9512024-05-08evidence
ERNIE 4.5Baidu0.2522025-06-25evidence
Gemini 1.5 FlashGoogle0.8622024-05-01evidence
Gemini 1.5 ProGoogle0.9082024-05-01evidence
Gemma 2 27BGoogle0.742024-06-27evidence
Gemma 2 9BGoogle0.6862024-06-27evidence
Gemma 3 12BGoogle0.9442025-03-12evidence
Gemma 3 1BGoogle0.6282025-03-12evidence
Gemma 3 27BGoogle0.9592025-03-12evidence
Gemma 3 4BGoogle0.8922025-03-12evidence
GPT-4.5OpenAI0.972025-02-27evidence
Granite 3.3 8B BaseIBM0.592025-04-16evidence
Granite 3.3 8B InstructIBM0.80892025-04-16evidence
Grok-1.5xAI0.92024-03-28evidence
IBM Granite 4.0 Tiny PreviewIBM0.7012025-05-02evidence
Jamba 1.5 LargeAI21 Labs0.872024-08-22evidence
Jamba 1.5 MiniAI21 Labs0.7582024-08-22evidence
Kimi K2 BaseMoonshot AI0.9212025-07-11evidence
Kimi K2 InstructMoonshot AI0.9732025-07-11evidence
Llama 3.1 405B InstructMeta0.9682024-07-23evidence
Llama 3.1 Nemotron 70B InstructNVIDIA0.91432024-10-01evidence
Llama 3.2 3B InstructMeta0.7772024-09-25evidence
MiMo-V2.5-ProXiaomi0.9962026-04-27evidence
Mistral Large 2Mistral0.932024-07-24evidence
Mistral Small 3 24B BaseMistral0.80732025-01-30evidence
Nova LiteAmazon0.9452024-11-20evidence
Nova MicroAmazon0.9232024-11-20evidence
Nova ProAmazon0.9482024-11-20evidence
o1OpenAI0.9712024-12-17evidence
Phi 4 MiniMicrosoft0.8862025-02-01evidence
Phi-3.5-mini-instructMicrosoft0.8622024-08-23evidence
Phi-3.5-MoE-instructMicrosoft0.8872024-08-23evidence
Qwen2 72B InstructQwen0.9112024-07-23evidence
Qwen2 7B InstructQwen0.8232024-07-23evidence
Qwen2.5 14B InstructQwen0.9482024-09-19evidence
Qwen2.5 32B InstructQwen0.9592024-09-19evidence
Qwen2.5 72B InstructQwen0.9582024-09-19evidence
Qwen2.5 7B InstructQwen0.9162024-09-19evidence
Qwen2.5-Coder 32B InstructQwen0.9112024-09-19evidence
Qwen2.5-Coder 7B InstructQwen0.8392024-09-19evidence
Qwen2.5-Omni-7BQwen0.8872025-03-27evidence
Qwen3 235B A22BQwen0.94392025-04-29evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.