Benchmark

MATH

MATH dataset contains 12,500 challenging competition mathematics problems from AMC 10, AMC 12, AIME, and other mathematics competitions. Each problem…

Released
2021-11-08
Modality
text
Categories
math, reasoning
Openness
open
Source
llm_stats
Reported scores
71

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3 HaikuAnthropic0.3892024-03-13evidence
Claude 3 OpusAnthropic0.6012024-02-29evidence
Claude 3 SonnetAnthropic0.4312024-02-29evidence
Claude 3.5 HaikuAnthropic0.6942024-10-22evidence
Claude 3.5 SonnetAnthropic0.7112024-06-21evidence
Claude 3.5 SonnetAnthropic0.7832024-10-22evidence
DeepSeek-V2.5DeepSeek0.7472024-05-08evidence
ERNIE 4.5Baidu0.1242025-06-25evidence
Gemini 1.0 ProGoogle0.3262024-02-15evidence
Gemini 1.5 FlashGoogle0.7792024-05-01evidence
Gemini 1.5 Flash 8BGoogle0.5872024-03-15evidence
Gemini 1.5 ProGoogle0.8652024-05-01evidence
Gemini 2.0 FlashGoogle0.8972024-12-01evidence
Gemini 2.0 Flash-LiteGoogle0.8682025-02-05evidence
Gemma 2 27BGoogle0.4232024-06-27evidence
Gemma 2 9BGoogle0.3662024-06-27evidence
Gemma 3 12BGoogle0.8382025-03-12evidence
Gemma 3 1BGoogle0.482025-03-12evidence
Gemma 3 27BGoogle0.892025-03-12evidence
Gemma 3 4BGoogle0.7562025-03-12evidence
GPT-3.5 TurboOpenAI0.4312023-03-21evidence
GPT-4OpenAI0.422023-06-13evidence
GPT-4 TurboOpenAI0.7262024-04-09evidence
GPT-4oOpenAI0.7662024-05-13evidence
GPT-4o miniOpenAI0.7022024-07-18evidence
GPT-5OpenAI0.8472025-08-07evidence
Grok-1.5xAI0.5062024-03-28evidence
Grok-2xAI0.7612024-08-13evidence
Grok-2 minixAI0.732024-08-13evidence
Hermes 3 70BNous Research0.2082024-08-15evidence
Kimi K2 0905Moonshot AI0.8912025-09-05evidence
Kimi K2 BaseMoonshot AI0.7022025-07-11evidence
Llama 3.1 405B InstructMeta0.7382024-07-23evidence
Llama 3.2 11B InstructMeta0.5192024-09-25evidence
Llama 3.2 3B InstructMeta0.482024-09-25evidence
Llama 3.2 90B InstructMeta0.682024-09-25evidence
Llama 3.3 70B InstructMeta0.772024-12-06evidence
Llama 4 MaverickMeta0.6122025-04-05evidence
Llama 4 ScoutMeta0.5032025-04-05evidence
MiMo-V2.5-ProXiaomi0.8622026-04-27evidence
MiniStral 3 (14B Instruct 2512)Mistral0.9042025-12-04evidence
Ministral 3 (3B Instruct 2512)Mistral0.832025-12-04evidence
Ministral 3 (8B Instruct 2512)Mistral0.8762025-12-04evidence
Ministral 8B InstructMistral0.5452024-10-16evidence
Mistral Large 3Mistral0.9042025-09-01evidence
Mistral Small 3 24B BaseMistral0.45982025-01-30evidence
Mistral Small 3 24B InstructMistral0.7062025-01-30evidence
Mistral Small 3.1 24B InstructMistral0.6932025-03-17evidence
Mistral Small 3.2 24B InstructMistral0.69422025-06-20evidence
Nova LiteAmazon0.7332024-11-20evidence
Nova MicroAmazon0.6932024-11-20evidence
Nova ProAmazon0.7662024-11-20evidence
o1OpenAI0.9642024-12-17evidence
o1-previewOpenAI0.8552024-09-12evidence
o3-miniOpenAI0.9792025-01-30evidence
Phi 4Microsoft0.8042024-12-12evidence
Phi 4 MiniMicrosoft0.642025-02-01evidence
Phi-3.5-mini-instructMicrosoft0.4852024-08-23evidence
Phi-3.5-MoE-instructMicrosoft0.5952024-08-23evidence
Pixtral-12BMistral0.4812024-09-17evidence
Qwen2 72B InstructQwen0.5972024-07-23evidence
Qwen2 7B InstructQwen0.4962024-07-23evidence
Qwen2.5 14B InstructQwen0.82024-09-19evidence
Qwen2.5 32B InstructQwen0.8312024-09-19evidence
Qwen2.5 72B InstructQwen0.8312024-09-19evidence
Qwen2.5 7B InstructQwen0.7552024-09-19evidence
Qwen2.5 VL 32B InstructQwen0.8222025-02-28evidence
Qwen2.5-Coder 32B InstructQwen0.5722024-09-19evidence
Qwen2.5-Coder 7B InstructQwen0.4662024-09-19evidence
Qwen2.5-Omni-7BQwen0.7152025-03-27evidence
Qwen3 235B A22BQwen0.71842025-04-29evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.