Benchmark

AIME 2025

All 30 problems from the 2025 American Invitational Mathematics Examination (AIME I and AIME II), testing olympiad-level mathematical reasoning with…

Modality
text
Categories
math, reasoning
Openness
unknown
Source
llm_stats
Reported scores
115

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3.7 SonnetAnthropic0.5482025-02-24evidence
Claude Haiku 4.5Anthropic0.8072025-10-15evidence
Claude Opus 4Anthropic0.7552025-05-22evidence
Claude Opus 4.1Anthropic0.782025-08-05evidence
Claude Opus 4.6Anthropic0.99792026-02-05evidence
Claude Sonnet 4Anthropic0.7052025-05-22evidence
Claude Sonnet 4.5Anthropic0.872025-09-29evidence
Command A+Cohere0.92026-05-20evidence
DeepSeek-R1-0528DeepSeek0.8752025-05-28evidence
DeepSeek-V3.1DeepSeek0.4982025-01-10evidence
DeepSeek-V3.2DeepSeek0.9312025-12-01evidence
DeepSeek-V3.2 (Thinking)DeepSeek0.9312025-12-01evidence
DeepSeek-V3.2-ExpDeepSeek0.8932025-09-29evidence
DeepSeek-V3.2-SpecialeDeepSeek0.962025-12-01evidence
ERNIE 5.0Baidu0.872026-01-22evidence
Gemini 2.5 FlashGoogle0.722025-05-20evidence
Gemini 2.5 Flash-LiteGoogle0.4982025-06-17evidence
Gemini 2.5 ProGoogle0.832025-05-20evidence
Gemini 2.5 Pro Preview 06-05Google0.882025-06-05evidence
Gemini 3 FlashGoogle0.9972025-12-17evidence
Gemini 3 ProGoogle1.02025-11-18evidence
Gemini DiffusionGoogle0.2332025-05-20evidence
Gemma 3n E2B InstructedGoogle0.0672025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.0672025-05-20evidence
Gemma 3n E4B InstructedGoogle0.1162025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.1162025-05-20evidence
GLM-4.6Z.ai0.9392025-09-30evidence
GLM-4.7Z.ai0.9572025-12-22evidence
GLM-4.7-FlashZ.ai0.9162026-01-19evidence
GPT OSS 120B HighOpenAI0.9252025-08-05evidence
GPT OSS 20B HighOpenAI0.9872025-08-05evidence
GPT-4.1OpenAI0.4642025-04-14evidence
GPT-4.1 miniOpenAI0.4022025-04-14evidence
GPT-5OpenAI0.9462025-08-07evidence
GPT-5 HighOpenAI0.9462025-08-07evidence
GPT-5 MediumOpenAI0.8892025-08-07evidence
GPT-5 miniOpenAI0.9112025-08-07evidence
GPT-5 nanoOpenAI0.8522025-08-07evidence
GPT-5.1OpenAI0.942025-11-13evidence
GPT-5.1 Codex HighOpenAI0.9672025-11-12evidence
GPT-5.1 Codex MiniOpenAI0.4212025-11-12evidence
GPT-5.1 HighOpenAI0.9962025-11-12evidence
GPT-5.1 InstantOpenAI0.942025-11-12evidence
GPT-5.1 MediumOpenAI0.9842025-11-12evidence
GPT-5.1 ThinkingOpenAI0.942025-11-12evidence
GPT-5.2OpenAI1.02025-12-11evidence
GPT-5.2 ProOpenAI1.02025-12-11evidence
GPT-5.5 InstantOpenAI0.8122026-05-05evidence
Grok 4 FastxAI0.922025-08-28evidence
Grok-3xAI0.9332025-02-17evidence
Grok-3 MinixAI0.9082025-02-17evidence
Grok-4xAI0.9172025-07-09evidence
Grok-4 HeavyxAI1.02025-07-09evidence
K-EXAONE-236B-A23BLG AI Research0.9282025-12-31evidence
Kimi K2 InstructMoonshot AI0.4952025-07-11evidence
Kimi K2-Instruct-0905Moonshot AI0.4952025-09-05evidence
Kimi K2-Thinking-0905Moonshot AI1.02025-09-05evidence
Kimi K2.5Moonshot AI0.9612026-01-27evidence
LFM2.5-2.6BLiquid AI0.51872026-08-04evidence
Llama 3.1 Nemotron Nano 8B V1NVIDIA0.4712025-03-18evidence
Llama 3.1 Nemotron Ultra 253B v1NVIDIA0.7252025-04-07evidence
Llama-3.3 Nemotron Super 49B v1NVIDIA0.5842025-03-18evidence
LongCat-Flash-ChatMeituan0.61252025-08-29evidence
LongCat-Flash-LiteMeituan0.63232026-02-05evidence
LongCat-Flash-ThinkingMeituan0.9062025-09-22evidence
LongCat-Flash-Thinking-2601Meituan0.9962026-01-14evidence
Magistral MediumMistral0.6492025-06-10evidence
Magistral Small 2506Mistral0.62762025-06-10evidence
MAI-Thinking-1Microsoft0.972026-06-02evidence
Mercury 2Inception0.9112026-02-24evidence
MiMo-V2-FlashXiaomi0.9412025-12-16evidence
Min istral 3 (3B Reasoning 2512)Mistral0.7212025-12-04evidence
MiniCPM-SALAOpenBMB0.78332026-02-11evidence
MiniMax M1 40KMiniMax0.7462025-06-16evidence
MiniMax M1 80KMiniMax0.7692025-06-16evidence
MiniMax M2MiniMax0.782025-10-27evidence
MiniMax M2.1MiniMax0.812025-12-23evidence
Ministral 3 (14B Reasoning 2512)Mistral0.852025-12-04evidence
Ministral 3 (8B Reasoning 2512)Mistral0.7872025-12-04evidence
Mistral Medium 3.5Mistral0.8632026-04-29evidence
Mistral Small 4Mistral0.8382026-03-16evidence
Nemotron 3 Nano (30B A3B)NVIDIA0.9922025-12-15evidence
Nemotron 3 Super (120B A12B)NVIDIA0.90212026-03-11evidence
Nemotron Nano 9B v2NVIDIA0.7212025-08-18evidence
Nova 2 LiteAmazon0.912025-12-02evidence
Nova 2 OmniAmazon0.9212025-12-02evidence
Nova 2 ProAmazon0.9232025-12-02evidence
o3OpenAI0.8642025-04-16evidence
o4-miniOpenAI0.9272025-04-16evidence
Phi 4 ReasoningMicrosoft0.6292025-04-30evidence
Phi 4 Reasoning PlusMicrosoft0.782025-04-30evidence
Qwen3 235B A22BQwen0.8152025-04-29evidence
Qwen3 30B A3BQwen0.7092025-04-29evidence
Qwen3 32BQwen0.7292025-04-29evidence
Qwen3 MaxQwen0.8162025-12-15evidence
Qwen3 VL 235B A22B InstructQwen0.7472025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.8972025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.6932025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.8312025-09-22evidence
Qwen3 VL 32B InstructQwen0.6622025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.8372025-09-22evidence
Qwen3 VL 4B InstructQwen0.4662025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.7452025-09-22evidence
Qwen3 VL 8B InstructQwen0.4592025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.8032025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.7032025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.9232025-07-25evidence
Qwen3-Next-80B-A3B-InstructQwen0.6952025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.8782025-09-10evidence
Sarvam-105BSarvam AI0.9672026-03-06evidence
Sarvam-30BSarvam AI0.9672026-03-06evidence
Seed 2.0 LiteByteDance0.932026-02-14evidence
Seed 2.0 ProByteDance0.9832026-02-14evidence
Step-3.5-FlashStepFun0.9732026-02-02evidence
Step3-VL-10BStepFun0.8772026-01-15evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.