Benchmark
AIME 2025
All 30 problems from the 2025 American Invitational Mathematics Examination (AIME I and AIME II), testing olympiad-level mathematical reasoning with…
- Modality
- text
- Categories
- math, reasoning
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 115
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 3.7 Sonnet | Anthropic | 0.548 | 2025-02-24 | evidence |
| Claude Haiku 4.5 | Anthropic | 0.807 | 2025-10-15 | evidence |
| Claude Opus 4 | Anthropic | 0.755 | 2025-05-22 | evidence |
| Claude Opus 4.1 | Anthropic | 0.78 | 2025-08-05 | evidence |
| Claude Opus 4.6 | Anthropic | 0.9979 | 2026-02-05 | evidence |
| Claude Sonnet 4 | Anthropic | 0.705 | 2025-05-22 | evidence |
| Claude Sonnet 4.5 | Anthropic | 0.87 | 2025-09-29 | evidence |
| Command A+ | Cohere | 0.9 | 2026-05-20 | evidence |
| DeepSeek-R1-0528 | DeepSeek | 0.875 | 2025-05-28 | evidence |
| DeepSeek-V3.1 | DeepSeek | 0.498 | 2025-01-10 | evidence |
| DeepSeek-V3.2 | DeepSeek | 0.931 | 2025-12-01 | evidence |
| DeepSeek-V3.2 (Thinking) | DeepSeek | 0.931 | 2025-12-01 | evidence |
| DeepSeek-V3.2-Exp | DeepSeek | 0.893 | 2025-09-29 | evidence |
| DeepSeek-V3.2-Speciale | DeepSeek | 0.96 | 2025-12-01 | evidence |
| ERNIE 5.0 | Baidu | 0.87 | 2026-01-22 | evidence |
| Gemini 2.5 Flash | 0.72 | 2025-05-20 | evidence | |
| Gemini 2.5 Flash-Lite | 0.498 | 2025-06-17 | evidence | |
| Gemini 2.5 Pro | 0.83 | 2025-05-20 | evidence | |
| Gemini 2.5 Pro Preview 06-05 | 0.88 | 2025-06-05 | evidence | |
| Gemini 3 Flash | 0.997 | 2025-12-17 | evidence | |
| Gemini 3 Pro | 1.0 | 2025-11-18 | evidence | |
| Gemini Diffusion | 0.233 | 2025-05-20 | evidence | |
| Gemma 3n E2B Instructed | 0.067 | 2025-06-26 | evidence | |
| Gemma 3n E2B Instructed LiteRT (Preview) | 0.067 | 2025-05-20 | evidence | |
| Gemma 3n E4B Instructed | 0.116 | 2025-06-26 | evidence | |
| Gemma 3n E4B Instructed LiteRT Preview | 0.116 | 2025-05-20 | evidence | |
| GLM-4.6 | Z.ai | 0.939 | 2025-09-30 | evidence |
| GLM-4.7 | Z.ai | 0.957 | 2025-12-22 | evidence |
| GLM-4.7-Flash | Z.ai | 0.916 | 2026-01-19 | evidence |
| GPT OSS 120B High | OpenAI | 0.925 | 2025-08-05 | evidence |
| GPT OSS 20B High | OpenAI | 0.987 | 2025-08-05 | evidence |
| GPT-4.1 | OpenAI | 0.464 | 2025-04-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.402 | 2025-04-14 | evidence |
| GPT-5 | OpenAI | 0.946 | 2025-08-07 | evidence |
| GPT-5 High | OpenAI | 0.946 | 2025-08-07 | evidence |
| GPT-5 Medium | OpenAI | 0.889 | 2025-08-07 | evidence |
| GPT-5 mini | OpenAI | 0.911 | 2025-08-07 | evidence |
| GPT-5 nano | OpenAI | 0.852 | 2025-08-07 | evidence |
| GPT-5.1 | OpenAI | 0.94 | 2025-11-13 | evidence |
| GPT-5.1 Codex High | OpenAI | 0.967 | 2025-11-12 | evidence |
| GPT-5.1 Codex Mini | OpenAI | 0.421 | 2025-11-12 | evidence |
| GPT-5.1 High | OpenAI | 0.996 | 2025-11-12 | evidence |
| GPT-5.1 Instant | OpenAI | 0.94 | 2025-11-12 | evidence |
| GPT-5.1 Medium | OpenAI | 0.984 | 2025-11-12 | evidence |
| GPT-5.1 Thinking | OpenAI | 0.94 | 2025-11-12 | evidence |
| GPT-5.2 | OpenAI | 1.0 | 2025-12-11 | evidence |
| GPT-5.2 Pro | OpenAI | 1.0 | 2025-12-11 | evidence |
| GPT-5.5 Instant | OpenAI | 0.812 | 2026-05-05 | evidence |
| Grok 4 Fast | xAI | 0.92 | 2025-08-28 | evidence |
| Grok-3 | xAI | 0.933 | 2025-02-17 | evidence |
| Grok-3 Mini | xAI | 0.908 | 2025-02-17 | evidence |
| Grok-4 | xAI | 0.917 | 2025-07-09 | evidence |
| Grok-4 Heavy | xAI | 1.0 | 2025-07-09 | evidence |
| K-EXAONE-236B-A23B | LG AI Research | 0.928 | 2025-12-31 | evidence |
| Kimi K2 Instruct | Moonshot AI | 0.495 | 2025-07-11 | evidence |
| Kimi K2-Instruct-0905 | Moonshot AI | 0.495 | 2025-09-05 | evidence |
| Kimi K2-Thinking-0905 | Moonshot AI | 1.0 | 2025-09-05 | evidence |
| Kimi K2.5 | Moonshot AI | 0.961 | 2026-01-27 | evidence |
| LFM2.5-2.6B | Liquid AI | 0.5187 | 2026-08-04 | evidence |
| Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 0.471 | 2025-03-18 | evidence |
| Llama 3.1 Nemotron Ultra 253B v1 | NVIDIA | 0.725 | 2025-04-07 | evidence |
| Llama-3.3 Nemotron Super 49B v1 | NVIDIA | 0.584 | 2025-03-18 | evidence |
| LongCat-Flash-Chat | Meituan | 0.6125 | 2025-08-29 | evidence |
| LongCat-Flash-Lite | Meituan | 0.6323 | 2026-02-05 | evidence |
| LongCat-Flash-Thinking | Meituan | 0.906 | 2025-09-22 | evidence |
| LongCat-Flash-Thinking-2601 | Meituan | 0.996 | 2026-01-14 | evidence |
| Magistral Medium | Mistral | 0.649 | 2025-06-10 | evidence |
| Magistral Small 2506 | Mistral | 0.6276 | 2025-06-10 | evidence |
| MAI-Thinking-1 | Microsoft | 0.97 | 2026-06-02 | evidence |
| Mercury 2 | Inception | 0.911 | 2026-02-24 | evidence |
| MiMo-V2-Flash | Xiaomi | 0.941 | 2025-12-16 | evidence |
| Min istral 3 (3B Reasoning 2512) | Mistral | 0.721 | 2025-12-04 | evidence |
| MiniCPM-SALA | OpenBMB | 0.7833 | 2026-02-11 | evidence |
| MiniMax M1 40K | MiniMax | 0.746 | 2025-06-16 | evidence |
| MiniMax M1 80K | MiniMax | 0.769 | 2025-06-16 | evidence |
| MiniMax M2 | MiniMax | 0.78 | 2025-10-27 | evidence |
| MiniMax M2.1 | MiniMax | 0.81 | 2025-12-23 | evidence |
| Ministral 3 (14B Reasoning 2512) | Mistral | 0.85 | 2025-12-04 | evidence |
| Ministral 3 (8B Reasoning 2512) | Mistral | 0.787 | 2025-12-04 | evidence |
| Mistral Medium 3.5 | Mistral | 0.863 | 2026-04-29 | evidence |
| Mistral Small 4 | Mistral | 0.838 | 2026-03-16 | evidence |
| Nemotron 3 Nano (30B A3B) | NVIDIA | 0.992 | 2025-12-15 | evidence |
| Nemotron 3 Super (120B A12B) | NVIDIA | 0.9021 | 2026-03-11 | evidence |
| Nemotron Nano 9B v2 | NVIDIA | 0.721 | 2025-08-18 | evidence |
| Nova 2 Lite | Amazon | 0.91 | 2025-12-02 | evidence |
| Nova 2 Omni | Amazon | 0.921 | 2025-12-02 | evidence |
| Nova 2 Pro | Amazon | 0.923 | 2025-12-02 | evidence |
| o3 | OpenAI | 0.864 | 2025-04-16 | evidence |
| o4-mini | OpenAI | 0.927 | 2025-04-16 | evidence |
| Phi 4 Reasoning | Microsoft | 0.629 | 2025-04-30 | evidence |
| Phi 4 Reasoning Plus | Microsoft | 0.78 | 2025-04-30 | evidence |
| Qwen3 235B A22B | Qwen | 0.815 | 2025-04-29 | evidence |
| Qwen3 30B A3B | Qwen | 0.709 | 2025-04-29 | evidence |
| Qwen3 32B | Qwen | 0.729 | 2025-04-29 | evidence |
| Qwen3 Max | Qwen | 0.816 | 2025-12-15 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.747 | 2025-09-22 | evidence |
| Qwen3 VL 235B A22B Thinking | Qwen | 0.897 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Instruct | Qwen | 0.693 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Thinking | Qwen | 0.831 | 2025-09-22 | evidence |
| Qwen3 VL 32B Instruct | Qwen | 0.662 | 2025-09-22 | evidence |
| Qwen3 VL 32B Thinking | Qwen | 0.837 | 2025-09-22 | evidence |
| Qwen3 VL 4B Instruct | Qwen | 0.466 | 2025-09-22 | evidence |
| Qwen3 VL 4B Thinking | Qwen | 0.745 | 2025-09-22 | evidence |
| Qwen3 VL 8B Instruct | Qwen | 0.459 | 2025-09-22 | evidence |
| Qwen3 VL 8B Thinking | Qwen | 0.803 | 2025-09-22 | evidence |
| Qwen3-235B-A22B-Instruct-2507 | Qwen | 0.703 | 2025-07-22 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.923 | 2025-07-25 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.695 | 2025-09-10 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.878 | 2025-09-10 | evidence |
| Sarvam-105B | Sarvam AI | 0.967 | 2026-03-06 | evidence |
| Sarvam-30B | Sarvam AI | 0.967 | 2026-03-06 | evidence |
| Seed 2.0 Lite | ByteDance | 0.93 | 2026-02-14 | evidence |
| Seed 2.0 Pro | ByteDance | 0.983 | 2026-02-14 | evidence |
| Step-3.5-Flash | StepFun | 0.973 | 2026-02-02 | evidence |
| Step3-VL-10B | StepFun | 0.877 | 2026-01-15 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.