Benchmark
MATH-500
MATH-500 is a subset of the MATH dataset containing 500 challenging competition mathematics problems from AMC 10, AMC 12, AIME, and other mathematics…
- Modality
- text
- Categories
- math, reasoning
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 32
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 3.7 Sonnet | Anthropic | 0.962 | 2025-02-24 | evidence |
| DeepSeek R1 Distill Llama 70B | DeepSeek | 0.945 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Llama 8B | DeepSeek | 0.891 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Qwen 1.5B | DeepSeek | 0.839 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Qwen 14B | DeepSeek | 0.939 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Qwen 32B | DeepSeek | 0.943 | 2025-01-20 | evidence |
| DeepSeek R1 Distill Qwen 7B | DeepSeek | 0.928 | 2025-01-20 | evidence |
| DeepSeek R1 Zero | DeepSeek | 0.959 | 2025-01-20 | evidence |
| DeepSeek-V3 | DeepSeek | 0.902 | 2024-12-25 | evidence |
| DeepSeek-V3 0324 | DeepSeek | 0.94 | 2025-03-25 | evidence |
| GLM-4.5 | Z.ai | 0.982 | 2025-07-28 | evidence |
| GLM-4.5-Air | Z.ai | 0.981 | 2025-07-28 | evidence |
| Granite 3.3 8B Base | IBM | 0.6902 | 2025-04-16 | evidence |
| Granite 3.3 8B Instruct | IBM | 0.6902 | 2025-04-16 | evidence |
| Kimi K2 Instruct | Moonshot AI | 0.974 | 2025-07-11 | evidence |
| Kimi K2-Instruct-0905 | Moonshot AI | 0.974 | 2025-09-05 | evidence |
| Kimi-k1.5 | Moonshot AI | 0.962 | 2025-01-20 | evidence |
| Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 0.954 | 2025-03-18 | evidence |
| Llama 3.1 Nemotron Ultra 253B v1 | NVIDIA | 0.97 | 2025-04-07 | evidence |
| Llama-3.3 Nemotron Super 49B v1 | NVIDIA | 0.966 | 2025-03-18 | evidence |
| LongCat-Flash-Chat | Meituan | 0.964 | 2025-08-29 | evidence |
| LongCat-Flash-Lite | Meituan | 0.968 | 2026-02-05 | evidence |
| LongCat-Flash-Thinking | Meituan | 0.992 | 2025-09-22 | evidence |
| MiniMax M1 40K | MiniMax | 0.96 | 2025-06-16 | evidence |
| MiniMax M1 80K | MiniMax | 0.968 | 2025-06-16 | evidence |
| Nemotron Nano 9B v2 | NVIDIA | 0.978 | 2025-08-18 | evidence |
| o1-mini | OpenAI | 0.9 | 2024-09-12 | evidence |
| Phi 4 Mini Reasoning | Microsoft | 0.946 | 2025-04-30 | evidence |
| QwQ-32B | Qwen | 0.906 | 2025-03-05 | evidence |
| QwQ-32B-Preview | Qwen | 0.906 | 2024-11-28 | evidence |
| Sarvam-105B | Sarvam AI | 0.986 | 2026-03-06 | evidence |
| Sarvam-30B | Sarvam AI | 0.97 | 2026-03-06 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.