Benchmark
HMMT 2025
Harvard-MIT Mathematics Tournament 2025 - A prestigious student-organized mathematics competition for high school students featuring two tournaments…
- Modality
- text
- Categories
- math
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 33
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| DeepSeek-R1-0528 | DeepSeek | 0.794 | 2025-05-28 | evidence |
| DeepSeek-V3.1 | DeepSeek | 0.335 | 2025-01-10 | evidence |
| DeepSeek-V3.2 | DeepSeek | 0.902 | 2025-12-01 | evidence |
| DeepSeek-V3.2 (Thinking) | DeepSeek | 0.902 | 2025-12-01 | evidence |
| DeepSeek-V3.2-Exp | DeepSeek | 0.836 | 2025-09-29 | evidence |
| DeepSeek-V3.2-Speciale | DeepSeek | 0.992 | 2025-12-01 | evidence |
| GLM-5.1 | Z.ai | 0.94 | 2026-04-07 | evidence |
| GLM-5.2 | Z.ai | 0.944 | 2026-06-16 | evidence |
| GPT-4.1 | OpenAI | 0.289 | 2025-04-14 | evidence |
| GPT-4.1 mini | OpenAI | 0.35 | 2025-04-14 | evidence |
| GPT-5 | OpenAI | 0.933 | 2025-08-07 | evidence |
| GPT-5 mini | OpenAI | 0.878 | 2025-08-07 | evidence |
| GPT-5 nano | OpenAI | 0.756 | 2025-08-07 | evidence |
| GPT-5.2 | OpenAI | 0.994 | 2025-12-11 | evidence |
| GPT-5.2 Pro | OpenAI | 1.0 | 2025-12-11 | evidence |
| Grok 4 Fast | xAI | 0.933 | 2025-08-28 | evidence |
| Kimi K2 Instruct | Moonshot AI | 0.388 | 2025-07-11 | evidence |
| Kimi K2-Instruct-0905 | Moonshot AI | 0.388 | 2025-09-05 | evidence |
| Kimi K2-Thinking-0905 | Moonshot AI | 0.975 | 2025-09-05 | evidence |
| Kimi K2.5 | Moonshot AI | 0.954 | 2026-01-27 | evidence |
| MiMo-V2-Flash | Xiaomi | 0.844 | 2025-12-16 | evidence |
| Nemotron 3 Super (120B A12B) | NVIDIA | 0.9473 | 2026-03-11 | evidence |
| Qwen3.5-122B-A10B | Qwen | 0.914 | 2026-02-24 | evidence |
| Qwen3.5-27B | Qwen | 0.92 | 2026-02-24 | evidence |
| Qwen3.5-35B-A3B | Qwen | 0.89 | 2026-02-24 | evidence |
| Qwen3.5-397B-A17B | Qwen | 0.948 | 2026-02-16 | evidence |
| Qwen3.5-4B | Qwen | 0.74 | 2026-03-02 | evidence |
| Qwen3.5-9B | Qwen | 0.832 | 2026-03-02 | evidence |
| Qwen3.6 Plus | Qwen | 0.967 | 2026-04-02 | evidence |
| Qwen3.6-27B | Qwen | 0.938 | 2026-04-21 | evidence |
| Qwen3.6-35B-A3B | Qwen | 0.907 | 2026-04-16 | evidence |
| Sarvam-105B | Sarvam AI | 0.858 | 2026-03-06 | evidence |
| Sarvam-30B | Sarvam AI | 0.733 | 2026-03-06 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.