Benchmark
HMMT25
Harvard-MIT Mathematics Tournament 2025 - A prestigious student-organized mathematics competition for high school students featuring two tournaments…
- Modality
- text
- Categories
- math
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 25
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Grok-4 | xAI | 0.9 | 2025-07-09 | evidence |
| Grok-4 Heavy | xAI | 0.967 | 2025-07-09 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.574 | 2025-09-22 | evidence |
| Qwen3 VL 235B A22B Thinking | Qwen | 0.774 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Instruct | Qwen | 0.506 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Thinking | Qwen | 0.676 | 2025-09-22 | evidence |
| Qwen3 VL 4B Instruct | Qwen | 0.307 | 2025-09-22 | evidence |
| Qwen3 VL 4B Thinking | Qwen | 0.531 | 2025-09-22 | evidence |
| Qwen3 VL 8B Instruct | Qwen | 0.325 | 2025-09-22 | evidence |
| Qwen3 VL 8B Thinking | Qwen | 0.606 | 2025-09-22 | evidence |
| Qwen3-235B-A22B-Instruct-2507 | Qwen | 0.554 | 2025-07-22 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.839 | 2025-07-25 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.541 | 2025-09-10 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.739 | 2025-09-10 | evidence |
| Qwen3.5-122B-A10B | Qwen | 0.903 | 2026-02-24 | evidence |
| Qwen3.5-27B | Qwen | 0.898 | 2026-02-24 | evidence |
| Qwen3.5-35B-A3B | Qwen | 0.892 | 2026-02-24 | evidence |
| Qwen3.5-397B-A17B | Qwen | 0.927 | 2026-02-16 | evidence |
| Qwen3.5-4B | Qwen | 0.768 | 2026-03-02 | evidence |
| Qwen3.5-9B | Qwen | 0.829 | 2026-03-02 | evidence |
| Qwen3.6 Plus | Qwen | 0.946 | 2026-04-02 | evidence |
| Qwen3.6-27B | Qwen | 0.907 | 2026-04-21 | evidence |
| Qwen3.6-35B-A3B | Qwen | 0.891 | 2026-04-16 | evidence |
| Sarvam-105B | Sarvam AI | 0.858 | 2026-03-06 | evidence |
| Sarvam-30B | Sarvam AI | 0.742 | 2026-03-06 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.