Benchmark
IMO-AnswerBench
IMO-AnswerBench is a benchmark for evaluating mathematical reasoning capabilities on International Mathematical Olympiad (IMO) problems, focusing on…
- Modality
- text
- Categories
- math, reasoning
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 20
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| DeepSeek-V3.2 | DeepSeek | 0.783 | 2025-12-01 | evidence |
| DeepSeek-V4-Flash-0423 | DeepSeek | 0.851 | 2026-04-23 | evidence |
| DeepSeek-V4-Flash-Max | DeepSeek | 0.884 | 2026-04-23 | evidence |
| DeepSeek-V4-Pro-Max | DeepSeek | 0.898 | 2026-04-23 | evidence |
| GLM-4.7 | Z.ai | 0.82 | 2025-12-22 | evidence |
| GLM-5.1 | Z.ai | 0.838 | 2026-04-07 | evidence |
| GLM-5.2 | Z.ai | 0.91 | 2026-06-16 | evidence |
| Hy3 | Tencent | 0.9 | 2026-07-06 | evidence |
| Kimi K2-Thinking-0905 | Moonshot AI | 0.786 | 2025-09-05 | evidence |
| Kimi K2.5 | Moonshot AI | 0.818 | 2026-01-27 | evidence |
| Kimi K2.6 | Moonshot AI | 0.86 | 2026-04-20 | evidence |
| LongCat-Flash-Thinking-2601 | Meituan | 0.786 | 2026-01-14 | evidence |
| Nemotron 3 Ultra (550B A55B) | NVIDIA | 0.923 | 2026-06-04 | evidence |
| Qwen3.5-397B-A17B | Qwen | 0.809 | 2026-02-16 | evidence |
| Qwen3.6 Plus | Qwen | 0.838 | 2026-04-02 | evidence |
| Qwen3.6-27B | Qwen | 0.808 | 2026-04-21 | evidence |
| Qwen3.6-35B-A3B | Qwen | 0.789 | 2026-04-16 | evidence |
| Qwen3.7 Max | Qwen | 0.9 | 2026-05-19 | evidence |
| Qwen3.7-Plus | Qwen | 0.86 | 2026-05-31 | evidence |
| Step-3.5-Flash | StepFun | 0.854 | 2026-02-02 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.