Benchmark
Humanity's Last Exam
Tool access and test-time compute budget move this score more than model capability does, so two reported figures are rarely comparable. Cards…
- Released
- 2025-01-23
- Categories
- reasoning
- Openness
- unknown
- Source
- model_reports
- Reported scores
- 27
Reported scores
model_reports
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Claude 4 Opus | Anthropic | 10.7 | 2025-06-17 | evidence |
| Claude 4 Sonnet | Anthropic | 7.8 | 2025-06-17 | evidence |
| DeepSeek-V4-Flash | DeepSeek | 34.8 | 2026-06-25 | evidence |
| DeepSeek-V4-Pro | DeepSeek | 7.7 | 2026-04-22 | evidence |
| DeepSeek-V4-Pro | DeepSeek | 34.5 | 2026-04-22 | evidence |
| DeepSeek-V4-Pro | DeepSeek | 44.7 | 2026-04-22 | evidence |
| DeepSeek-V4-Pro | DeepSeek | 37.7 | 2026-04-22 | evidence |
| DeepSeek-V4-Pro | DeepSeek | 48.2 | 2026-04-22 | evidence |
| DeepSeek-V4-Pro-0813 | DeepSeek | 60.0 | 2026-08-13 | evidence |
| DeepSeek-V4-Pro-0813 | DeepSeek | 42.7 | 2026-08-13 | evidence |
| Gemini 2.5 Pro | 21.6 | 2025-06-17 | evidence | |
| Gemini 3.1 Pro | 44.4 | 2026-02-19 | evidence | |
| Gemini 3.1 Pro | 51.4 | 2026-02-19 | evidence | |
| Gemma 4 (31B) | 19.5 | 2026-03-11 | evidence | |
| Gemma 4 (31B) | 26.5 | 2026-03-11 | evidence | |
| GLM-5 | Z.ai | 30.5 | 2026-02-11 | evidence |
| GLM-5.1 | Z.ai | 31.0 | 2026-04-03 | evidence |
| GLM-5.2 | Z.ai | 40.5 | 2026-06-16 | evidence |
| GLM-5.3-Flash | Z.ai | 55.3 | 2026-08-27 | evidence |
| Hy4 preview | Tencent | 55.4 | 2026-08-28 | evidence |
| Hy4 preview | Tencent | 43.4 | 2026-08-28 | evidence |
| Kimi K3 | Moonshot AI | 56.0 | 2026-06-13 | evidence |
| Kimi K3 | Moonshot AI | 43.5 | 2026-06-13 | evidence |
| o3 high | OpenAI | 20.3 | 2025-06-17 | evidence |
| Qwen3.5-397B-A17B | Qwen | 28.7 | 2026-02-16 | evidence |
| Qwen3.5-397B-A17B | Qwen | 48.3 | 2026-02-16 | evidence |
| Qwen3.5-397B-A17B | Qwen | 37.6 | 2026-02-16 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.