Benchmark
MMLU-ProX
Extended version of MMLU-Pro providing additional challenging multiple-choice questions for evaluating language models across diverse academic and…
- Modality
- text
- Categories
- legal, math, reasoning, language, finance, general, healthcare
- Openness
- unknown
- Source
- llm_stats
- Reported scores
- 32
Reported scores
llm_stats
| Model | Organization | Reported value | Reported | Evidence |
|---|---|---|---|---|
| Gemma 3n E2B Instructed | 0.081 | 2025-06-26 | evidence | |
| Gemma 3n E2B Instructed LiteRT (Preview) | 0.081 | 2025-05-20 | evidence | |
| Gemma 3n E4B Instructed | 0.199 | 2025-06-26 | evidence | |
| Gemma 3n E4B Instructed LiteRT Preview | 0.199 | 2025-05-20 | evidence | |
| Nemotron 3 Nano (30B A3B) | NVIDIA | 0.595 | 2025-12-15 | evidence |
| Nemotron 3 Super (120B A12B) | NVIDIA | 0.7936 | 2026-03-11 | evidence |
| Nemotron 3 Ultra (550B A55B) | NVIDIA | 0.83 | 2026-06-04 | evidence |
| Qwen3 VL 235B A22B Instruct | Qwen | 0.778 | 2025-09-22 | evidence |
| Qwen3 VL 235B A22B Thinking | Qwen | 0.806 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Instruct | Qwen | 0.709 | 2025-09-22 | evidence |
| Qwen3 VL 30B A3B Thinking | Qwen | 0.761 | 2025-09-22 | evidence |
| Qwen3 VL 32B Instruct | Qwen | 0.734 | 2025-09-22 | evidence |
| Qwen3 VL 32B Thinking | Qwen | 0.772 | 2025-09-22 | evidence |
| Qwen3 VL 4B Instruct | Qwen | 0.594 | 2025-09-22 | evidence |
| Qwen3 VL 4B Thinking | Qwen | 0.65 | 2025-09-22 | evidence |
| Qwen3 VL 8B Instruct | Qwen | 0.654 | 2025-09-22 | evidence |
| Qwen3 VL 8B Thinking | Qwen | 0.707 | 2025-09-22 | evidence |
| Qwen3-235B-A22B-Instruct-2507 | Qwen | 0.794 | 2025-07-22 | evidence |
| Qwen3-235B-A22B-Thinking-2507 | Qwen | 0.81 | 2025-07-25 | evidence |
| Qwen3-Next-80B-A3B-Instruct | Qwen | 0.767 | 2025-09-10 | evidence |
| Qwen3-Next-80B-A3B-Thinking | Qwen | 0.787 | 2025-09-10 | evidence |
| Qwen3.5-0.8B | Qwen | 0.346 | 2026-03-02 | evidence |
| Qwen3.5-122B-A10B | Qwen | 0.822 | 2026-02-24 | evidence |
| Qwen3.5-27B | Qwen | 0.822 | 2026-02-24 | evidence |
| Qwen3.5-2B | Qwen | 0.523 | 2026-03-02 | evidence |
| Qwen3.5-35B-A3B | Qwen | 0.81 | 2026-02-24 | evidence |
| Qwen3.5-397B-A17B | Qwen | 0.847 | 2026-02-16 | evidence |
| Qwen3.5-4B | Qwen | 0.715 | 2026-03-02 | evidence |
| Qwen3.5-9B | Qwen | 0.763 | 2026-03-02 | evidence |
| Qwen3.6 Plus | Qwen | 0.847 | 2026-04-02 | evidence |
| Qwen3.7 Max | Qwen | 0.87 | 2026-05-19 | evidence |
| Qwen3.7-Plus | Qwen | 0.854 | 2026-05-31 | evidence |
Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.