Benchmark

MMLU-ProX

Extended version of MMLU-Pro providing additional challenging multiple-choice questions for evaluating language models across diverse academic and…

Modality
text
Categories
legal, math, reasoning, language, finance, general, healthcare
Openness
unknown
Source
llm_stats
Reported scores
32

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Gemma 3n E2B InstructedGoogle0.0812025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.0812025-05-20evidence
Gemma 3n E4B InstructedGoogle0.1992025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.1992025-05-20evidence
Nemotron 3 Nano (30B A3B)NVIDIA0.5952025-12-15evidence
Nemotron 3 Super (120B A12B)NVIDIA0.79362026-03-11evidence
Nemotron 3 Ultra (550B A55B)NVIDIA0.832026-06-04evidence
Qwen3 VL 235B A22B InstructQwen0.7782025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.8062025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.7092025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.7612025-09-22evidence
Qwen3 VL 32B InstructQwen0.7342025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.7722025-09-22evidence
Qwen3 VL 4B InstructQwen0.5942025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.652025-09-22evidence
Qwen3 VL 8B InstructQwen0.6542025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.7072025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.7942025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.812025-07-25evidence
Qwen3-Next-80B-A3B-InstructQwen0.7672025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.7872025-09-10evidence
Qwen3.5-0.8BQwen0.3462026-03-02evidence
Qwen3.5-122B-A10BQwen0.8222026-02-24evidence
Qwen3.5-27BQwen0.8222026-02-24evidence
Qwen3.5-2BQwen0.5232026-03-02evidence
Qwen3.5-35B-A3BQwen0.812026-02-24evidence
Qwen3.5-397B-A17BQwen0.8472026-02-16evidence
Qwen3.5-4BQwen0.7152026-03-02evidence
Qwen3.5-9BQwen0.7632026-03-02evidence
Qwen3.6 PlusQwen0.8472026-04-02evidence
Qwen3.7 MaxQwen0.872026-05-19evidence
Qwen3.7-PlusQwen0.8542026-05-31evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.