Benchmark

MMLU-Redux

An improved version of the MMLU benchmark featuring manually re-annotated questions to identify and correct errors in the original dataset. Provides more…

Modality
text
Categories
math, reasoning, language, general
Openness
unknown
Source
llm_stats
Reported scores
48

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
DeepSeek-R1-0528DeepSeek0.9342025-05-28evidence
DeepSeek-V3DeepSeek0.8912024-12-25evidence
DeepSeek-V3.1DeepSeek0.9182025-01-10evidence
ERNIE 4.5Baidu0.4322025-06-25evidence
Kimi K2 InstructMoonshot AI0.9272025-07-11evidence
Kimi K2-Instruct-0905Moonshot AI0.9272025-09-05evidence
Kimi K2-Thinking-0905Moonshot AI0.9442025-09-05evidence
LongCat-Flash-ThinkingMeituan0.8932025-09-22evidence
MiMo-V2.5-ProXiaomi0.9282026-04-27evidence
Ministral 3 (14B Base 2512)Mistral0.822025-12-04evidence
Ministral 3 (3B Base 2512)Mistral0.7352025-12-04evidence
Ministral 3 (8B Base 2512)Mistral0.7932025-12-04evidence
Mistral Large 3Mistral0.822025-09-01evidence
Qwen2.5 14B InstructQwen0.82024-09-19evidence
Qwen2.5 32B InstructQwen0.8392024-09-19evidence
Qwen2.5 72B InstructQwen0.8682024-09-19evidence
Qwen2.5 7B InstructQwen0.7542024-09-19evidence
Qwen2.5-Coder 32B InstructQwen0.7752024-09-19evidence
Qwen2.5-Coder 7B InstructQwen0.6662024-09-19evidence
Qwen2.5-Omni-7BQwen0.712025-03-27evidence
Qwen3 235B A22BQwen0.8742025-04-29evidence
Qwen3 VL 235B A22B InstructQwen0.9222025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.9372025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.8842025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.9092025-09-22evidence
Qwen3 VL 32B InstructQwen0.8982025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.9192025-09-22evidence
Qwen3 VL 4B InstructQwen0.8152025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.862025-09-22evidence
Qwen3 VL 8B InstructQwen0.8492025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.8882025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.9312025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.9382025-07-25evidence
Qwen3-Next-80B-A3B-InstructQwen0.9092025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.9252025-09-10evidence
Qwen3.5-0.8BQwen0.5952026-03-02evidence
Qwen3.5-122B-A10BQwen0.942026-02-24evidence
Qwen3.5-27BQwen0.9322026-02-24evidence
Qwen3.5-2BQwen0.7962026-03-02evidence
Qwen3.5-35B-A3BQwen0.9332026-02-24evidence
Qwen3.5-397B-A17BQwen0.9492026-02-16evidence
Qwen3.5-4BQwen0.8882026-03-02evidence
Qwen3.5-9BQwen0.9112026-03-02evidence
Qwen3.6 PlusQwen0.9452026-04-02evidence
Qwen3.6-27BQwen0.9352026-04-21evidence
Qwen3.6-35B-A3BQwen0.9332026-04-16evidence
Qwen3.7 MaxQwen0.952026-05-19evidence
Qwen3.7-PlusQwen0.9452026-05-31evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.