Benchmark

MMLU-Pro

A more robust and challenging multi-task language understanding benchmark that extends MMLU by expanding multiple-choice options from 4 to 10, eliminating…

Released
2024-06-03
Modality
text
Categories
legal, math, reasoning, language, finance, general, healthcare
Openness
open
Source
llm_stats
Reported scores
134

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3 OpusAnthropic0.6852024-02-29evidence
Claude 3 SonnetAnthropic0.5682024-02-29evidence
Claude 3.5 HaikuAnthropic0.652024-10-22evidence
Claude 3.5 SonnetAnthropic0.7612024-06-21evidence
Claude 3.5 SonnetAnthropic0.7762024-10-22evidence
DeepSeek-R1-0528DeepSeek0.852025-05-28evidence
DeepSeek-V3DeepSeek0.7592024-12-25evidence
DeepSeek-V3 0324DeepSeek0.8122025-03-25evidence
DeepSeek-V3.1DeepSeek0.8372025-01-10evidence
DeepSeek-V3.2DeepSeek0.852025-12-01evidence
DeepSeek-V3.2 (Thinking)DeepSeek0.852025-12-01evidence
DeepSeek-V3.2-ExpDeepSeek0.852025-09-29evidence
DeepSeek-V4-Flash-0423DeepSeek0.8642026-04-23evidence
DeepSeek-V4-Flash-MaxDeepSeek0.8622026-04-23evidence
DeepSeek-V4-Pro-MaxDeepSeek0.8752026-04-23evidence
DiffusionGemma 26B-A4BGoogle0.7762026-06-10evidence
ERNIE 4.5Baidu0.162025-06-25evidence
ERNIE 5.0Baidu0.872026-01-22evidence
Gemini 1.5 FlashGoogle0.6732024-05-01evidence
Gemini 1.5 Flash 8BGoogle0.5872024-03-15evidence
Gemini 1.5 ProGoogle0.7582024-05-01evidence
Gemini 2.0 FlashGoogle0.7642024-12-01evidence
Gemini 2.0 Flash-LiteGoogle0.7162025-02-05evidence
Gemma 3 12BGoogle0.6062025-03-12evidence
Gemma 3 1BGoogle0.1472025-03-12evidence
Gemma 3 27BGoogle0.6752025-03-12evidence
Gemma 3 4BGoogle0.4362025-03-12evidence
Gemma 3n E2B InstructedGoogle0.4052025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.4052025-05-20evidence
Gemma 3n E4B InstructedGoogle0.5062025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.5062025-05-20evidence
Gemma 4 12BGoogle0.7722026-05-23evidence
Gemma 4 26B-A4BGoogle0.8262026-04-02evidence
Gemma 4 31BGoogle0.8522026-04-02evidence
Gemma 4 E2BGoogle0.62026-04-02evidence
Gemma 4 E4BGoogle0.6942026-04-02evidence
GLM-4.5Z.ai0.8462025-07-28evidence
GLM-4.5-AirZ.ai0.8142025-07-28evidence
GLM-4.7Z.ai0.8432025-12-22evidence
GPT OSS 120B HighOpenAI0.8072025-08-05evidence
GPT-4oOpenAI0.7262024-05-13evidence
GPT-4oOpenAI0.7472024-08-06evidence
Grok-1.5xAI0.512024-03-28evidence
Grok-2xAI0.7552024-08-13evidence
Grok-2 minixAI0.722024-08-13evidence
Hermes 3 70BNous Research0.47242024-08-15evidence
Jamba 1.5 LargeAI21 Labs0.5352024-08-22evidence
Jamba 1.5 MiniAI21 Labs0.4252024-08-22evidence
K-EXAONE-236B-A23BLG AI Research0.8382025-12-31evidence
Kimi K2 0905Moonshot AI0.8252025-09-05evidence
Kimi K2 BaseMoonshot AI0.6922025-07-11evidence
Kimi K2 InstructMoonshot AI0.8112025-07-11evidence
Kimi K2-Instruct-0905Moonshot AI0.8112025-09-05evidence
Kimi K2-Thinking-0905Moonshot AI0.8462025-09-05evidence
Kimi K2.5Moonshot AI0.8712026-01-27evidence
Llama 3.1 405B InstructMeta0.7332024-07-23evidence
Llama 3.1 70B InstructMeta0.6642024-07-23evidence
Llama 3.1 8B InstructMeta0.4832024-07-23evidence
Llama 3.3 70B InstructMeta0.6892024-12-06evidence
Llama 4 MaverickMeta0.8052025-04-05evidence
Llama 4 ScoutMeta0.7432025-04-05evidence
LongCat-Flash-ChatMeituan0.82682025-08-29evidence
LongCat-Flash-LiteMeituan0.78292026-02-05evidence
LongCat-Flash-ThinkingMeituan0.8262025-09-22evidence
MAI-Thinking-1Microsoft0.852026-06-02evidence
MiMo-V2-FlashXiaomi0.8492025-12-16evidence
MiMo-V2.5-ProXiaomi0.6852026-04-27evidence
MiniCPM-SALAOpenBMB0.67042026-02-11evidence
MiniMax M1 40KMiniMax0.8062025-06-16evidence
MiniMax M1 80KMiniMax0.8112025-06-16evidence
MiniMax M2MiniMax0.822025-10-27evidence
MiniMax M2.1MiniMax0.882025-12-23evidence
Mistral Small 3 24B BaseMistral0.54372025-01-30evidence
Mistral Small 3 24B InstructMistral0.6632025-01-30evidence
Mistral Small 3.1 24B BaseMistral0.56032025-03-17evidence
Mistral Small 3.1 24B InstructMistral0.66762025-03-17evidence
Mistral Small 3.2 24B InstructMistral0.69062025-06-20evidence
Mistral Small 4Mistral0.782026-03-16evidence
Nemotron 3 Nano (30B A3B)NVIDIA0.7832025-12-15evidence
Nemotron 3 Super (120B A12B)NVIDIA0.83732026-03-11evidence
Nemotron 3 Ultra (550B A55B)NVIDIA0.8682026-06-04evidence
Nemotron 3.5 Lightning (30B A3B)NVIDIA0.81942026-08-11evidence
North Micro Vision InstructCohere0.3072026-08-12evidence
Nova 2 LiteAmazon0.8092025-12-02evidence
Nova 2 OmniAmazon0.8072025-12-02evidence
Nova 2 ProAmazon0.8162025-12-02evidence
Phi 4Microsoft0.7042024-12-12evidence
Phi 4 MiniMicrosoft0.5282025-02-01evidence
Phi 4 ReasoningMicrosoft0.7432025-04-30evidence
Phi 4 Reasoning PlusMicrosoft0.762025-04-30evidence
Phi-3.5-mini-instructMicrosoft0.4742024-08-23evidence
Phi-3.5-MoE-instructMicrosoft0.4532024-08-23evidence
Qwen2 72B InstructQwen0.6442024-07-23evidence
Qwen2 7B InstructQwen0.4412024-07-23evidence
Qwen2.5 14B InstructQwen0.6372024-09-19evidence
Qwen2.5 32B InstructQwen0.692024-09-19evidence
Qwen2.5 72B InstructQwen0.7112024-09-19evidence
Qwen2.5 7B InstructQwen0.5632024-09-19evidence
Qwen2.5 VL 32B InstructQwen0.6882025-02-28evidence
Qwen2.5-Coder 32B InstructQwen0.5042024-09-19evidence
Qwen2.5-Coder 7B InstructQwen0.4012024-09-19evidence
Qwen2.5-Omni-7BQwen0.472025-03-27evidence
Qwen3 235B A22BQwen0.68182025-04-29evidence
Qwen3 VL 235B A22B InstructQwen0.8182025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.8382025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.7782025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.8052025-09-22evidence
Qwen3 VL 32B InstructQwen0.7862025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.8212025-09-22evidence
Qwen3 VL 4B InstructQwen0.6712025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.7362025-09-22evidence
Qwen3 VL 8B InstructQwen0.7162025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.7732025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.832025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.8442025-07-25evidence
Qwen3-Next-80B-A3B-InstructQwen0.8062025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.8272025-09-10evidence
Qwen3.5-0.8BQwen0.4232026-03-02evidence
Qwen3.5-122B-A10BQwen0.8672026-02-24evidence
Qwen3.5-27BQwen0.8612026-02-24evidence
Qwen3.5-2BQwen0.6652026-03-02evidence
Qwen3.5-35B-A3BQwen0.8532026-02-24evidence
Qwen3.5-397B-A17BQwen0.8782026-02-16evidence
Qwen3.5-4BQwen0.7912026-03-02evidence
Qwen3.5-9BQwen0.8252026-03-02evidence
Qwen3.6 PlusQwen0.8852026-04-02evidence
Qwen3.6-27BQwen0.8622026-04-21evidence
Qwen3.6-35B-A3BQwen0.8522026-04-16evidence
Qwen3.7 MaxQwen0.8962026-05-19evidence
Qwen3.7-PlusQwen0.8852026-05-31evidence
Sakana NamazuSakana AI0.90332026-08-03evidence
Sarvam-105BSarvam AI0.8172026-03-06evidence
Sarvam-30BSarvam AI0.82026-03-06evidence
Solar Pro 4Upstage0.8632026-08-06evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.