Benchmark

MMLU

Massive Multitask Language Understanding benchmark testing knowledge across 57 diverse subjects including STEM, humanities, social sciences, and…

Modality
text
Categories
legal, math, reasoning, language, finance, general, healthcare
Openness
unknown
Source
llm_stats
Reported scores
101

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3 HaikuAnthropic0.7522024-03-13evidence
Claude 3 OpusAnthropic0.8682024-02-29evidence
Claude 3 SonnetAnthropic0.792024-02-29evidence
Claude 3.5 SonnetAnthropic0.9042024-06-21evidence
Claude 3.5 SonnetAnthropic0.9042024-10-22evidence
Command R+Cohere0.7572024-08-30evidence
DeepSeek-V2.5DeepSeek0.8042024-05-08evidence
DeepSeek-V3DeepSeek0.8852024-12-25evidence
ERNIE 4.5Baidu0.4192025-06-25evidence
Gemini 1.0 ProGoogle0.7182024-02-15evidence
Gemini 1.5 FlashGoogle0.7892024-05-01evidence
Gemini 1.5 ProGoogle0.8592024-05-01evidence
Gemma 2 27BGoogle0.7522024-06-27evidence
Gemma 2 9BGoogle0.7132024-06-27evidence
Gemma 3n E2B InstructedGoogle0.6012025-06-26evidence
Gemma 3n E2B Instructed LiteRT (Preview)Google0.6012025-05-20evidence
Gemma 3n E4B InstructedGoogle0.6492025-06-26evidence
Gemma 3n E4B Instructed LiteRT PreviewGoogle0.6492025-05-20evidence
GPT OSS 120BOpenAI0.92025-08-05evidence
GPT OSS 20BOpenAI0.8532025-08-05evidence
GPT-3.5 TurboOpenAI0.6982023-03-21evidence
GPT-4OpenAI0.8642023-06-13evidence
GPT-4 TurboOpenAI0.8652024-04-09evidence
GPT-4.1OpenAI0.9022025-04-14evidence
GPT-4.1 miniOpenAI0.8752025-04-14evidence
GPT-4.1 nanoOpenAI0.8012025-04-14evidence
GPT-4.5OpenAI0.9082025-02-27evidence
GPT-4oOpenAI0.8872024-05-13evidence
GPT-4oOpenAI0.8572024-08-06evidence
GPT-4o miniOpenAI0.822024-07-18evidence
GPT-5OpenAI0.9252025-08-07evidence
Granite 3.3 8B BaseIBM0.63892025-04-16evidence
Granite 3.3 8B InstructIBM0.65542025-04-16evidence
Grok-1.5xAI0.8132024-03-28evidence
Grok-2xAI0.8752024-08-13evidence
Grok-2 minixAI0.8622024-08-13evidence
Hermes 3 70BNous Research0.79092024-08-15evidence
IBM Granite 4.0 Tiny PreviewIBM0.6042025-05-02evidence
Jamba 1.5 LargeAI21 Labs0.8122024-08-22evidence
Jamba 1.5 MiniAI21 Labs0.6972024-08-22evidence
Kimi K2 0905Moonshot AI0.9022025-09-05evidence
Kimi K2 BaseMoonshot AI0.8782025-07-11evidence
Kimi K2 InstructMoonshot AI0.8952025-07-11evidence
Kimi K2-Instruct-0905Moonshot AI0.8952025-09-05evidence
Kimi-k1.5Moonshot AI0.8742025-01-20evidence
Llama 3.1 405B InstructMeta0.8732024-07-23evidence
Llama 3.1 70B InstructMeta0.8362024-07-23evidence
Llama 3.1 8B InstructMeta0.6942024-07-23evidence
Llama 3.1 Nemotron 70B InstructNVIDIA0.8022024-10-01evidence
Llama 3.2 11B InstructMeta0.732024-09-25evidence
Llama 3.2 3B InstructMeta0.6342024-09-25evidence
Llama 3.2 90B InstructMeta0.862024-09-25evidence
Llama 3.3 70B InstructMeta0.862024-12-06evidence
Llama 4 MaverickMeta0.8552025-04-05evidence
Llama 4 ScoutMeta0.7962025-04-05evidence
LongCat-Flash-ChatMeituan0.89712025-08-29evidence
LongCat-Flash-LiteMeituan0.85522026-02-05evidence
MiMo-V2.5-ProXiaomi0.8942026-04-27evidence
Ministral 3 (14B Base 2512)Mistral0.7942025-12-04evidence
Ministral 3 (3B Base 2512)Mistral0.7072025-12-04evidence
Ministral 3 (8B Base 2512)Mistral0.7612025-12-04evidence
Ministral 8B InstructMistral0.652024-10-16evidence
Mistral Large 2Mistral0.842024-07-24evidence
Mistral NeMo InstructMistral0.682024-07-18evidence
Mistral Small 3 24B BaseMistral0.80732025-01-30evidence
Mistral Small 3.1 24B BaseMistral0.81012025-03-17evidence
Mistral Small 3.1 24B InstructMistral0.80622025-03-17evidence
Mistral Small 3.2 24B InstructMistral0.8052025-06-20evidence
North Micro Vision InstructCohere0.5042026-08-12evidence
Nova LiteAmazon0.8052024-11-20evidence
Nova MicroAmazon0.7762024-11-20evidence
Nova ProAmazon0.8592024-11-20evidence
o1OpenAI0.9182024-12-17evidence
o1-miniOpenAI0.8522024-09-12evidence
o1-previewOpenAI0.9082024-09-12evidence
o3-miniOpenAI0.8692025-01-30evidence
Phi 4Microsoft0.8482024-12-12evidence
Phi 4 MiniMicrosoft0.6732025-02-01evidence
Phi-3.5-mini-instructMicrosoft0.692024-08-23evidence
Phi-3.5-MoE-instructMicrosoft0.7892024-08-23evidence
Pixtral-12BMistral0.6922024-09-17evidence
Qwen2 72B InstructQwen0.8232024-07-23evidence
Qwen2 7B InstructQwen0.7052024-07-23evidence
Qwen2.5 14B InstructQwen0.7972024-09-19evidence
Qwen2.5 32B InstructQwen0.8332024-09-19evidence
Qwen2.5 VL 32B InstructQwen0.7842025-02-28evidence
Qwen2.5-Coder 32B InstructQwen0.7512024-09-19evidence
Qwen2.5-Coder 7B InstructQwen0.6762024-09-19evidence
Qwen3 235B A22BQwen0.87812025-04-29evidence
Qwen3 VL 235B A22B InstructQwen0.8882025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.9062025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.852025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.8762025-09-22evidence
Qwen3 VL 32B InstructQwen0.8642025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.8872025-09-22evidence
Qwen3 VL 4B InstructQwen0.7722025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.8152025-09-22evidence
Qwen3 VL 8B InstructQwen0.8072025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.8522025-09-22evidence
Sarvam-105BSarvam AI0.9062026-03-06evidence
Sarvam-30BSarvam AI0.8512026-03-06evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.