Benchmark

MMMLU

Multilingual Massive Multitask Language Understanding dataset released by OpenAI, featuring professionally translated MMLU test questions across 14…

Modality
text
Categories
math, reasoning, language, general
Openness
unknown
Source
llm_stats
Reported scores
49

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3.7 SonnetAnthropic0.8612025-02-24evidence
Claude Haiku 4.5Anthropic0.832025-10-15evidence
Claude Mythos PreviewAnthropic0.9272026-04-07evidence
Claude Opus 4Anthropic0.8882025-05-22evidence
Claude Opus 4.1Anthropic0.8952025-08-05evidence
Claude Opus 4.5Anthropic0.9082025-11-24evidence
Claude Opus 4.6Anthropic0.9112026-02-05evidence
Claude Opus 4.7Anthropic0.9152026-04-16evidence
Claude Sonnet 4Anthropic0.8652025-05-22evidence
Claude Sonnet 4.5Anthropic0.8912025-09-29evidence
Claude Sonnet 4.6Anthropic0.8932026-02-17evidence
DiffusionGemma 26B-A4BGoogle0.8152026-06-10evidence
Gemini 3 FlashGoogle0.9182025-12-17evidence
Gemini 3 ProGoogle0.9182025-11-18evidence
Gemini 3.1 Flash-LiteGoogle0.8892026-03-03evidence
Gemini 3.1 ProGoogle0.9262026-02-19evidence
Gemma 4 12BGoogle0.8342026-05-23evidence
Gemma 4 26B-A4BGoogle0.8632026-04-02evidence
Gemma 4 31BGoogle0.8842026-04-02evidence
Gemma 4 E2BGoogle0.6742026-04-02evidence
Gemma 4 E4BGoogle0.7662026-04-02evidence
GPT OSS 120B HighOpenAI0.8382025-08-05evidence
GPT-4.1OpenAI0.8732025-04-14evidence
GPT-4.1 miniOpenAI0.7852025-04-14evidence
GPT-4.1 nanoOpenAI0.6692025-04-14evidence
GPT-4.5OpenAI0.8512025-02-27evidence
GPT-4oOpenAI0.8142024-08-06evidence
GPT-5.2OpenAI0.8962025-12-11evidence
K-EXAONE-236B-A23BLG AI Research0.8572025-12-31evidence
Mistral Large 3Mistral0.7422025-09-01evidence
Mistral Large 3 (675B Base)Mistral0.8552025-12-04evidence
Mistral Large 3 (675B Instruct 2512 Eagle)Mistral0.8552025-12-04evidence
Mistral Large 3 (675B Instruct 2512 NVFP4)Mistral0.8552025-12-04evidence
Mistral Large 3 (675B Instruct 2512)Mistral0.8552025-12-04evidence
o1OpenAI0.8772024-12-17evidence
Phi-3.5-mini-instructMicrosoft0.5542024-08-23evidence
Phi-3.5-MoE-instructMicrosoft0.6992024-08-23evidence
Qwen3 235B A22BQwen0.8672025-04-29evidence
Qwen3.5-0.8BQwen0.4432026-03-02evidence
Qwen3.5-122B-A10BQwen0.8672026-02-24evidence
Qwen3.5-27BQwen0.8592026-02-24evidence
Qwen3.5-2BQwen0.6312026-03-02evidence
Qwen3.5-35B-A3BQwen0.8522026-02-24evidence
Qwen3.5-397B-A17BQwen0.8852026-02-16evidence
Qwen3.5-4BQwen0.7612026-03-02evidence
Qwen3.5-9BQwen0.8122026-03-02evidence
Qwen3.6 PlusQwen0.8952026-04-02evidence
Qwen3.7 MaxQwen0.9032026-05-19evidence
Qwen3.7-PlusQwen0.892026-05-31evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.