Benchmark

MMMLU

A language-count average. Two cards reporting "MMMLU" may be averaging over different language sets, so the counts must match to compare.

Released
2024-09-24
Categories
multilingual
Openness
unknown
Source
model_reports
Reported scores
5

Reported scores

model_reports

ModelOrganizationReported valueReportedEvidence
Claude Opus 4Anthropic88.82025-05-22evidence
Claude Sonnet 4Anthropic86.52025-05-22evidence
Gemini 3.1 ProGoogle92.62026-02-19evidence
Gemma 4 (31B)Google88.42026-03-11evidence
Qwen3.5-397B-A17BQwen88.52026-02-16evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.