Benchmark

MMMU-Pro

A more robust multi-discipline multimodal understanding benchmark that enhances MMMU through a three-step process: filtering text-only answerable…

Modality
multimodal
Categories
multimodal, reasoning, general, vision
Openness
unknown
Source
llm_stats
Reported scores
68

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude Opus 4.6Anthropic0.7732026-02-05evidence
Claude Sonnet 4.6Anthropic0.7562026-02-17evidence
Command A+Cohere0.632026-05-20evidence
DiffusionGemma 26B-A4BGoogle0.5432026-06-10evidence
Gemini 3 FlashGoogle0.8122025-12-17evidence
Gemini 3 ProGoogle0.812025-11-18evidence
Gemini 3.1 Flash-LiteGoogle0.7682026-03-03evidence
Gemini 3.1 ProGoogle0.8052026-02-19evidence
Gemini 3.5 FlashGoogle0.8362026-05-19evidence
Gemma 4 12BGoogle0.6912026-05-23evidence
Gemma 4 26B-A4BGoogle0.7382026-04-02evidence
Gemma 4 31BGoogle0.7692026-04-02evidence
Gemma 4 E2BGoogle0.4422026-04-02evidence
Gemma 4 E4BGoogle0.5262026-04-02evidence
GPT-4oOpenAI0.5992024-08-06evidence
GPT-5OpenAI0.7842025-08-07evidence
GPT-5.2OpenAI0.7952025-12-11evidence
GPT-5.4OpenAI0.8122026-03-05evidence
GPT-5.4 miniOpenAI0.7662026-03-17evidence
GPT-5.4 nanoOpenAI0.6612026-03-17evidence
GPT-5.5OpenAI0.8322026-04-23evidence
GPT-5.5 InstantOpenAI0.762026-05-05evidence
GPT-5.6 LunaOpenAI0.7842026-07-09evidence
GPT-5.6 SolOpenAI0.832026-07-09evidence
GPT-5.6 TerraOpenAI0.8072026-07-09evidence
Inkling-SmallThinking Machines Lab0.742026-07-30evidence
Kimi K2.5Moonshot AI0.7852026-01-27evidence
Kimi K2.6Moonshot AI0.8012026-04-20evidence
Kimi K3Moonshot AI0.8162026-07-16evidence
LFM2.5-VL-3BLiquid AI0.3052026-08-12evidence
Llama 3.2 11B InstructMeta0.332024-09-25evidence
Llama 3.2 90B InstructMeta0.4522024-09-25evidence
Llama 4 MaverickMeta0.5962025-04-05evidence
MiMo-V2.5Xiaomi0.7792026-04-22evidence
MiniMax M3MiniMax0.7812026-06-01evidence
Mistral Small 4Mistral0.62026-03-16evidence
Muse Glimmer-30BMeta0.742026-08-10evidence
Muse SparkMeta0.8042026-04-08evidence
Nova 2 LiteAmazon0.6182025-12-02evidence
Nova 2 OmniAmazon0.6142025-12-02evidence
Nova 2 ProAmazon0.6352025-12-02evidence
o3OpenAI0.7642025-04-16evidence
Phi-4-multimodal-instructMicrosoft0.3852025-02-01evidence
Qwen2-VL-72B-InstructQwen0.4622024-08-29evidence
Qwen2.5 VL 32B InstructQwen0.4952025-02-28evidence
Qwen2.5 VL 72B InstructQwen0.5112025-01-26evidence
Qwen2.5 VL 7B InstructQwen0.3832025-01-26evidence
Qwen2.5-Omni-7BQwen0.3662025-03-27evidence
Qwen3 VL 235B A22B InstructQwen0.6812025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.6932025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.6042025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.632025-09-22evidence
Qwen3 VL 32B InstructQwen0.6532025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.6812025-09-22evidence
Qwen3 VL 4B InstructQwen0.5322025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.572025-09-22evidence
Qwen3 VL 8B InstructQwen0.5592025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.6042025-09-22evidence
Qwen3.5-122B-A10BQwen0.7692026-02-24evidence
Qwen3.5-27BQwen0.752026-02-24evidence
Qwen3.5-35B-A3BQwen0.7512026-02-24evidence
Qwen3.6 PlusQwen0.7882026-04-02evidence
Qwen3.6-27BQwen0.7582026-04-21evidence
Qwen3.6-35B-A3BQwen0.7532026-04-16evidence
Qwen3.7-PlusQwen0.792026-05-31evidence
Qwen3.8 MaxQwen0.8232026-08-02evidence
Seed 2.1 ProByteDance0.8272026-06-24evidence
Seed 2.1 TurboByteDance0.8222026-06-24evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.