Benchmark

MMMU

MMMU (Massive Multi-discipline Multimodal Understanding) is a benchmark designed to evaluate multimodal models on college-level subject knowledge and…

Released
2023-11-27
Modality
multimodal
Categories
multimodal, reasoning, general, healthcare, vision
Openness
open
Source
llm_stats
Reported scores
63

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude 3.5 SonnetAnthropic0.6832024-10-22evidence
Claude 3.7 SonnetAnthropic0.752025-02-24evidence
Claude Sonnet 4Anthropic0.7442025-05-22evidence
Command A+Cohere0.7512026-05-20evidence
DeepSeek VL2DeepSeek0.5112024-12-13evidence
DeepSeek VL2 SmallDeepSeek0.482024-12-13evidence
DeepSeek VL2 TinyDeepSeek0.4072024-12-13evidence
Gemini 1.0 ProGoogle0.4792024-02-15evidence
Gemini 1.5 FlashGoogle0.6232024-05-01evidence
Gemini 1.5 Flash 8BGoogle0.5372024-03-15evidence
Gemini 1.5 ProGoogle0.6592024-05-01evidence
Gemini 2.0 FlashGoogle0.7072024-12-01evidence
Gemini 2.0 Flash ThinkingGoogle0.7542025-01-21evidence
Gemini 2.0 Flash-LiteGoogle0.682025-02-05evidence
Gemini 2.5 FlashGoogle0.7972025-05-20evidence
Gemini 2.5 Flash-LiteGoogle0.7292025-06-17evidence
Gemini 2.5 ProGoogle0.7962025-05-20evidence
Gemini 2.5 Pro Preview 06-05Google0.822025-06-05evidence
GPT-3.5 TurboOpenAI0.02023-03-21evidence
GPT-4.1OpenAI0.7482025-04-14evidence
GPT-4.1 miniOpenAI0.7272025-04-14evidence
GPT-4.1 nanoOpenAI0.5542025-04-14evidence
GPT-4.5OpenAI0.7522025-02-27evidence
GPT-4oOpenAI0.7222024-08-06evidence
GPT-4o miniOpenAI0.5942024-07-18evidence
GPT-5OpenAI0.8422025-08-07evidence
GPT-5.1OpenAI0.8542025-11-13evidence
GPT-5.1 InstantOpenAI0.8542025-11-12evidence
GPT-5.1 ThinkingOpenAI0.8542025-11-12evidence
Grok-1.5xAI0.5362024-03-28evidence
Grok-1.5VxAI0.5362024-04-12evidence
Grok-2xAI0.6612024-08-13evidence
Grok-2 minixAI0.6322024-08-13evidence
Grok-3xAI0.782025-02-17evidence
Kimi-k1.5Moonshot AI0.72025-01-20evidence
Llama 3.2 11B InstructMeta0.5072024-09-25evidence
Llama 3.2 90B InstructMeta0.6032024-09-25evidence
Llama 4 MaverickMeta0.7342025-04-05evidence
Llama 4 ScoutMeta0.6942025-04-05evidence
Mistral Small 3.1 24B BaseMistral0.59272025-03-17evidence
Mistral Small 3.1 24B InstructMistral0.59272025-03-17evidence
Mistral Small 3.2 24B InstructMistral0.6252025-06-20evidence
Nova LiteAmazon0.5622024-11-20evidence
Nova ProAmazon0.6172024-11-20evidence
o1OpenAI0.7762024-12-17evidence
o3OpenAI0.8292025-04-16evidence
o4-miniOpenAI0.8162025-04-16evidence
Phi-3.5-vision-instructMicrosoft0.432024-08-23evidence
Phi-4-multimodal-instructMicrosoft0.5512025-02-01evidence
Pixtral LargeMistral0.642024-11-18evidence
Pixtral-12BMistral0.5252024-09-17evidence
QvQ-72B-PreviewQwen0.7032024-12-25evidence
Qwen2.5 VL 32B InstructQwen0.72025-02-28evidence
Qwen2.5 VL 72B InstructQwen0.7022025-01-26evidence
Qwen2.5 VL 7B InstructQwen0.5862025-01-26evidence
Qwen2.5-Omni-7BQwen0.5922025-03-27evidence
Qwen3.5-122B-A10BQwen0.8392026-02-24evidence
Qwen3.5-27BQwen0.8232026-02-24evidence
Qwen3.5-35B-A3BQwen0.8142026-02-24evidence
Qwen3.6 PlusQwen0.862026-04-02evidence
Qwen3.6-27BQwen0.8292026-04-21evidence
Qwen3.6-35B-A3BQwen0.8172026-04-16evidence
Step3-VL-10BStepFun0.7812026-01-15evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.