Benchmark

VideoMMMU

Video-MMMU evaluates Large Multimodal Models' ability to acquire knowledge from expert-level professional videos across six disciplines through three…

Modality
multimodal
Categories
multimodal, reasoning, healthcare, vision
Openness
unknown
Source
llm_stats
Reported scores
26

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Gemini 2.5 Pro Preview 06-05Google0.8362025-06-05evidence
Gemini 3 FlashGoogle0.8692025-12-17evidence
Gemini 3 ProGoogle0.8762025-11-18evidence
Gemini 3.1 Flash-LiteGoogle0.8482026-03-03evidence
GPT-4oOpenAI0.6122024-08-06evidence
GPT-5OpenAI0.8462025-08-07evidence
GPT-5.2OpenAI0.8592025-12-11evidence
Kimi K2.5Moonshot AI0.8662026-01-27evidence
MiniMax M3MiniMax0.8462026-06-01evidence
o3OpenAI0.8332025-04-16evidence
Qwen3 VL 235B A22B InstructQwen0.7472025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.82025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.6872025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.752025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.792025-09-22evidence
Qwen3 VL 4B InstructQwen0.5622025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.6942025-09-22evidence
Qwen3 VL 8B InstructQwen0.6532025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.7282025-09-22evidence
Qwen3.5-122B-A10BQwen0.822026-02-24evidence
Qwen3.5-27BQwen0.8232026-02-24evidence
Qwen3.5-35B-A3BQwen0.8042026-02-24evidence
Qwen3.6 PlusQwen0.842026-04-02evidence
Qwen3.6-27BQwen0.8442026-04-21evidence
Qwen3.6-35B-A3BQwen0.8372026-04-16evidence
Qwen3.7-PlusQwen0.8542026-05-31evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.