Benchmark

MVBench

A comprehensive multi-modal video understanding benchmark covering 20 challenging video tasks that require temporal understanding beyond single-frame…

Modality
multimodal
Categories
multimodal, reasoning, spatial_reasoning, video, vision
Openness
unknown
Source
llm_stats
Reported scores
17

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Qwen2-VL-72B-InstructQwen0.7362024-08-29evidence
Qwen2.5 VL 72B InstructQwen0.7042025-01-26evidence
Qwen2.5 VL 7B InstructQwen0.6962025-01-26evidence
Qwen2.5-Omni-7BQwen0.7032025-03-27evidence
Qwen3 VL 30B A3B InstructQwen0.7232025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.722025-09-22evidence
Qwen3 VL 32B InstructQwen0.7282025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.7322025-09-22evidence
Qwen3 VL 4B InstructQwen0.6892025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.6932025-09-22evidence
Qwen3 VL 8B InstructQwen0.6872025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.692025-09-22evidence
Qwen3.5-122B-A10BQwen0.7662026-02-24evidence
Qwen3.5-27BQwen0.7462026-02-24evidence
Qwen3.5-35B-A3BQwen0.7482026-02-24evidence
Qwen3.6-27BQwen0.7552026-04-21evidence
Qwen3.6-35B-A3BQwen0.7462026-04-16evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.