Benchmark

MMBench-V1.1

Version 1.1 of MMBench, an improved bilingual benchmark for assessing multi-modal capabilities of vision-language models through multiple-choice questions…

Modality
multimodal
Categories
multimodal, reasoning, vision
Openness
unknown
Source
llm_stats
Reported scores
20

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
DeepSeek VL2DeepSeek0.7922024-12-13evidence
DeepSeek VL2 SmallDeepSeek0.7932024-12-13evidence
DeepSeek VL2 TinyDeepSeek0.6832024-12-13evidence
LFM2.5-VL-3BLiquid AI0.812026-08-12evidence
North Micro Vision InstructCohere0.6872026-08-12evidence
Qwen2.5-Omni-7BQwen0.8182025-03-27evidence
Qwen3 VL 235B A22B InstructQwen0.8992025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.9062025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.872025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.8892025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.9082025-09-22evidence
Qwen3 VL 4B InstructQwen0.8512025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.8672025-09-22evidence
Qwen3 VL 8B InstructQwen0.852025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.8752025-09-22evidence
Qwen3.5-122B-A10BQwen0.9282026-02-24evidence
Qwen3.5-27BQwen0.9262026-02-24evidence
Qwen3.5-35B-A3BQwen0.9152026-02-24evidence
Qwen3.6-27BQwen0.9232026-04-21evidence
Qwen3.6-35B-A3BQwen0.9282026-04-16evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.