Benchmark

MathVista-Mini

MathVista-Mini is a smaller version of the MathVista benchmark that evaluates mathematical reasoning in visual contexts. It consists of examples derived…

Modality
multimodal
Categories
math, multimodal, vision
Openness
unknown
Source
llm_stats
Reported scores
24

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Gemma 3 12BGoogle0.6292025-03-12evidence
Gemma 3 27BGoogle0.6762025-03-12evidence
Gemma 3 4BGoogle0.52025-03-12evidence
Kimi K2.5Moonshot AI0.9012026-01-27evidence
LFM2.5-VL-3BLiquid AI0.6852026-08-12evidence
Qwen2-VL-72B-InstructQwen0.7052024-08-29evidence
Qwen2.5 VL 32B InstructQwen0.7472025-02-28evidence
Qwen2.5 VL 72B InstructQwen0.7482025-01-26evidence
Qwen2.5 VL 7B InstructQwen0.6822025-01-26evidence
Qwen3 VL 235B A22B InstructQwen0.8492025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.8582025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.8012025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.8192025-09-22evidence
Qwen3 VL 32B InstructQwen0.8382025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.8592025-09-22evidence
Qwen3 VL 4B InstructQwen0.7372025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.7952025-09-22evidence
Qwen3 VL 8B InstructQwen0.7722025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.8142025-09-22evidence
Qwen3.5-122B-A10BQwen0.8742026-02-24evidence
Qwen3.5-27BQwen0.8782026-02-24evidence
Qwen3.5-35B-A3BQwen0.8622026-02-24evidence
Qwen3.6-27BQwen0.8742026-04-21evidence
Qwen3.6-35B-A3BQwen0.8642026-04-16evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.