Benchmark

PolyMATH

Polymath is a challenging multi-modal mathematical reasoning benchmark designed to evaluate the general cognitive reasoning abilities of Multi-modal Large…

Modality
multimodal
Categories
math, multimodal, reasoning, spatial_reasoning, vision
Openness
unknown
Source
llm_stats
Reported scores
23

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Qwen3 VL 30B A3B InstructQwen0.4432025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.5172025-09-22evidence
Qwen3 VL 32B InstructQwen0.4052025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.522025-09-22evidence
Qwen3 VL 4B InstructQwen0.2882025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.4462025-09-22evidence
Qwen3 VL 8B InstructQwen0.3042025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.4752025-09-22evidence
Qwen3-235B-A22B-Instruct-2507Qwen0.5022025-07-22evidence
Qwen3-235B-A22B-Thinking-2507Qwen0.6012025-07-25evidence
Qwen3-Next-80B-A3B-InstructQwen0.4592025-09-10evidence
Qwen3-Next-80B-A3B-ThinkingQwen0.5632025-09-10evidence
Qwen3.5-0.8BQwen0.0822026-03-02evidence
Qwen3.5-122B-A10BQwen0.6892026-02-24evidence
Qwen3.5-27BQwen0.7122026-02-24evidence
Qwen3.5-2BQwen0.2612026-03-02evidence
Qwen3.5-35B-A3BQwen0.6442026-02-24evidence
Qwen3.5-397B-A17BQwen0.7332026-02-16evidence
Qwen3.5-4BQwen0.5112026-03-02evidence
Qwen3.5-9BQwen0.5732026-03-02evidence
Qwen3.6 PlusQwen0.7742026-04-02evidence
Qwen3.7 MaxQwen0.8652026-05-19evidence
Qwen3.7-PlusQwen0.842026-05-31evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.