Benchmark

ScreenSpot Pro

ScreenSpot-Pro is a novel GUI grounding benchmark designed to rigorously evaluate the grounding capabilities of multimodal large language models (MLLMs)…

Modality
multimodal
Categories
multimodal, spatial_reasoning, grounding, vision
Openness
unknown
Source
llm_stats
Reported scores
25

Reported scores

llm_stats

ModelOrganizationReported valueReportedEvidence
Claude Opus 4.8Anthropic0.8792026-05-28evidence
Gemini 3 FlashGoogle0.6912025-12-17evidence
Gemini 3 ProGoogle0.7272025-11-18evidence
GPT-5.2OpenAI0.8632025-12-11evidence
Muse Glimmer-30BMeta0.7542026-08-10evidence
Muse SparkMeta0.8412026-04-08evidence
Qwen2.5 VL 32B InstructQwen0.3942025-02-28evidence
Qwen2.5 VL 72B InstructQwen0.4362025-01-26evidence
Qwen2.5 VL 7B InstructQwen0.292025-01-26evidence
Qwen3 VL 235B A22B InstructQwen0.622025-09-22evidence
Qwen3 VL 235B A22B ThinkingQwen0.6182025-09-22evidence
Qwen3 VL 30B A3B InstructQwen0.6052025-09-22evidence
Qwen3 VL 30B A3B ThinkingQwen0.5732025-09-22evidence
Qwen3 VL 32B InstructQwen0.5792025-09-22evidence
Qwen3 VL 32B ThinkingQwen0.5712025-09-22evidence
Qwen3 VL 4B InstructQwen0.5952025-09-22evidence
Qwen3 VL 4B ThinkingQwen0.4922025-09-22evidence
Qwen3 VL 8B InstructQwen0.5462025-09-22evidence
Qwen3 VL 8B ThinkingQwen0.4662025-09-22evidence
Qwen3.5-122B-A10BQwen0.7042026-02-24evidence
Qwen3.5-27BQwen0.7032026-02-24evidence
Qwen3.5-35B-A3BQwen0.6862026-02-24evidence
Qwen3.6 PlusQwen0.6822026-04-02evidence
Qwen3.7-PlusQwen0.792026-05-31evidence
Qwen3.8 MaxQwen0.8452026-08-02evidence

Scores are partitioned by the source that reported them and are never merged into a single cross-source ranking, because the sources measure different things and say so.